Docs of Jace-Lab
Ai

Ollama

Qwen 3.6을 로컬에서 LLM 에이전트로 활용하기 (Mac)

최근 출시된 Qwen 3.6은 코딩 성능과 논리 추론 면에서 매우 뛰어난 평가를 받고 있어, 로컬 에이전트로 활용하기에 탁월한 선택입니다. Mac 환경에서 Native Ollama를 기반으로 OpenCode(VSCodium 등)Neovim에 연동하는 과정을 단계별로 정리해 드립니다.


1단계: Ollama에 Qwen 3.6 설치

먼저 엔진이 되는 Ollama에 모델을 내려받습니다.

  1. Ollama 실행: Mac 메뉴바에 Ollama 아이콘이 떠 있는지 확인합니다.
  2. 모델 다운로드: 터미널에서 다음 명령어를 입력합니다.
    # 메인 추론 및 채팅용 (지능 중심)
    # ollama pull qwen3.6:7b  # 또는 사양에 따라 14b, 32b 선택
    ollama pull qwen3.6:35b-a3b-q4_K_M # Q4
    ollama pull qwen3.6:27b-coding-mxfp8 # coding
    ollama pull qwen3.6:7b-instruct-q8_0 # Q8
    # 실시간 코드 자동 완성용 (속도 중심)
    # ollama pull qwen3.6:1.5b

2단계: OpenCode (또는 VSCodium) 연동

오픈소스 기반 IDE에서 Qwen 3.6을 에이전트로 쓰기 위해 Continue 확장 프로그램을 사용합니다.

  1. 확장 프로그램 설치: OpenCode 내 마켓플레이스에서 Continue를 검색하여 설치합니다.
  2. 설정 편집: 사이드바의 Continue 아이콘 클릭 후 하단 **톱니바퀴(Settings)**를 눌러 config.json을 엽니다.
  3. 모델 등록: 아래 내용을 modelstabAutocompleteModel 섹션에 각각 추가합니다.
{
  "models": [
    {
      "title": "Qwen 3.6 (Chat)",
      "provider": "ollama",
      "model": "qwen3.6:7b"
    }
  ],
  "tabAutocompleteModel": {
    "title": "Qwen 3.6 (Auto)",
    "provider": "ollama",
    "model": "qwen3.6:1.5b"
  }
}
  • 활용: 코드를 선택하고 Cmd + I를 눌러 "이 로직을 최적화해줘"라고 명령하거나, 타이핑 시 자동 완성을 경험할 수 있습니다.

3단계: Neovim 연동 (CLI 에이전트 환경)

Neovim 유저에게 가장 추천하는 조합은 **gen.nvim**을 이용한 채팅 및 코드 생성 환경입니다.

1. 플러그인 설치 (lazy.nvim 기준)

lua/plugins/ai.lua 파일에 다음 설정을 추가합니다.

return {
  "davidmh/gen.nvim",
  opts = {
    model = "qwen3.6:7b", -- 기본 모델을 Qwen 3.6으로 설정
    display_mode = "float", -- 결과창을 플로팅 윈도우로 설정
    show_model = true,
  }
}

2. 커스텀 단축키 설정

init.lua 또는 keymaps.lua에 에이전트 호출 단축키를 지정합니다.

-- 비주얼 모드에서 선택한 코드를 Qwen 3.6에게 전달
vim.keymap.set({'n', 'v'}, '<leader>aq', ':Gen Chat<CR>', { desc = "Qwen 3.6 에이전트" })
-- 코드 리뷰 및 수정 요청
vim.keymap.set('v', '<leader>ar', ':Gen Review_Code<CR>', { desc = "코드 리뷰" })

4단계: 전체 워크플로우 종합 및 활용

이제 모든 준비가 끝났습니다. 실제 개발 시 다음과 같은 흐름으로 활용하세요.

  1. 엔진 구동: Mac 시작 시 Ollama가 자동 실행되므로 별도의 설정 없이 바로 API를 사용할 수 있습니다. (Native Metal 가속 적용)
  2. OpenCode 작업: 복잡한 리팩토링이나 새로운 파일 구조 설계 시 @codebase 기능을 활용해 프로젝트 전체 맥락을 Qwen 3.6에게 전달합니다.
  3. Neovim 작업: 터미널 환경에서 가볍게 코딩할 때 단축키 한 번으로 현재 작성 중인 함수의 버그를 찾거나 단위 테스트를 자동 생성합니다.

💡 팁: 성능 최적화

  • 시스템 프롬프트 활용: Qwen 3.6은 지시 이행 능력이 매우 좋습니다. Neovim의 gen.nvim이나 OpenCode의 Continue 설정에서 "너는 10년 차 풀스택 개발자야. 간결하고 성능 중심적인 코드를 작성해"와 같이 역할을 부여하면 응답의 질이 확연히 좋아집니다.
  • 메모리 관리: 만약 8GB RAM의 Mac을 사용 중이라면 7B 모델을, 16GB 이상이라면 14B나 32B 모델을 시도해 보세요.

이제 로컬에 설치된 Qwen 3.6 에이전트와 함께 효율적인 개발을 시작해 보세요! 추가로 궁금한 설정이 있으신가요?




Docker Desktop에서 Ollama 실행

1. 모델 다운로드 (터미널)

먼저 로컬 PC에 LLM 모델을 다운로드해야 합니다. 터미널에서 아래 명령어를 실행하여 qwen3-vl:8b 모델을 다운로드하세요.

ollama pull qwen3-vl:8b

참고: 처음 실행 시 Docker Desktop이 설치되어 있지 않다면 설치가 필요할 수 있습니다. (Ollama 공식 문서 확인)

2. Docker Compose 설정

다음 내용을 docker-compose.yml 파일로 저장하세요:

services:
  ollama:
    image: ollama/ollama
    container_name: ollama
    ports:
      - "11434:11434"
    volumes:
      - ollama-data:/root/.ollama

volumes:
  ollama-data:

3. 실행

docker compose up -d

이제 http://localhost:11434 주소로 Ollama API에 접근할 수 있습니다. (실제 테스트는 curl http://localhost:11434/api/generate 등으로 확인 가능)

Docker Container에서 실행


2026년 4월 2일 출시된 Gemma 4는 이전 버전들보다 훨씬 강력한 멀티모달 기능(텍스트, 이미지, 비디오, 오디오 지원)과 함께 Apache 2.0 라이선스로 공개되어 진정한 '나만의 AI'를 구축하기에 최적입니다.

Docker를 활용해 Gemma 4를 로컬 환경에서 가장 효율적으로 구동하는 방법은 Ollama를 사용하는 것입니다.


1. 하드웨어 요구사항 확인

Gemma 4는 모델 크기에 따라 필요한 메모리가 다릅니다. 본인의 사양에 맞는 모델을 선택하세요.

모델명파라미터권장 RAM (4-bit 양자화 기준)특징
Gemma-4-E2B2.3B5GB 이상가볍고 빠름, 오디오/비디오 지원
Gemma-4-E4B4.5B9GB 이상균형 잡힌 성능, 이미지 인식 탁월
Gemma-4-26B26B (MoE)18GB 이상전문가 혼합 모델, 높은 효율성
Gemma-4-31B31B (Dense)20GB ~ 34GB 이상가장 강력한 성능, 복잡한 추론 가능

2. Docker를 이용한 설치 및 실행 (Ollama)

Ollama는 Docker 상에서 LLM을 구동하는 가장 표준적이고 쉬운 방법입니다. GPU 가속을 위해 NVIDIA Container Toolkit이 설치되어 있어야 합니다.

Step 1: Docker 컨테이너 실행

터미널에서 아래 명령어를 입력하여 Ollama 컨테이너를 실행합니다.

# NVIDIA GPU를 사용하는 경우
docker run -d --gpus=all -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama

Step 2: Gemma 4 모델 불러오기

컨테이너 내에서 Gemma 4 모델을 다운로드하고 실행합니다. (E4B 모델 예시)

docker exec -it ollama ollama run gemma4:e4b

3. 나만의 AI로 활용하기 (Web UI 연결)

터미널 환경이 불편하다면, Open WebUI를 추가로 띄워 챗GPT와 같은 인터페이스를 구축할 수 있습니다.

docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui ghcr.io/open-webui/open-webui:main

이제 웹 브라우저에서 http://localhost:3000에 접속하면, 방금 설치한 Gemma 4와 대화하거나 이미지를 분석(멀티모달)할 수 있습니다.


💡 팁: 성능 최적화

  • 멀티모달 활용: Gemma 4는 이미지와 오디오를 인식합니다. Open WebUI 창에 이미지 파일을 드래그 앤 드롭하여 질문해 보세요.
  • 라이선스 혜택: Gemma 4는 Apache 2.0 라이선스이므로, 이를 활용해 만든 서비스를 상업적으로 이용하거나 소스 코드를 자유롭게 수정할 수 있습니다.
  • 속도가 느리다면: 모델 이름 뒤에 :q4_K_M 같은 태그를 붙여 더 낮은 비트의 양자화 버전을 사용하면 속도가 빨라집니다 (예: ollama run gemma4:e4b-q4_K_M).

Gemma 4 로컬 실행 가이드 이 영상은 Gemma 4의 출시 소식과 함께 로컬 환경에서 멀티모달 기능을 어떻게 활용할 수 있는지 상세히 설명해 줍니다.

On this page