Qwen 로컬 실행 가이드: 내 PC 사양별 모델 선택과 설치 방법

Qwen 로컬 실행, 실제로 가능합니다. 모델 파일을 한 번 내려받으면 인터넷도, 유료 API도 필요 없습니다. Qwen3 시리즈는 Apache-2.0 라이선스로 공개되어 있고, Ollama나 LM Studio 같은 도구로 개인 PC에서 바로 추론할 수 있습니다.

다만 “돌릴 수 있다”와 “쓸 만하게 돌아간다”는 다른 이야기입니다. 모델 크기, 내 PC의 VRAM과 RAM, 양자화 방식에 따라 체감 속도가 크게 달라집니다. 이 글에서는 어떤 모델을 골라야 하고, 실제로 어떻게 설치하는지, 그리고 내 사양에서 현실적으로 어디까지 되는지를 정리합니다.

Qwen 로컬 실행이란

클라우드 API를 호출하는 방식과 달리, 로컬 실행은 모델 가중치 파일을 내 컴퓨터에 내려받고 내 GPU나 CPU로 직접 계산하는 것입니다. 한 번 Qwen 다운로드가 끝나면 오프라인에서도 동작합니다.

최초 설치할 때만 인터넷이 필요합니다. 앱 설치와 모델 다운로드가 끝나면 네트워크를 꺼도 됩니다. LM Studio는 이 점을 공식 문서에서 명시하고 있습니다.

어떤 사양이 필요한가

가장 중요한 건 VRAM(GPU 메모리)과 시스템 RAM입니다. 모델 파일 전체를 메모리에 올려야 하기 때문입니다. MoE 구조인 30B-A3B도 활성 파라미터는 3B이지만, 전체 30B의 가중치를 메모리에 적재해야 합니다.

실제 필요 메모리는 GGUF 파일 크기에 KV 캐시와 실행 오버헤드를 더한 값입니다. 아래는 가장 많이 쓰는 Q4_K_M 양자화 기준 권장치입니다.

모델GGUF 파일 크기GPU 권장 VRAMCPU 실행 권장 RAM
Qwen3-0.6B0.5GB2GB 이상8GB 이상
Qwen3-1.7B1.3GB3GB 이상8GB 이상
Qwen3-4B2.5GB6GB 이상12~16GB
Qwen3-8B5.0GB8GB 이상16GB 이상
Qwen3-14B9.0GB12GB 이상16~24GB
Qwen3-30B-A3B18.6GB24GB 이상32GB 이상
Qwen3-32B19.8GB24GB 이상32GB 이상

235B-A22B는 Q4_K_M으로도 142GB라 일반 PC의 선택지가 아닙니다. 표에서 뺐습니다.

문맥 길이를 늘리면 KV 캐시도 커집니다. 4K 토큰 기준으로 0.4~1.5GB이던 것이 32K 토큰에서는 3.5~12GB까지 올라갑니다. “128K 지원”은 스펙상 가능하다는 뜻이지, 소비자 GPU에서 여유 있게 쓸 수 있다는 뜻이 아닙니다.

어떤 모델을 골라야 하나

Qwen3 텍스트 모델은 0.6B부터 235B까지 8종입니다. 양자화는 Q4_K_M이 용량과 품질 균형의 첫 선택입니다. Q8_0은 품질 손실이 적지만 메모리가 약 1.7배 필요합니다.

내 사양별로 현실적인 선택을 정리하면 이렇습니다.

  • 8GB VRAM 또는 16GB RAM: Qwen3-4B Q4_K_M. 가벼운 작업은 1.7B나 0.6B
  • 12GB VRAM 또는 16~24GB RAM: Qwen3-8B Q4_K_M
  • 16GB VRAM: Qwen3-14B Q4_K_M. 단, 문맥을 짧게 잡아야 하고 24GB가 더 안정적
  • 24GB VRAM 또는 32GB RAM: Qwen3-30B-A3B 또는 32B Q4_K_M

30B-A3B는 MoE 구조라 계산 시 활성 파라미터가 3B뿐입니다. 같은 메모리를 쓰는 32B보다 추론 속도에서 이점이 있을 수 있지만, 18.6GB의 가중치를 통째로 올려야 하는 건 같습니다.

Qwen 로컬 설치: Ollama와 LM Studio

비개발자가 Qwen을 로컬에 설치하는 가장 현실적인 방법은 Ollama와 LM Studio 두 가지입니다. Qwen 공식 저장소에서도 이 둘을 안내합니다.

Ollama: 터미널 한 줄이면 끝

Ollama는 명령어 기반입니다. 설치가 빠르고 가볍습니다.

  1. ollama.com/download에서 운영체제에 맞는 설치 파일을 받습니다.
  2. 터미널을 열고 원하는 모델을 실행합니다.

bash ollama run qwen3:8b

이 한 줄이면 모델 다운로드와 실행이 동시에 진행됩니다. 기본 양자화는 Q4_K_M이고, qwen3:8b 기준 약 5.2GB를 내려받습니다. 더 작은 모델을 원하면 qwen3:4b(2.5GB), 더 큰 모델을 원하면 qwen3:14b(9.3GB)나 qwen3:30b(19GB)로 바꾸면 됩니다.

LM Studio: GUI로 편하게

터미널이 익숙하지 않다면 LM Studio가 낫습니다. 채팅 앱처럼 생긴 인터페이스에서 모델 검색, 다운로드, 실행까지 전부 처리됩니다.

  1. lmstudio.ai/download에서 앱을 설치합니다.
  2. Discover 탭에서 Qwen3을 검색합니다.
  3. 원하는 양자화(Q4_K_M 권장)를 골라 다운로드합니다.
  4. Chat 탭에서 모델을 로드하고 채팅을 시작합니다.

LM Studio는 16GB 이상 RAM을 권장하며, 8GB 환경에서는 작은 모델과 짧은 컨텍스트를 쓰라고 안내합니다.

실제 사용해보니: 4060 Laptop + 36GB RAM

직접 LM Studio에서 Qwen3.6 35B-A3B GGUF(Q4_K_M, 19.71GB)를 게이밍 노트북에 올려봤습니다. 사양은 RTX 4060 Laptop GPU에 시스템 RAM 36GB였습니다.

Qwen 로컬 실행 화면 캡처

스크린샷을 보면 메모리 사용량이 14.59GB / 47GB로 표시되어 있고, 컨텍스트는 8192로 설정된 상태입니다. 모델 로딩은 75% 진행 중이었습니다.

결론부터 말하면, 꽤 느렸습니다. RTX 4060 Laptop의 VRAM은 8GB입니다. 19.71GB짜리 모델을 8GB VRAM에 다 올릴 수 없으니 나머지는 시스템 RAM으로 넘어가고, 그만큼 추론 속도가 떨어집니다. 돌아가긴 하지만 “최적 속도”라고 부르기는 어려운 수준이었습니다.

이 경험에서 알 수 있는 건, VRAM에 모델이 전부 올라가지 않으면 속도가 확 떨어진다는 점입니다. 8GB VRAM 환경이라면 8B 이하 모델이 현실적인 선택입니다.

내 PC에 맞는 구성 추천

내 환경추천 모델예상 체감
8GB VRAM, 16GB RAMQwen3-4B Q4_K_M빠른 응답, 가벼운 작업에 적합
8GB VRAM, 32GB+ RAMQwen3-8B Q4_K_M무난한 품질, 적당한 속도
12GB VRAMQwen3-8B Q4_K_MVRAM에 전부 올라가서 쾌적
16GB VRAMQwen3-14B Q4_K_M짧은 문맥 기준, 여유 있게 쓰려면 24GB
24GB VRAMQwen3-32B 또는 30B-A3B고품질 추론 가능

처음 시작한다면 Ollama + Qwen3-8B가 가장 무난합니다. 명령어 한 줄로 5분 안에 시작할 수 있고, 대부분의 16GB RAM PC에서 돌아갑니다. GUI가 편하다면 LM Studio로 같은 모델을 받으면 됩니다.

모델 크기는 나중에 바꿀 수 있으니, 일단 작은 것부터 시작하고 내 PC에서 얼마나 빠른지 체감한 뒤 올려보는 게 실패 없는 방법입니다.

당신을 위한 TOP 3 글 추천

라이너 스콜라 사용법과 후기: 논문 검색부터 인용까지 직접 써봤습니다

젠스파크 가격: AI 따로 구독하면 3만원 손해

러버블 AI란? 코딩 모르는 비개발자가 앱을 만들어 봤습니다

큐스페 새 글 알림 받기

필요한 AI 활용 글을 골라 이메일로 전해드립니다.

스팸 없이, 원할 때 언제든 해지할 수 있습니다.

댓글 남기기