Qwen 모델이 너무 많아서 뭘 써야 할지 모르겠다는 질문을 자주 본다. 실제로 알리바바 Qwen 팀이 공개한 모델만 따져도 텍스트, 코드, 비전, 음성, 이미지 생성까지 수십 종이 넘는다. 이 글에서는 Qwen 모델 종류를 계열별로 정리하고, 용도와 하드웨어에 따라 어떤 걸 골라야 하는지 실질적인 기준을 짚는다.
먼저 알아둘 것: 이름 읽는 법
Qwen 모델 이름에는 규칙이 있다.
- 숫자 B: 총 파라미터 수. 클수록 똑똑하지만 무겁다.
- A 뒤의 B: MoE(전문가 혼합) 모델에서 토큰당 실제로 동작하는 파라미터 수.
235B-A22B는 총 235B이지만 한 번에 22B만 쓴다. - Base: 사전학습 모델. 파인튜닝이나 연구용.
- Instruct: 대화와 지시 수행에 맞춰 조정된 버전. 일반 사용자는 이걸 쓴다.
- Thinking: 복잡한 문제를 길게 생각하는 추론 모드 전용.
- 날짜 접미사(-2507 등): 해당 월의 갱신판.
주요 라인업 한눈에 보기
Qwen은 단일 모델이 아니라 용도별로 나뉜 브랜드 체계다. 2026년 9월 기준, 핵심 계열을 정리하면 이렇다.
범용 텍스트 모델
| 계열 | 시기 | 특징 |
|---|---|---|
| Qwen2.5 | 2024-09 | 0.5B~72B, 안정적인 이전 세대. 여전히 널리 사용됨 |
| Qwen3 | 2025-04 | 0.6B~235B, thinking/non-thinking 전환이 핵심 |
| Qwen3.5 | 2026-02 | 네이티브 비전-언어 통합, 0.8B~397B |
| Qwen3.6 | 2026-04 | 27B dense 멀티모달, API 중심 Plus 모델 |
| Qwen3.8 | 2026-08 | 2.4T-A95B 플래그십, 27B 멀티모달, Flash-Next |
전문 용도 모델
- 코딩: Qwen2.5-Coder(1.5B~32B), Qwen3-Coder(30B-A3B, 480B-A35B)
- 추론·수학: QwQ-32B, Qwen2.5-Math(수학 전용)
- 비전·영상: Qwen2.5-VL, Qwen3-VL(이미지·문서·GUI 에이전트)
- 음성: Qwen2.5-Omni, Qwen3-Omni, Qwen3-ASR, Qwen3-TTS
- 이미지 생성: Qwen-Image 시리즈(1.0→3.0), Qwen-Image-Edit
- 검색(RAG): Qwen3-Embedding, Qwen3-Reranker
크기별 실제 요구 사양
“내 컴퓨터에서 돌아가나?”가 가장 현실적인 질문이다. Ollama Q4_K_M(4비트 양자화) 기준으로 정리한다.
Qwen3 크기별 사양
| 모델 | 다운로드 크기 | GPU VRAM 최소 | 적합한 환경 |
|---|---|---|---|
| 0.6B | 523MB | 2GB | 실험용 |
| 4B | 2.5GB | 4GB | 가벼운 범용 시작점 |
| 8B | 5.2GB | 7GB | 개인 PC 범용 |
| 14B | 9.3GB | 12GB | 품질과 비용의 균형 |
| 32B | 20GB | 22GB | 24GB GPU의 상한선 |
| 30B-A3B | 19GB | 22GB | MoE, 빠른 추론 |
| 235B-A22B | 142GB | 150GB | 서버·다중 GPU 전용 |
MoE 모델(30B-A3B 등)은 활성 파라미터가 3B라고 해서 메모리도 3B급은 아니다. 전체 가중치를 다 올려야 하므로 실제 VRAM 요구량은 총 파라미터에 가깝다.
환경별 빠른 선택
- GPU 없음, RAM 16GB: Qwen3 1.7B 또는 4B
- 8~12GB VRAM: Qwen3 8B
- 16GB VRAM: Qwen3 14B (긴 컨텍스트는 줄여야 함)
- 24GB VRAM: Qwen3 32B 또는 QwQ-32B를 Q4로
Qwen 모델 성능은 어느 정도인가
벤치마크 수치는 참고용이지 절대 기준은 아니다. 그래도 위치를 가늠하는 데는 도움이 된다.
Qwen 공식 평가에 따르면 Qwen3의 4B/8B/14B/32B Base는 각각 Qwen2.5의 7B/14B/32B/72B Base와 비슷한 수준이다. 같은 VRAM에서 한 세대 위 성능을 기대할 수 있다는 뜻이다. 단, 이건 영어 벤치마크 기준이고 한국어·특정 업무에서 그대로 적용되지는 않는다.
Qwen3-32B Thinking 모드와 QwQ-32B를 비교하면, AIME’24(81.4 vs 79.5), LiveCodeBench(65.7 vs 62.7)로 Qwen3 쪽이 앞선다. 새로 시작한다면 별도 QwQ보다 Qwen3의 thinking 모드가 더 실용적이다.
용도별 선택 기준
일반 글쓰기·요약·다국어
가벼운 로컬이라면 Qwen3 4B~14B, 고성능 로컬은 Qwen3.8-27B, API 최고급은 Qwen3.8-Max를 검토한다.
코딩
저장소 탐색·도구 호출 중심이면 Qwen3-Coder, 범용 멀티모달 코딩이면 Qwen3.6/3.8-27B를 비교한다.
수학·복잡한 추론
Qwen3 이상에서 Thinking 모드를 켜는 게 기본이다. 수학 전용 벤치마크에 특화된 작업이면 Qwen2.5-Math 계열도 있다.
이미지·문서 이해
단순 OCR부터 GUI 에이전트까지 Qwen3-VL이 명확한 선택지다. 최신 범용이면 Qwen3.5/3.8 계열이 네이티브 멀티모달을 지원한다.
음성 대화
입출력 모두 음성이면 Qwen3-Omni, 인식만이면 Qwen3-ASR, 생성만이면 Qwen3-TTS.
RAG 파이프라인
생성 모델에 검색을 맡기지 말고 Qwen3-Embedding + Qwen3-Reranker를 별도로 조합한다.
로컬이 아니면 굳이 Qwen인가
솔직히 말하면, 유료 API를 쓸 예산이 있다면 GPT나 Claude 같은 상용 모델이 대부분의 업무에서 더 편하고 성능도 높다. Qwen의 진짜 가치는 로컬에서 돌릴 수 있다는 점이다.
비용을 내고 API를 호출할 거라면 이미 검증된 상용 서비스가 낫다. 하지만 데이터를 외부에 보내기 어렵거나, API 비용을 줄이고 싶거나, 자기 서버에서 자유롭게 커스터마이징하고 싶다면 Qwen은 오픈소스 진영에서 가장 넓은 선택지를 제공한다. 허깅페이스 기준 누적 다운로드가 메타 Llama를 넘어선 것도 이런 실용성 때문이다.
정리하면 이렇다.
- 로컬 구동이 목적: Qwen이 최우선 후보
- API 비용을 아끼면서 자체 서버 운영: Qwen 오픈 웨이트 + vLLM 등 서빙
- 편의성과 최고 성능이 우선: 상용 API(GPT, Claude 등)가 현실적
처음 쓴다면 이렇게 시작하라
- Ollama 설치 후
ollama run qwen3:8b로 바로 대화해 본다. - 품질이 부족하면 14B나 32B로 올린다. VRAM이 모자라면 4B로 내린다.
- 코드 작업이 많으면
qwen2.5-coder:7b를 따로 받아 비교한다. - 수학이나 논리 문제가 중심이면 Qwen3의 thinking 모드를 켜거나
qwq:32b를 쓴다. - 이미지·문서를 읽혀야 하면 텍스트 모델이 아닌 VL 계열을 선택한다.
Qwen 최신 모델은 빠르게 갱신되고 있어서 공식 블로그와 GitHub 저장소를 주기적으로 확인하는 게 좋다. 벤치마크 수치보다는 내 업무, 내 하드웨어에서 직접 돌려보는 것이 가장 정확한 선택 기준이다.