Qwen 3.8 27B는 2026년 8월 알리바바 Qwen 팀이 공개한 270억 파라미터의 오픈웨이트 모델입니다. Apache 2.0 라이선스에 이미지·비디오까지 처리하는 멀티모달 모델인데, 27B라는 크기가 로컬 실행과 성능 사이에서 어떤 위치인지 궁금한 분이 많을 겁니다. 직접 돌려볼 수 있는 건지, 내 GPU로 되는 건지, 성능은 쓸 만한 건지 하나씩 짚어보겠습니다.
Qwen 3.8 27B, 어떤 모델인가
핵심부터 정리하면 이렇습니다.
- 파라미터: 27B dense 모델 (MoE가 아니라 전체 파라미터가 활성화됩니다)
- 아키텍처: 64개 층의 하이브리드 구조. Gated DeltaNet과 Gated Attention을 섞은 레이아웃에 MTP(Multi-Token Prediction)도 학습됐습니다
- 컨텍스트 윈도우: 네이티브 262,144 토큰, 확장 시 최대 1,000,000 토큰
- 멀티모달: 텍스트뿐 아니라 이미지·비디오 입력을 네이티브로 처리합니다
- 라이선스: Apache License 2.0
- 추론 모드: 기본 활성화된 thinking 모드와 xhigh/medium/low 추론 강도 제어를 지원합니다
MoE 모델이 아닌 dense 모델이라는 점이 중요합니다. 같은 27B라도 MoE 모델은 토큰당 일부만 활성화해서 실행 비용이 낮지만, Qwen 3.8 27B는 전체 27B가 매번 동작합니다. 그만큼 VRAM을 온전히 사용하고, 그만큼 단일 모델의 밀도 있는 성능을 기대할 수 있습니다.
Qwen 3.8 27B 성능: 공식 벤치마크 기준
Qwen 팀이 공식 모델 카드에 공개한 주요 벤치마크 결과입니다.
| 벤치마크 | Qwen3.8-27B | 직전 Qwen3.6-27B |
|---|---|---|
| Terminal Bench 2.1 | 73.0 | 63.4 |
| SWE-bench Pro | 61.7 | 53.5 |
| LiveCodeBench v6 | 90.3 | 83.9 |
| GPQA Diamond | 89.2 | 87.8 |
| HLE (종합 추론) | 30.8 | 24.0 |
| IFBench (지시 이행) | 79.5 | 69.1 |
| DeepSWE 1.1 | 42.2 | 13.3 |
직전 세대인 Qwen3.6-27B 대비 거의 모든 항목에서 눈에 띄는 개선을 보입니다. 특히 DeepSWE 1.1에서 13.3 → 42.2로 뛴 것은 에이전트 코딩 능력이 크게 달라졌다는 의미입니다. SWE-bench Pro 61.7은 Qwen 측 발표 기준으로 같은 급 오픈웨이트 모델 가운데 높은 편입니다.
다만 주의할 점이 있습니다. 이 표의 일부 비교 수치는 Qwen이 자체 하네스로 재평가한 결과이고, QwenSWEBench·CoWorkBench 같은 자체 벤치마크도 포함돼 있습니다. 또한 MMLU, HumanEval, GSM8K 같은 고전 벤치마크 점수는 이번 모델 카드에서 공개되지 않았습니다.
Artificial Analysis 지수에서의 위치
제3자 평가인 Artificial Analysis Intelligence Index v4.3에서 Qwen3.8-27B는 xhigh 추론 설정 기준 34점을 받았습니다. 같은 20~30B급 오픈웨이트와 비교하면 다음과 같습니다.
| 모델 | 파라미터 | AA v4.3 점수 |
|---|---|---|
| Qwen3.8-27B (xhigh) | 27B | 34 |
| Qwen3.8-27B (non-reasoning) | 27B | 22 |
| Mistral Small 3.1 | 24B | 7 |
| Gemma 3 27B | 27B | 5 |
같은 크기대에서는 확실히 앞서 있지만, 상위 상용 모델과는 격차가 있습니다. 참고로 같은 AA v4.3에서 GPT-5.6-Terra가 42점, Claude Sonnet 5가 38점입니다. 34점이라는 숫자 자체보다는, 27B 오픈웨이트로 로컬에서 돌릴 수 있는 모델 중에서는 상위라는 맥락으로 보는 게 맞습니다.
이 34점은 호스팅된 xhigh 추론 설정의 결과입니다. 로컬에서 양자화해서 돌리면 같은 점수가 나오지 않습니다.
요구 사양: 내 GPU로 돌릴 수 있나
가장 현실적인 질문입니다. 양자화 수준별로 파일 크기와 대략적인 VRAM 요구량을 정리하면 이렇습니다.
| 양자화 | 파일 크기 | 8K 컨텍스트 VRAM (추정) | 권장 GPU |
|---|---|---|---|
| BF16 원본 | 55.6GB | ~61GB | 80GB급 (A100 등) |
| Q8_0 | 28.6GB | ~33GB | 48GB급 |
| Q6_K | 22.0GB | ~25GB | 32GB 이상 |
| Q5_K_M | 19.8GB | ~22GB | 24GB (빠듯함) |
| Q4_K_M | 16.5~19GB | ~19GB | 24GB (RTX 4090/3090) |
RTX 4090 24GB 기준, Q4_K_M이 가장 보편적인 진입점입니다. 8K 컨텍스트에서 약 19GB, 32K에서도 약 21GB로 여유가 있습니다. 다만 128K 이상의 긴 컨텍스트에서는 KV 캐시만으로 약 28GB가 필요해서 24GB로는 부족합니다.
시스템 RAM도 간과하면 안 됩니다. GPU에 모델 전체를 올리는 Q4/Q5 기준으로 시스템 RAM 32GB가 실질적 하한이고, 64GB가 권장됩니다. CPU 오프로딩을 쓰는 경우에는 64GB 이상이 현실적입니다.
직접 써본 경험을 덧붙이면, 4060 Laptop(VRAM 8GB) 같은 환경에서는 이전 세대 35B 모델을 양자화해서 돌릴 수는 있었지만 토큰 출력 속도가 상당히 느렸습니다. 27B도 8GB VRAM에서는 대부분 CPU 오프로딩에 의존하게 되니, 실용적인 속도를 원한다면 최소 24GB VRAM을 기준으로 잡는 게 좋습니다.
로컬 실행 방법
Qwen 3.8 27B는 주요 로컬 실행 도구를 모두 지원합니다.
Ollama: 가장 간단합니다. 한 줄이면 됩니다.
bash ollama run qwen3.8:27b
양자화를 직접 지정하려면 ollama run qwen3.8:27b-q4_K_M처럼 태그를 붙이면 됩니다.
llama.cpp: ggml-org에서 GGUF 파일을 배포합니다.
bash llama-server -hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M
비전 입력을 쓰려면 mmproj 파일이 별도로 필요합니다.
LM Studio: GUI에서 Qwen3.8-27B를 검색해 내려받으면 됩니다. GGUF와 Apple Silicon용 MLX 양자화를 모두 지원합니다.
vLLM: 서버용 배포에 적합합니다. 공식 모델 카드에서 Transformers·vLLM 호환을 명시하고 있고, 단일 GPU용 NVFP4 양자화 레시피도 제공됩니다.
이 모델이 맞는 사람
Qwen 3.8 27B가 특히 의미 있는 경우를 정리하면 이렇습니다.
- 로컬 실행이 목적인 사용자: 데이터가 외부로 나가지 않고, 검열 없이 원하는 설정으로 쓸 수 있다는 로컬의 장점이 확실합니다. 24GB GPU가 있다면 Q4 양자화로 실용적인 속도를 낼 수 있습니다.
- 코딩·에이전트 작업이 많은 경우: SWE-bench Pro 61.7, LiveCodeBench v6 90.3 등 코딩 관련 벤치마크가 같은 크기대에서 두드러집니다.
- 멀티모달이 필요한 경우: 이미지·비디오 입력을 네이티브로 지원하는 27B 오픈웨이트 모델은 선택지가 많지 않습니다.
- 긴 컨텍스트가 필요한 경우: 네이티브 262K 토큰은 문서 분석이나 코드베이스 전체를 넘기는 작업에 유리합니다. 다만 48GB 이상의 VRAM이 필요합니다.
- 파인튜닝을 고려하는 경우: Apache 2.0 라이선스이므로 상업적 파인튜닝에도 제약이 없습니다.
한계와 주의할 점
솔직히 짚어야 할 부분도 있습니다.
VRAM 문턱이 높습니다. Dense 27B 모델이라 MoE 모델 대비 같은 VRAM에서 선택지가 제한됩니다. 16GB 이하 GPU에서는 심한 양자화와 CPU 오프로딩이 불가피하고, 실용적인 속도를 기대하기 어렵습니다.
양자화하면 성능이 떨어집니다. 벤치마크 점수는 FP16 원본 또는 호스팅된 xhigh 추론 기준입니다. Q4로 양자화하면 같은 성능이 아닙니다. 공식 FP8 양자화판은 “원본과 거의 동일”하다고 밝히고 있지만, Q4/Q5 수준의 공식 성능 비교는 제공되지 않았습니다.
상용 모델과의 격차. AA v4.3 기준 34점은 같은 크기대 오픈웨이트 중에서는 높지만, 상용 모델(GPT-5.6-Terra 42점, Claude Sonnet 5 38점)과는 차이가 있습니다. 최고 성능이 필요한 작업이라면 API 모델이 여전히 낫습니다.
비전 실행은 추가 구성이 필요합니다. llama.cpp에서 이미지 입력을 쓰려면 mmproj 파일을 별도로 내려받아야 하고, 비전 인코더가 추가 VRAM을 약 0.6~0.9GB 더 사용합니다.
정리하면, Qwen 3.8 27B는 “24GB GPU로 돌릴 수 있는 가장 강력한 오픈웨이트 모델 중 하나”라는 위치에 있습니다. 로컬 실행의 장점이 확실한 사용자에게, 그리고 코딩·에이전트·멀티모달 작업이 주된 사용자에게 가장 의미 있는 선택지입니다.