Qwen 3.8 정리: 모델 라인업, 성능, 이전 세대와 달라진 점

Qwen 3.8은 알리바바 클라우드 Qwen 팀이 2026년 8월에 공개한 최신 모델 세대다. “또 새 버전이 나왔는데 뭐가 달라진 건가?”라는 질문이 먼저 떠오를 텐데, 이번 세대는 단순한 점수 갱신보다 모델 구성 자체가 눈에 띄게 바뀌었다. 어떤 모델이 있고, Qwen 3.7과 비교해 무엇이 달라졌으며, 실제로 어디에 쓸 수 있는지 정리한다.

Qwen 3.7에서 Qwen 3.8로: 무엇이 바뀌었나

Qwen 3.7은 Max, Plus, Flash 세 등급의 API 모델로 구성됐다. 파라미터 수는 공개되지 않았고, 100만 토큰 컨텍스트와 멀티모달 입력이 핵심이었다.

Qwen 3.8에서 달라진 점은 크게 세 가지다.

오픈 가중치 모델의 복귀. 3.7이 API 전용이었던 것과 달리, 3.8은 2.4T-A95B와 27B의 가중치를 Hugging Face에 공개했다. 직접 서빙하거나 파인튜닝할 수 있는 선택지가 다시 생겼다.

규모의 공개. 3.7은 파라미터 수를 밝히지 않았지만, 3.8-Max는 총 2.4조 파라미터에 토큰당 활성 95B라는 구체적인 구조를 공개했다. 27B 밀집형 모델도 별도로 내놨다.

Flash-Next라는 실험적 갈래. Qwen4의 사전 공개 성격으로, 기존의 Gated Attention을 Qwen Sparse Attention(QSA)으로 교체하고 N-gram embedding, 4-분기 Gated Residual 같은 새로운 구조를 도입했다. 총 약 180B에 활성 6B로, 긴 컨텍스트 비용을 줄이는 데 초점을 맞춘 모델이다.

아키텍처 측면에서 Max와 27B는 Qwen 3.5부터 이어져 온 Gated DeltaNet + Gated Attention 하이브리드 구조를 기반으로 한다. 완전히 새로운 설계가 아니라, 에이전트 실행과 코딩, 장기 작업 성능을 강화한 개선판이다.

모델 라인업 한눈에 보기

모델규모활성 파라미터컨텍스트가중치 공개
Qwen3.8-Max2.4T MoE, 멀티모달95B최대 1MAPI 전용
Qwen3.8-2.4T-A95B2.4T MoE, 텍스트 전용95B네이티브 262K, 확장 1M공개 (커스텀 라이선스)
Qwen3.8-27B27B Dense, 이미지·비디오27B 전체네이티브 262K, 확장 1MApache-2.0
Qwen3.8-Flash-Next~180B MoE6B네이티브 262K, 확장 1Mqwen-community-1.0
Qwen3.8-FlashFlash-Next 기반 호스팅판미공개기본 1MAPI 전용

주의할 점이 몇 가지 있다. 2.4T-A95B 오픈 체크포인트는 텍스트 전용이다. 멀티모달이 필요하면 Max API나 27B를 써야 한다. FP8 표기가 붙은 배포판은 양자화 버전이지 별도 모델이 아니다. 그리고 GitHub 저장소의 Apache-2.0 라이선스와 모델 가중치의 라이선스는 서로 다르니 혼동하지 않는 게 좋다.

Qwen 3.8 성능: 공식 벤치마크 기준

Qwen 3.8은 기존에 흔히 쓰이던 MMLU, HumanEval, GSM8K 같은 지표 대신 에이전트 수행, 실제 소프트웨어 작업, 장문맥 평가를 전면에 내세웠다. 공식 모델 카드에서 구형 벤치마크 수치는 확인되지 않는다.

27B 모델

벤치마크Qwen3.8-27BQwen3.6-27BClaude Opus 4.6 Max
Terminal-Bench 2.173.063.478.2
SWE-bench Pro61.753.553.4
CoWorkBench70.761.068.2
GPQA Diamond89.287.891.3
LiveCodeBench v690.383.988.8

직전 27B 대비 Terminal-Bench +9.6점, SWE-bench Pro +8.2점, LiveCodeBench +6.4점이다. SWE-bench Pro와 CoWorkBench에서는 Opus 4.6 Max 비교치보다 높게 나오지만, GPQA와 Terminal-Bench에서는 Opus가 앞선다.

Max 모델

벤치마크Qwen3.8-MaxClaude Opus 4.8GPT 5.6 SolQwen 3.7-Max
Terminal-Bench 2.186.684.688.874.5
SWE-bench Pro67.769.264.660.6
PaperBench93.080.390.564.8
CoWorkBench74.872.371.564.6
IFBench82.862.272.779.1

Qwen 3.7-Max 대비 Terminal-Bench +12.1점, PaperBench +28.2점, CoWorkBench +10.2점으로 폭이 크다. 다만 이 수치는 Qwen이 자체 제시한 벤치마크이며, 일부 외부 모델 결과는 서로 다른 하네스의 공개 최고 점수다. 절대적 서열이 아니라 참고 비교로 읽어야 한다.

주요 활용처

Qwen 3.8이 공식적으로 강조하는 영역은 네 가지다.

코딩과 소프트웨어 엔지니어링. 코드 보조, 자동 수정, 저장소 수준 생성, 장기 자율 개발. SWE-bench Pro와 Terminal-Bench 점수가 이 방향성을 뒷받침한다.

에이전트. 계획 수립, 도구·환경 피드백 처리, 다단계 작업 완결. 27B는 OSWorld-Verified 84.3, WebArena-Verified 64.8, AndroidWorld 81.9를 보고했다.

시각·문서·영상 이해. 27B와 Flash-Next가 이미지·비디오 입력을 지원한다. STEM 도표, 차트, 긴 문서, 영상 분석이 대상이며, MathVision 90.0(코드 인터프리터 사용 시 94.6)도 공식 표에 포함돼 있다.

긴 컨텍스트와 추론 제어. 오픈 모델은 네이티브 262K에서 최대 약 100만 토큰까지 확장 가능하고, reasoning_effort(xhigh/medium/low)로 추론 깊이를, preserve_thinking으로 대화 이력의 추론 블록 유지를 제어할 수 있다.

한 가지 주의할 점: 다국어 성능은 이번 공식 자료에서 핵심 활용처로 강조되지 않았고 언어별 벤치마크도 제시되지 않았다. Qwen이 다국어 계열로 알려져 있긴 하지만, 3.8에서 이전 세대 대비 얼마나 향상됐는지는 확인할 수 없다.

이용 방법과 요금

API: Alibaba Cloud Model Studio

모델입력 (CNY/100만 토큰)출력 (CNY/100만 토큰)
qwen3.8-max1236
qwen3.8-flash0.82.7
qwen3.8-2.4t-a95b1236
qwen3.8-27b312

베이징 리전 기준이며, 각 모델에 100만 토큰 무료 쿼터가 있다(활성화 후 90일 유효). 싱가포르 리전은 약 25% 높다.

로컬 실행

  • vLLM: 2.4T-A95B, 27B, Flash-Next 모두 공식 모델 카드에서 vllm serve 실행을 안내한다.
  • Ollama: 공식 라이브러리에서 직접 확인된 것은 qwen3.8-flash-next뿐이다. 27B와 2.4T는 GGUF 양자화를 통해 Ollama나 LM Studio에서 사용할 수 있지만, 공식 한 줄 설치가 보장되는 것은 아니다.
  • Hugging Face: 2.4T-A95B, 27B, Flash-Next의 가중치와 FP8 양자화판을 내려받을 수 있다.

2.4T 모델은 활성 파라미터가 95B라고 해서 전체 가중치 저장·메모리 요구량도 95B인 것은 아니다. 직접 서빙하려면 대규모 인프라가 필요하다.

어떤 모델을 선택할까

상황별로 갈린다.

최고 성능이 필요하고 API를 쓸 수 있다면 qwen3.8-max. 코딩 에이전트나 복합 문서 분석처럼 정확도가 비용보다 중요한 작업에 맞다.

비용을 낮추면서 빠른 응답이 필요하다면 qwen3.8-flash. 입력 기준 Max의 1/15 수준이다. 고동시성 코딩 보조나 대량 처리에 적합하다.

직접 서빙하거나 파인튜닝하고 싶다면 27B가 현실적이다. Apache-2.0으로 가중치가 공개돼 있고, 이미지·영상까지 처리한다. vLLM으로 올릴 수 있는 규모이기도 하다.

새 아키텍처를 실험하고 싶다면 Flash-Next. 활성 6B로 가벼운 편이지만, Qwen4 기반의 실험적 프리뷰라는 점은 감안해야 한다. 프로덕션보다는 검증·개발 목적이다.

2.4T-A95B 오픈 체크포인트는 Max의 텍스트 전용 버전이다. 성능은 높지만 서빙 인프라가 충분할 때만 선택지가 된다.

결국 Qwen 3.8 세대에서 가장 눈에 띄는 변화는 성능 자체보다 선택지의 구조다. API만 있던 3.7과 달리, 오픈 가중치부터 실험적 차세대 아키텍처까지 필요에 따라 고를 수 있게 됐다. 쓰려는 곳이 정해져 있다면, 위 기준으로 좁혀 보는 게 빠르다.

당신을 위한 TOP 3 글 추천

라이너 스콜라 사용법과 후기: 논문 검색부터 인용까지 직접 써봤습니다

젠스파크 가격: AI 따로 구독하면 3만원 손해

러버블 AI란? 코딩 모르는 비개발자가 앱을 만들어 봤습니다

큐스페 새 글 알림 받기

필요한 AI 활용 글을 골라 이메일로 전해드립니다.

스팸 없이, 원할 때 언제든 해지할 수 있습니다.

댓글 남기기