Qwen 3.8 Max: 2.4T 플래그십 모델, 언제 쓸 가치가 있을까

Qwen 3.8 Max는 알리바바 Qwen 팀이 2026년 8월에 내놓은 3.8 세대의 최상위 모델이다. 파라미터 2.4조, 100만 토큰 컨텍스트, 이미지·비디오 입력까지 지원하는 관리형 API 제품인데, 같은 세대에 27B와 Flash도 있다 보니 “Max를 굳이 써야 하나?”라는 질문이 자연스럽게 따라온다. 이 글에서 사양과 성능, 가격 차이를 정리하고 선택 기준을 짚어 본다.

Qwen 3.8 Max, 어떤 모델인가

Qwen Max는 Qwen 3.8 계열의 플래그십이다. 텍스트뿐 아니라 이미지와 비디오를 입력받을 수 있는 멀티모달 모델이고, 함수 호출·구조화 출력·웹 검색 같은 도구도 기본 내장돼 있다.

핵심 사양을 간단히 요약하면 이렇다.

항목내용
총 파라미터2.4조(2.4T)
아키텍처희소 MoE + 하이브리드 어텐션
활성 파라미터토큰당 약 950억(95B)
전문가 구성512개 중 라우팅 10개 + 공유 1개 활성
컨텍스트최대 100만 토큰(입력 991,808 + 출력 131,072)
입력텍스트, 이미지, 비디오
출시2026년 8월 2~3일(API), 8월 12일(공개 가중치)

2.4조 파라미터 전체가 매번 작동하는 건 아니다. MoE 구조라서 요청마다 950억 파라미터만 활성화된다. 덕분에 모델 규모 대비 추론 비용을 억제할 수 있지만, 그래도 같은 세대 다른 모델보다는 확실히 무겁다.

주요 특징

Max를 다른 3.8 계열과 구분 짓는 특징은 크게 세 가지다.

멀티모달 입력. 텍스트 외에 이미지와 비디오를 직접 넣을 수 있다. 기반이 되는 공개 가중치 Qwen3.8-2.4T-A95B는 텍스트 전용이라서, 비전 입력이 필요하면 Max API를 쓰는 게 공식 경로다.

비사고(non-thinking) 모드. 공개 가중치 버전은 사고 모드가 항상 켜져 있다. Max API는 비사고 모드를 선택할 수 있어서, 단순 응답이 필요한 상황에서 불필요한 추론 토큰을 줄일 수 있다.

기본 100만 토큰 컨텍스트. 공개 가중치의 네이티브 컨텍스트는 262,144 토큰이고 확장 시 100만까지 가능하다. Max API는 처음부터 100만 토큰을 기본 제공한다.

Qwen 3.8 Max 성능

Qwen 팀이 공개한 벤치마크 수치를 보면 Max의 위치가 보인다. 다만 벤치마크마다 하네스와 프롬프트 조건이 다르고, CoWorkBench·QwenSWEBench 같은 내부 벤치마크도 포함돼 있으니 절대적인 순위표로 읽기보다는 경향을 파악하는 용도로 보는 게 맞다.

벤치마크Max27BFlash
Terminal Bench 2.186.673.0—
SWE-bench Pro67.761.762.5
DeepSWE 1.156.642.258.7
CoWorkBench74.870.773.9
JobBench53.433.455.7
GPQA Diamond92.689.2—

몇 가지 눈에 띄는 지점이 있다.

  • 코딩 난이도가 높을수록 Max의 격차가 커진다. Terminal Bench 2.1에서 Max는 86.6, 27B는 73.0으로 13.6점 차이다.
  • Flash가 Max에 근접하거나 일부 항목에서 앞서는 경우도 있다. DeepSWE 1.1에서 Flash(58.7)가 Max(56.6)보다 높다. 다만 평가 설정이 동일한지 확인되지 않았으므로 “Flash가 Max보다 낫다”는 결론으로 쓰기는 어렵다.
  • 27B는 확실히 한 단계 아래다. 특히 JobBench(33.4 vs 53.4)처럼 복잡한 업무 자동화에서 차이가 두드러진다.

Artificial Analysis Intelligence Index v4.3 기준으로 Qwen 3.8 Max는 40점($2.66/작업)을 기록했다. 같은 인덱스에서 GPT-5.6-Terra 42점, Gemini 3.8 Flash 41점과 비슷한 구간이고, 최상위인 Claude Fable 5.1·GPT-6 Astra의 53점과는 차이가 있다.

27B·Flash와 무엇이 다른가

같은 Qwen 3.8이라는 이름을 달고 있지만 세 모델은 성격이 상당히 다르다.

Max27BFlash
규모2.4T MoE, 95B 활성27B dense125B + 51B, 6B 활성
멀티모달텍스트·이미지·비디오비전언어(이미지+텍스트)텍스트·이미지·비디오
API 가격(입력/출력)$2 / $6$0.50 / $3$0.15 / $0.47
컨텍스트100만100만(API)100만
공개 가중치기반 모델 공개(텍스트 전용)Apache 2.0공개 가중치 있음

가격 차이가 결정적이다. Flash 대비 Max의 토큰 단가는 입력 약 13배, 출력 약 13배다. 일상적인 요청을 Max로 돌리면 비용이 금방 불어난다.

27B는 가격보다 소유와 통제가 핵심이다. Apache 2.0 라이선스의 dense 모델이라 로컬 실행, 사내망 데이터 처리, 자체 파인튜닝이 가능하다. 양자화하면 노트북에서도 돌릴 수 있다고 알리바바가 설명한다. API 가격만 놓고 보면 Flash가 27B보다 싸지만, 데이터를 외부로 보내지 않아야 하거나 모델을 직접 수정해야 할 때는 27B가 유일한 선택지다.

어디서 쓸 수 있나

Qwen 3.8 Max API를 제공하는 확인된 경로는 세 곳이다.

Alibaba Cloud Model Studio(DashScope). 가장 직접적인 공식 경로다. 싱가포르 리전에서 100만 토큰 무료 쿼터를 제공하며, 활성화 후 90일간 유효하다. OpenAI 호환 API와 DashScope 멀티모달 API를 모두 지원한다.

Fireworks AI. 모델 ID accounts/fireworks/models/qwen3p8-max로 호출할 수 있다. 서버리스 API 가격은 공식과 같은 $2/$6이고, 신규 사용자에게 $1 무료 크레딧을 제공한다.

OpenRouter. 통합 OpenAI 호환 API에서 qwen/qwen3.8-max-0902로 접근 가능하다. 가격은 동일하게 $2/$6이다.

Hugging Face에는 기반 공개 가중치인 Qwen3.8-2.4T-A95B가 올라와 있다. 자체 서버에 배포할 수는 있지만, FP8 체크포인트만 약 2.5TB여서 일반 PC로는 현실적이지 않다. 게다가 텍스트 전용이고 비전 입력과 비사고 모드가 빠져 있으니, Max API와 동일한 경험은 아니다.

공개 가중치의 라이선스는 Qwen3.8-Max License다. 월간 활성 사용자 1억 명 또는 월 매출 2,000만 달러 이상이면 모델명 표시 의무가 있고, MaaS/AI 업무 보조 사업자가 연 매출 5,000만 달러를 넘으면 별도 라이선스가 필요하다. 대부분의 개인·중소 사용자에게는 해당하지 않지만 상용 배포 전에 확인할 사항이다.

어떤 용도에 적합한가

Max의 가격은 Flash의 13배다. 그래서 “항상 Max”가 아니라 “이 작업에는 Max”라는 판단이 필요하다.

Max가 맞는 상황:

  • 실패 비용이 큰 복잡한 코드베이스 작업
  • 계획·검증·반복이 긴 에이전트 워크플로우
  • 이미지나 비디오를 함께 분석해야 하는 고난도 멀티모달 작업
  • 100만 토큰에 가까운 긴 문서를 한 번에 처리해야 할 때

Flash가 낫는 상황:

  • 대량의 반복 요청, 빠른 상호작용
  • 일반적인 코딩 보조, 업무 자동화, 도구 호출
  • 비용 효율이 중요한 프로덕션 파이프라인

27B가 맞는 상황:

  • 데이터를 외부 API로 보낼 수 없는 사내망 환경
  • 모델을 직접 파인튜닝하거나 수정해야 할 때
  • 재현 가능한 로컬 배포가 필수인 경우

선택 판단: Max를 쓸지 말지

결국 핵심 질문은 하나다. “이 작업에서 Max와 Flash의 성능 차이가 13배 가격 차이를 정당화하는가?”

공식 벤치마크에서 Max가 Flash를 확실히 앞서는 영역은 Terminal Bench 같은 고난도 소프트웨어 엔지니어링 과제다. 반면 SWE-bench Pro나 CoWorkBench에서는 격차가 좁고, 일부 항목에서는 Flash가 비슷하거나 앞서기도 한다.

실무적으로는 이렇게 접근하면 된다.

  1. 기본값은 Flash로 둔다. 대부분의 일상 작업에서 Flash는 충분하고 비용 부담이 작다.
  2. Flash로 안 되는 작업이 생기면 Max로 올린다. 복잡한 추론, 멀티모달 분석, 긴 컨텍스트가 동시에 필요한 경우다.
  3. 데이터 통제가 핵심이면 27B를 검토한다. API 비용과는 별개의 판단축이다.

Qwen Max는 “언제나 최고를 쓰자”가 아니라, 까다로운 작업에서 꺼내 쓰는 상위 모델이다. Flash와의 가격 차이를 인식하고, 작업 난이도에 따라 전환하는 게 가장 현실적인 사용법이다.

당신을 위한 TOP 3 글 추천

라이너 스콜라 사용법과 후기: 논문 검색부터 인용까지 직접 써봤습니다

젠스파크 가격: AI 따로 구독하면 3만원 손해

러버블 AI란? 코딩 모르는 비개발자가 앱을 만들어 봤습니다

큐스페 새 글 알림 받기

필요한 AI 활용 글을 골라 이메일로 전해드립니다.

스팸 없이, 원할 때 언제든 해지할 수 있습니다.

댓글 남기기