Qwen 3.8 Flash가 뭔지 궁금해서 찾아본 분이라면, 아마 이런 질문이 먼저일 겁니다. “Max도 있고 GPT도 있는데, 이걸 왜 쓰지?”
결론부터 말하면, Flash는 “싸고 컨텍스트 긴 멀티모달 MoE 모델”입니다. 그리고 이 모델이 진짜 의미를 갖는 상황은 생각보다 좁습니다.
Qwen 3.8 Flash 기본 사양
Alibaba Qwen이 제공하는 멀티모달 API 모델입니다. 텍스트, 이미지, 동영상을 입력받아 텍스트를 출력합니다.
| 항목 | 내용 |
|---|---|
| 총 파라미터 | 125B (주 모델) + 51B N-gram 임베딩 + 4B MTP |
| 활성 파라미터 | 토큰당 6B |
| 아키텍처 | MoE, 512개 전문가 중 10개 라우팅 + 1개 공유 활성화 |
| 컨텍스트 | 100만 토큰 (API 기준) |
| 최대 출력 | 131K 토큰 |
| 입력 | 텍스트, 이미지(최대 1,600만 픽셀), 동영상(2시간·2GB) |
| 기능 | 함수 호출, 구조화 출력, 컨텍스트 캐시, 웹 검색, 코드 인터프리터 |
125B 전체를 돌리는 게 아니라 토큰마다 6B만 활성화합니다. 이게 Flash라는 이름이 붙은 이유이기도 합니다. 파라미터 대비 추론 비용이 낮습니다.
기반 공개 모델인 Qwen3.8-Flash-Next는 2026년 8월 26일에 가중치가 공개됐습니다. API 모델 qwen3.8-flash는 여기에 프로덕션 기능을 추가한 관리형 버전입니다.
특징: 무엇이 다른가
Flash의 핵심은 세 가지입니다.
낮은 활성 파라미터. 125B 모델이지만 실제로는 6B만 쓰므로, 같은 규모의 Dense 모델보다 추론 비용이 훨씬 낮습니다.
100만 토큰 컨텍스트. API 기준 입력 991K, 출력 131K까지 가능합니다. 장문 효율을 위해 GDN(Gated DeltaNet)과 QSA(Qwen Sparse Attention) 하이브리드 어텐션을 사용합니다. 공식 기술 보고서에 따르면 100만 토큰에서 QSA가 조밀 어텐션 대비 prefill 커널 7.6배, decode 어텐션 4.9배 빠르다고 합니다. 다만 이건 전체 API 응답 속도가 아니라 특정 하드웨어 조건의 어텐션 커널 상대 속도입니다.
멀티모달 + 도구. 이미지와 동영상을 입력받고, 함수 호출과 구조화 출력까지 지원합니다. Max와 기능 세트가 거의 같습니다.
Qwen 3.8 Flash 성능은 어느 정도인가
공식 벤치마크 수치를 먼저 보겠습니다. 아래는 기반 모델 Flash-Next 기준입니다.
| 벤치마크 | 점수 | 비고 |
|---|---|---|
| MMLU | 90.36% | Base, 5-shot |
| GSM8K | 93.29% | Base, 4-shot CoT |
| MATH | 72.78% | Base, 4-shot CoT |
| GPQA Diamond | 91.7% | post-training |
| LiveCodeBench v6 | 91.9% | post-training |
| SWE-bench Pro | 62.5% | post-training |
| EvalPlus | 78.76% | HumanEval·MBPP 평균 집계 |
숫자만 보면 꽤 좋아 보입니다. 하지만 주의할 점이 있습니다.
독립 평가기관 Artificial Analysis 기준으로 출력 속도는 약 51.6 tok/s, TTFT는 2.70초, Intelligence Index는 40점입니다. 동급 공개 가중치 모델의 속도 중앙값(70.9 tok/s)보다 낮습니다. “Flash”라는 이름에서 기대하는 것만큼 빠르진 않다는 뜻입니다.
Artificial Analysis Intelligence Index에서 Flash는 40점으로, 같은 가격대의 DeepSeek V4 Flash(35점, $0.22)보다는 높지만 GPT-5.6-Luna(38점, $0.18)와 비교하면 가격 대비 뚜렷한 우위가 있다고 보기 어렵습니다.
Max와 뭐가 다른가
같은 Qwen 3.8 계열이지만 급이 다릅니다.
| 항목 | Flash | Max |
|---|---|---|
| 총 파라미터 | 1,250억 | 2조 4,000억 |
| 활성 파라미터 | 60억 | 950억 |
| 컨텍스트 | 100만 토큰 | 100만 토큰 |
| 입력 가격 (100만 토큰) | $0.15 | $2.00 |
| 출력 가격 (100만 토큰) | $0.47 | $6.00 |
기능은 거의 같습니다. 컨텍스트, 멀티모달, 함수 호출, 구조화 출력 모두 동일. 차이는 파라미터 규모(활성 기준 약 16배)와 가격(입력 13배, 출력 13배)입니다.
성능 차이는 의외로 공개된 직접 비교가 부족합니다. 제3자 비교에서 LiveBench는 Flash 79.12 vs Max 81.88, ToneBench는 Flash 80.83 vs Max 81.06으로 Max가 근소하게 높았지만, 충분한 독립 평가가 없어 범용 우위를 단정하기는 어렵습니다.
정리하면: Flash는 Max의 기능을 거의 그대로 가져오면서 비용을 13분의 1로 낮춘 모델입니다. 대신 파라미터가 16분의 1이고, 복잡한 추론에서는 Max보다 뒤처질 가능성이 높습니다.
비용과 접근 방법
API 요금은 아래와 같습니다.
| 플랫폼 | 입력 (100만 토큰) | 출력 (100만 토큰) | 비고 |
|---|---|---|---|
| QwenCloud / Model Studio (싱가포르) | $0.15 | $0.47 | 캐시 입력 $0.016 |
| Model Studio (베이징·도쿄 등) | $0.113 | $0.382 | 캐시 입력 $0.014 |
| Together AI | $0.15 | $0.47 | 서버리스 |
무료 체험도 있습니다. Model Studio 싱가포르 리전에서 계정당 100만 토큰 무료 쿼터가 제공되며, 90일 유효입니다. 다른 리전에는 이 무료 쿼터가 없고, Together AI는 최소 $5 크레딧 구매가 필요합니다.
셀프호스팅을 고려한다면 주의할 점이 있습니다. API 모델 qwen3.8-flash 자체의 가중치는 공개되지 않았습니다. 공개된 건 기반 모델 Qwen3.8-Flash-Next이고, Qwen Community License 1.0이 적용됩니다. 이 라이선스는 무제한 오픈소스가 아니라 상업적 MaaS나 AI 업무 보조 제품에 별도 조건이 있습니다.
그래서 누가 쓰면 되나
솔직히 말하면, 클라우드 API로만 보면 선택지가 애매합니다. GPT-5.6-Luna가 $0.18로 비슷한 가격대에서 38점을 찍고 있고, Flash는 $0.47 출력에 40점입니다. 출력 비용이 2.6배인데 점수 차이는 2점. 범용 API 용도라면 Luna가 가성비에서 앞섭니다.
Flash가 의미 있는 상황은 구체적입니다.
- 데이터가 외부로 나가면 안 될 때. Flash-Next 공개 가중치로 vLLM이나 SGLang을 띄워 로컬에서 운용할 수 있습니다. 이 경우 API 비용이 0이고 데이터 주권을 확보합니다.
- 검열 없는 모델이 필요할 때. 오픈웨이트 모델을 직접 운용하면 필터링 정책을 통제할 수 있습니다.
- 100만 토큰 컨텍스트가 필요하면서 비용을 극단적으로 줄여야 할 때. 대량 문서 요약, 코드 리포지터리 분석, 고동시성 도구 호출처럼 호출량이 많은 작업에서 Max 대비 13분의 1 비용은 의미가 큽니다.
- Qwen 생태계 안에서 단계별 모델 분리가 필요할 때. Flash를 기본 라우트로 쓰고, 품질 검증 실패 시에만 Max로 승격하는 구성이 가능합니다.
반대로, 법률·의료·재무처럼 한 번의 오류 비용이 큰 최종 판단, 복잡한 다단계 자율 코딩, 최상위 비전 정확도가 필요한 작업은 Max를 쓰는 게 맞습니다.
범용 클라우드 API 챗봇이나 일반 업무 자동화가 목적이라면, 굳이 Flash를 고를 이유가 뚜렷하지 않습니다. 로컬 배포나 데이터 주권이 필요한 상황에서 이 모델의 가치가 생깁니다.