Kimi K3 총정리: 달라진 점, 성능, 활용법까지

2026년 7월, 중국 문샷AI(Moonshot AI)가 공개한 Kimi K3는 기존 K2 계열과 규모부터 다릅니다. 총 2.8조 파라미터에 토큰당 활성 파라미터 1,040억, 컨텍스트 윈도우 100만 토큰. 숫자만 보면 “또 큰 모델 나왔네” 싶지만, 진짜 궁금한 건 이겁니다. 실제로 뭐가 달라졌고, 어디에 쓸 만한가?

Kimi K3, K2에서 뭐가 바뀌었나

K3를 이해하려면 K2 계열과 직접 비교하는 게 빠릅니다.

항목K2 / K2.5K3
총 파라미터 / 활성1T / 32B2.8T / 104B
전문가 구성384개 중 8개 선택896개 중 16개 선택
컨텍스트K2.5 기준 256K1M (100만 토큰)
어텐션 구조MLAKDA 69개 + Gated MLA 24개
멀티모달K2는 텍스트 중심, K2.5부터 이미지·영상텍스트·이미지·영상 + 1M 컨텍스트 결합

규모만 커진 게 아닙니다. K3의 핵심은 Kimi Delta Attention(KDA), Attention Residuals, Stable LatentMoE라는 세 가지 구조적 변화입니다. K2의 MLA 중심 구조에서 KDA와 Gated MLA를 섞고, 깊이 방향 정보 흐름을 바꾸는 Attention Residuals를 넣었습니다. 문샷AI는 이 조합이 K2 대비 약 2.5배의 스케일링 효율을 냈다고 주장합니다. 이는 회사의 공식 주장이지 독립 검증 수치는 아닙니다.

구조·컨텍스트·멀티모달 들여다보기

100만 토큰 컨텍스트는 실무에서 어떤 의미일까요? 단순히 긴 글을 넣을 수 있다는 것 이상입니다. 100쪽짜리 계약서 여러 건, 대형 코드베이스, 긴 논문 묶음을 한 번에 올려놓고 작업할 수 있는 규모입니다.

다만 100만 토큰을 “수용”할 수 있다는 것과 그 전체에서 정확하게 추론한다는 것은 다른 문제입니다. 문샷AI의 공개 검증 저장소에서 100만 토큰 장기기억 시험(BEAM 1M) 점수는 0.31로, 긴 맥락에서의 정확도에는 한계가 있음을 시사합니다. 대형 문서 요약 시 중요 수치나 인용은 별도 확인이 필요합니다.

멀티모달 측면에서 K3는 MoonViT-V2 비전 인코더(4.01억 파라미터)를 탑재한 네이티브 비전 모델입니다. 텍스트와 이미지를 함께 이해하고, 공식 블로그에서는 영상 이해도 가능하다고 밝힙니다. 문서 스캔, 표, 차트, 스크린샷을 읽는 작업에서 OmniDocBench 91.1을 기록했습니다.

Kimi 벤치마크 성능: 어디가 강하고 어디가 약한가

K3는 MMLU, HumanEval 같은 전통적인 정적 시험 점수를 새로 공개하지 않았습니다. 대신 장기 코딩·도구 사용·웹 조사 등 에이전트 과제 중심으로 Kimi 성능을 보고했습니다.

강한 영역: 에이전트·코딩·검색

벤치마크K3GPT-5.6 SolClaude Fable 5
BrowseComp (웹 검색)91.290.488.0
MCPMark (도구 사용)94.592.987.4
DeepSearchQA (조사)95.0—94.2
SWE-Marathon (장기 코딩)42.039.035.0
ProgramBench77.877.676.8
OmniDocBench (문서 시각)91.185.889.8

도구를 쓰며 긴 시간 작업하는 에이전트 과제, 웹 검색·조사, 문서 이해에서 최상위 폐쇄형 모델과 대등하거나 앞서는 수치를 보여줍니다.

뒤지는 영역

벤치마크K3GPT-5.6 SolClaude Fable 5
GPQA Diamond (추론)93.594.1—
DeepSWE (코딩)67.573.070.0
FrontierSWE (코딩)81.271.386.6
HLE-Full 도구사용 (추론)56.058.063.0

순수 추론 난이도가 높은 과제나 특정 코딩 벤치마크에서는 최강 폐쇄형 모델에 못 미칩니다. 전체적으로 “모든 면에서 앞선다”기보다는 에이전트·도구 사용·긴 맥락 작업에서 특히 강한 모델이라고 보는 게 정확합니다.

벤치마크마다 Kimi Code, Claude Code, Codex 등 서로 다른 에이전트 하네스가 사용됐습니다. 순수 모델 성능의 일대일 비교가 아니라, 에이전트 시스템 전체의 성능이라는 점을 감안해야 합니다.

주요 활용처

문샷AI가 공식적으로 내세우는 K3의 활용 영역은 다음과 같습니다.

코딩 에이전트: 대형 코드베이스 탐색, 버그 수정, 테스트 작성, 리팩터링. 낯선 저장소 구조를 파악하고 터미널 도구를 사용하며 장시간 엔지니어링 작업을 수행합니다. 독립 평가인 DeepSWE v1.1 리더보드에서 69%(±5%, 과제당 평균 비용 $4.65)를 기록했습니다.

문서 처리와 분석: 100쪽 계약서 버전 비교, 50쪽 PDF 번역, 긴 논문을 발표자료로 변환하는 작업을 문샷AI가 대표 사례로 제시합니다.

심층 리서치: 웹 검색과 데이터 수집을 결합한 조사 업무. BrowseComp 91.2, DeepSearchQA 95.0으로 검색·조사 과제에서 높은 점수를 보였습니다.

기업용 에이전트 플랫폼: Kimi Work는 Mac·Windows 데스크톱에서 동작하는 에이전트로, 작업 분해, 병렬 실행, 브라우저·도구 호출을 지원합니다. 최대 300개 서브에이전트로 구성되는 Agent Swarm도 제공합니다. 현재 베타 단계입니다.

직접 사용하는 방법

K3에 접근하는 경로는 세 가지입니다.

웹 챗

kimi.com에서 모델 선택에서 K3를 고르면 됩니다. Standard, Advanced, Extreme 추론 강도를 선택할 수 있고, 강도가 높을수록 크레딧 소모가 커집니다.

K3 웹 사용은 멤버십 크레딧에서 차감됩니다. 월 ¥49 / ¥99 / ¥199 / ¥699 네 단계의 멤버십이 있습니다. 무료 계정에 K3 할당량이 있는지는 공식 문서에서 명시하지 않았으므로, 무료로 쓸 수 있다고 단정하기 어렵습니다.

API

개발자는 platform.kimi.ai에서 API 키를 발급받아 사용합니다. OpenAI Chat Completions 형식과 Anthropic Messages 형식을 모두 지원합니다.

항목가격 (100만 토큰당)
입력 (캐시 미적중)$3.00
입력 (캐시 적중)$0.30
출력$15.00

API 사용에는 최소 $1 충전이 필요합니다. K3는 항상 thinking 모드로 동작하며, 추론 강도는 low / high / max 중 선택합니다.

오픈웨이트 다운로드

전체 모델 가중치는 Hugging Face에 공개돼 있습니다. 2026년 7월 27일에 공개됐으며, vLLM·SGLang 실행 예시도 모델 카드에 포함돼 있습니다.

다만 현실적으로 개인이 로컬에서 돌리기는 어렵습니다. 저장 용량만 약 1.56TB이고, 4비트 가중치 기준으로 추론에 약 1.4TB 이상의 VRAM이 필요합니다. 데이터센터 GPU를 여러 대 묶는 환경이 아니면 API를 쓰는 게 현실적입니다.

라이선스는 자체 Kimi K3 License로, MIT나 Apache 같은 무제한 오픈소스가 아닙니다. 일반적인 사용·수정·배포는 허용되지만, 연 매출 2,000만 달러 초과 사업자는 별도 계약이 필요합니다.

한국어는 UI와 대화 모두 지원합니다. 다만 한국어 전용 벤치마크 성능은 공개되지 않았으며, 한국에서의 가입·결제 가능 여부는 시점에 따라 다를 수 있으므로 직접 확인이 필요합니다.

누구에게 적합한가

K3가 특히 맞는 사용자는 이런 분들입니다.

  • 긴 문서를 자주 다루는 지식 노동자: 계약서, 논문, 보고서 묶음을 한 번에 올려놓고 비교·요약·변환하는 작업. 다만 100만 토큰 전체에서의 정확도에는 한계가 있으므로 핵심 수치는 별도 확인이 필요합니다.
  • 코딩 에이전트가 필요한 개발자: 대형 저장소 탐색, 장기 버그 수정, 자동화 스크립트 작성. SWE-Marathon에서 최상위 모델을 앞선 점이 눈에 띕니다.
  • 검색·조사 업무를 자동화하고 싶은 분: 웹 검색과 데이터 수집을 결합한 심층 리서치에서 BrowseComp, DeepSearchQA 모두 높은 점수를 기록했습니다.
  • API로 도구 사용형 워크플로를 구축하는 개발자: OpenAI·Anthropic 형식 호환, 100만 토큰 컨텍스트, 도구 호출 성능(MCPMark 94.5)이 강점입니다.

반대로, 순수 추론 난이도가 높은 과제에서 최고 성능이 필요하거나, 로컬에서 직접 모델을 돌리고 싶은 개인 사용자에게는 다른 선택지가 더 나을 수 있습니다. K3는 오픈웨이트이지만 실질적으로 데이터센터급 인프라가 필요하고, 일부 추론 벤치마크에서는 GPT-5.6 Sol이나 Claude Fable 5에 뒤집니다.

정리하면, Kimi K3는 “크고 빠른 모델”이 아니라 “도구를 쓰며 오래 일하는 에이전트”에 초점을 맞춘 모델입니다. 전통적인 시험 점수 경쟁 대신 실제 업무 자동화 과제에서 승부를 걸었고, 그 영역에서는 최상위 폐쇄형 모델과 견줄 만한 결과를 보여주고 있습니다.

당신을 위한 TOP 3 글 추천

라이너 스콜라 사용법과 후기: 논문 검색부터 인용까지 직접 써봤습니다

젠스파크 가격: AI 따로 구독하면 3만원 손해

러버블 AI란? 코딩 모르는 비개발자가 앱을 만들어 봤습니다

큐스페 새 글 알림 받기

필요한 AI 활용 글을 골라 이메일로 전해드립니다.

스팸 없이, 원할 때 언제든 해지할 수 있습니다.

댓글 남기기