Fable 5.1 정리: 성능, 가격, 코딩 능력과 실제 쓸 만한 작업

Fable 5.1이 나왔는데, 이전 Fable 5랑 뭐가 다른 건지, 비싼 값을 하는 건지 궁금한 분이 많습니다. 결론부터 말하면, 장기 에이전트 작업과 정밀 코드 리뷰에서는 확실히 달라졌고, 일상적인 작업에는 굳이 필요 없습니다.

Fable 5.1이 뭔가요

Anthropic이 2026년 9월 1일에 출시한 Claude 5세대 Fable 계열 모델입니다. API 모델 ID는 claude-fable-5-1이고, 복잡한 추론, 장시간 에이전트 작업, 대규모 코드베이스 처리가 주 용도입니다.

기본 사양은 이렇습니다.

항목수치
컨텍스트 창100만 토큰
최대 출력12만 8,000 토큰
입력텍스트, 이미지, PDF
출력텍스트
지식 기준일2026년 6월
추론적응형 thinking (항상 켜짐), effort 수준 조절 가능

파라미터 규모는 공개되지 않았습니다. “몇 B 파라미터”라는 숫자가 돌아다니면 공식이 아닙니다.

Fable 5 대비 뭐가 달라졌나

가격 구조가 바뀌었습니다. 기본 입·출력 단가는 같지만, 캐시 읽기 비용이 100만 토큰당 $1에서 $0.25로 75% 내려갔습니다. 반복적으로 긴 코드베이스를 읽는 에이전트 작업이라면 체감 비용 차이가 큽니다.

API 기능이 추가됐습니다. 메시지별 effort 변경, 한 턴짜리 시스템 메시지, 도구 호출 사이 진행 상황 업데이트가 베타로 들어왔습니다. 반면 tool_choice: any처럼 특정 도구 호출을 강제하는 기능은 지원하지 않아 400 오류가 납니다. 기존 API 통합에서 이걸 쓰고 있었다면 수정이 필요합니다.

안전장치 개입이 줄었습니다. Anthropic에 따르면 사이버 안전장치 개입은 세션당 약 60%, 의료·생물학 관련 오탐은 약 85% 줄었다고 합니다. 이전에 정상적인 보안 분석 요청이 막혔던 경험이 있다면 개선을 느낄 수 있는 부분입니다.

주의할 점도 있습니다. Fable 5.1은 긴 에이전트 루프에서 도구를 한 번에 병렬로 쓰기보다 한 턴에 하나씩 호출하는 경향이 생겼습니다. 정확도는 올라갈 수 있지만, 토큰 소비와 왕복 시간은 늘어날 수 있습니다.

Fable 5.1 성능: 벤치마크로 보면

Anthropic이 공개한 벤치마크 비교표입니다. 공급사 자체 평가이므로 독립 재현 결과와 동일시하면 안 됩니다.

평가Fable 5Fable 5.1변화
Terminal-Bench-Science 0.124.7%52.6%+27.9%p
Terminal-Bench 4.042.0%55.8%+13.8%p
AutomationBench17.1%31.4%+14.3%p
CursorBench 3.2.070.5%73.4%+2.9%p
OSWorld 2.0 (strict)36.1%41.7%+5.6%p
SWE-bench Pro80.0%81.2%+1.2%p

과학 에이전트(Terminal-Bench-Science)와 업무 자동화(AutomationBench)의 상승 폭이 가장 큽니다. 반면 SWE-bench Pro는 +1.2%p로 작고, CursorBench도 +2.9%p입니다. “코딩이 엄청 좋아졌다”보다는 “장기 에이전트 작업의 안정성과 성공률이 크게 올랐다”가 더 정확한 요약입니다.

Fable 5.1 코딩 능력은 어느 정도인가

코딩 관련 수치를 경쟁 모델과 나란히 놓으면 이렇습니다.

벤치마크Fable 5.1Opus 5GPT-5.6 Sol
CursorBench 3.2.073.4%70.0%67.2%
SWE-bench Pro81.2%79.2%64.6%
Terminal-Bench 4.055.8%52.3%37.3%

Agent Arena의 Code 보드에서도 Fable 5.1 Max가 순개선율 15.52%로 1위, GPT-6 Astra Max 13.14%, Opus 5 High 11.81%입니다. 이건 벤치마크가 아니라 실제 도구 사용 세션 집계라는 점에서 의미가 있습니다.

실제로 써 보면, 정밀한 코드 리뷰처럼 깊이 파고들어야 하는 작업에서 차이가 납니다. 다만 웬만한 수준의 코딩 작업은 GPT-6으로도 충분히 처리됩니다.

Fable 5.1 가격과 API 비용

항목가격 (100만 토큰당)
일반 입력$10
일반 출력$50
캐시 쓰기 (5분)$12.50
캐시 쓰기 (1시간)$20
캐시 읽기$0.25
Batch API 입력$5
Batch API 출력$25

Claude 무료 플랜에서는 Fable 5.1을 쓸 수 없습니다. Pro($20/월)에서는 사용량 크레딧으로 종량 과금되고, Max($100 또는 $200/월)에서는 주간 한도의 최대 50%까지 기본 포함됩니다.

Anthropic은 일반 워크로드 약 25%, 캐시 재사용이 많은 에이전트 작업은 최대 약 45%의 비용 절감을 추정합니다. 하지만 이건 회사 추정치이지 보장값은 아닙니다.

Opus 5, GPT-6 Astra와 비교하면

모델특징입력/출력 (100만 토큰)
Fable 5.1장기 에이전트·과학·코딩 최상위. 캐시 비용 최저$10 / $50
Opus 5Fable보다 약간 낮지만 근접한 성능. 절반 가격$5 / $25
GPT-6 Astra지능·코딩 지수 공동 선두. 과제당 비용 더 낮다는 독립 평가$10 / $50
Gemini 3.8 Flash절대 성능보다 속도·비용. 단순 작업에 강력$0.75 / $3.75

독립 기관 Artificial Analysis는 9월 평가에서 Fable 5.1과 GPT-6 Astra를 지능·코딩 에이전트 지수 공동 선두로 평가했고, 과제당 비용은 Astra가 더 낮다고 결론 냈습니다. “Fable이 압도적 1위”라기보다는, 최고 난도 작업에서 선두권이되 비용 효율의 정답은 아닌 위치입니다.

벤치마크상 심층 추론에서는 Fable 5.1이 약간 앞서지만, 가성비로 보면 밀립니다. 일상적인 수준의 작업이라면 GPT-6으로도 넘치는 게 현실입니다.

어떤 작업에 쓸 가치가 있는가

쓸 가치가 있는 경우:

  • 대규모 코드베이스를 반복적으로 읽으며 장시간 자율 코딩하는 에이전트 작업
  • 정밀한 코드 리뷰, 보안 분석처럼 깊이 파고들어야 하는 작업
  • 과학·연구용 장기 터미널 작업
  • 캐시 재사용이 많아서 $0.25/MTok 캐시 읽기 비용의 혜택을 크게 받는 구조

굳이 필요 없는 경우:

  • 짧은 질의응답, 일반적인 코딩, 요약 같은 일상 작업
  • 비용이 중요한 대량 에이전트 운영 (Opus 5나 Gemini 3.8 Flash가 더 경제적)
  • tool_choice: any에 의존하는 기존 API 통합 (수정 없이는 오류 발생)

Anthropic 공식 문서도 단순하고 짧은 작업에는 Opus 5부터 검토하라고 안내합니다. Fable 5.1은 “가장 비싸고 가장 잘하는 모델”이 아니라, 특정 유형의 복잡한 작업에서 성공률을 높이고 싶을 때 꺼내 쓰는 모델입니다.

당신을 위한 TOP 3 글 추천

라이너 스콜라 사용법과 후기: 논문 검색부터 인용까지 직접 써봤습니다

젠스파크 가격: AI 따로 구독하면 3만원 손해

러버블 AI란? 코딩 모르는 비개발자가 앱을 만들어 봤습니다

큐스페 새 글 알림 받기

필요한 AI 활용 글을 골라 이메일로 전해드립니다.

스팸 없이, 원할 때 언제든 해지할 수 있습니다.

댓글 남기기