본문으로 건너뛰기
AIMODEL

Claude Haiku 5.5: 입력 100만 토큰 $0.10, 가격은 90% 내리고 점수는 두 배 넘게

11 MIN READBY JJY
#Anthropic#Claude#Claude Haiku 5.5#소형 모델#LLM#API 가격#GPT-6 Luna#AI 에이전트

핵심 요약

Anthropic이 2026년 10월 7일(미국 시간) Claude Haiku 5.5를 공개했습니다. Claude API와 Amazon Bedrock, Google Cloud Vertex AI, Microsoft Azure에서 같은 날부터 쓸 수 있고, 모델 ID는 claude-haiku-5-5입니다. Anthropic은 이 모델을 "지금까지 가장 빠르고, 가장 싸고, 가장 똑똑한 소형 모델"이라고 소개했습니다.

숫자가 큽니다. 10만 토큰 이하 요청은 입력 100만 토큰당 $0.10, 출력 $0.50으로 Haiku 4.5보다 90% 쌉니다. 그런데 컴퓨터 사용 벤치마크 OSWorld 2.1(오프라인 부분집합)은 15.7%에서 72.4%로 뛰었습니다. 값은 내리고 성능은 올린, 소형 모델에서 보기 드문 조합입니다.

관련 글: ChatGPT에 GPT-6와 Intelligent UI: 답변이 글에서 화면으로 바뀐다

항목내용
발표일2026년 10월 7일 (미국 기준)
모델 IDclaude-haiku-5-5
제공처Claude API, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Azure
가격 (10만 토큰 이하)입력 $0.10, 출력 $0.50 (100만 토큰당)
가격 (10만 토큰 초과)입력 $0.50, 출력 $2.50 (100만 토큰당)
평균 비용Haiku 4.5 대비 약 75% 절감 (Anthropic 추정)
새 기능Haiku 계열 첫 effort(추론 강도) 조절

가격 구조: 10만 토큰을 기준으로 두 구간

이번 가격표의 특징은 요청 길이에 따라 단가가 갈린다는 점입니다. 프롬프트가 10만 토큰 이하면 싼 구간, 넘으면 비싼 구간이 적용됩니다.

항목 (100만 토큰당)Haiku 5.5 (≤10만)Haiku 5.5 (>10만)Haiku 4.5
입력$0.10$0.50$1.00
출력$0.50$2.50$5.00
캐시 읽기$0.01$0.05$0.10
캐시 쓰기$0.125$0.625$1.25

Haiku 4.5와 비교하면 짧은 요청은 90%, 긴 요청은 50% 내려갔습니다. Anthropic은 실제 작업 기준으로는 평균 약 75% 싸다고 추정합니다. 90%가 아니라 75%인 이유는 두 가지입니다. 긴 요청은 할인 폭이 작고, 새 토크나이저가 같은 작업에 토큰을 조금 더 씁니다. Anthropic 발표문은 이 토크나이저가 Sonnet 5.5, Opus 5.5와 비슷하다고 설명합니다.

VentureBeat에 따르면 Haiku 4.5 요청의 약 90%가 10만 토큰 이하 구간에 들어갑니다. 대부분의 기존 사용자는 싼 구간을 적용받는다는 뜻입니다. 정확히 10만 토큰짜리 요청이 어느 구간으로 계산되는지는 발표 자료에 나와 있지 않다고 VentureBeat는 짚었습니다.

경쟁 소형 모델과 단가

VentureBeat가 정리한 표준 단가를 옮기면 이렇습니다. 가격만 비교한 표이고 성능은 반영하지 않았습니다.

모델입력출력비고
Claude Haiku 5.5$0.10$0.5010만 토큰 이하
OpenAI GPT-6 Luna$0.10$0.5027.2만 토큰 초과 입력은 더 비쌈
Gemini 3.5 Flash-Lite$0.30$2.50표준 가격
Gemini 3.8 Flash$0.75$3.752026년 12월 31일까지 프로모션 가격
Claude Sonnet 5.5$2.00$10.00참고용

짧은 요청 기준으로 Haiku 5.5는 GPT-6 Luna와 캐시 단가까지 똑같습니다. 우연으로 보긴 어렵습니다. 가격을 맞춘 상태에서 벤치마크로 승부를 걸겠다는 계산이 읽힙니다.

벤치마크: Luna는 넘고 Sonnet 5.5엔 못 미친다

Anthropic이 발표문에 실은 표입니다. 모두 Anthropic 자체 측정이고, 외부 재현은 아직 없습니다. 세부 방법론은 Haiku 5.5 시스템 카드에 있다고 합니다.

벤치마크Haiku 5.5Haiku 4.5GPT-6 LunaSonnet 5.5
GDPval-AA v2.1 (지식 노동, Elo)1,6207351,4371,840
AA-Briefcase v1.1 (지식 노동, Elo)1,5786141,3361,824
OSWorld 2.1 오프라인 부분집합 (컴퓨터 사용)72.4%15.7%48.9%83.9%
Terminal-Bench 4.0 (에이전트 코딩)39.2%0.0%16.4%70.6%
FrontierCode 1.1 Main (에이전트 코딩)46.4%—42.4%52.1% (Xhigh)
Humanity's Last Exam, 도구 없음45.9%10.2%—56.9%
Humanity's Last Exam, 도구 사용57.4%18.7%—64.5%
Chartography, 도구 없음 (시각 추론)46.4%6.4%29.1%61.6%

표만 보면 결론은 단순합니다. 공개된 모든 항목에서 Haiku 4.5와 GPT-6 Luna를 앞서고, Sonnet 5.5에는 모두 뒤집니다.

가장 눈에 띄는 줄은 Terminal-Bench 4.0입니다. Haiku 4.5가 0.0%였던 테스트에서 39.2%가 나왔습니다. 다만 VentureBeat는 이 점수가 최대 effort에서 나온 값이고, 기본값인 medium effort에서는 약 20%라고 전했습니다. 벤치마크 점수를 그대로 비용 계산에 대입하면 안 되는 이유입니다.

effort 조절: Haiku에서 처음

Haiku 5.5는 Haiku 계열 처음으로 effort 설정을 지원합니다. 발표문 차트에는 Low, Med, High, Xhigh, Max 다섯 단계가 나옵니다. effort를 올리면 더 오래 생각하고 토큰도 더 씁니다.

결국 "Haiku 5.5의 가격"은 하나가 아닙니다. 같은 모델이라도 effort를 Max로 두면 토큰 사용량이 늘어 75% 절감 폭이 줄어들 수 있습니다. 실제로 얼마나 늘어나는지는 공개 자료에 수치가 없습니다.

어디에 쓰라는 모델인가

Anthropic은 Haiku 5.5의 자리를 분명하게 정했습니다. 요약, 컨텍스트 압축(compaction), 데이터베이스 조회, 분류 같은 대량·저비용 작업이 첫째입니다. 고객 상담 실시간 응답과 브라우저 조작처럼 속도가 중요한 일이 둘째입니다.

코딩에서는 주연이 아니라 조연입니다. Opus 5.5나 Sonnet 5.5가 큰 작업을 맡고, Haiku 5.5는 그 아래에서 서브에이전트로 조회와 요약을 처리하는 구도입니다. 복잡한 에이전트 코딩에는 여전히 Sonnet 5.5와 Opus 5.5가 낫다고 Anthropic 스스로 적었습니다.

속도에 대해선 단서가 붙습니다. 각 모델의 표준 속도끼리 비교하면 Haiku 5.5가 Anthropic 모델 중 가장 빠르지만, Fast Mode로 돌리는 Opus 모델보다는 느립니다. 초당 토큰 수 같은 구체적 수치는 공개되지 않았습니다.

고객사 테스트 결과

발표문에 실린 고객사 평가입니다. 각 회사가 제공한 자체 평가라 회사 간 비교는 어렵습니다.

회사보고 내용
Asana지연 시간 30% 이상 감소, 에이전트 한 턴당 추론 최대 2.5배 빠름
HubSpot자체 CRM 평가에서 3회 평균 92.8%, 지금까지 본 최고 점수
AlphaSense400개 질의에서 0.84로 Haiku 4.5(0.76) 대비 통계적으로 유의한 개선
BoxHaiku 4.5보다 11점 높고 지연 시간은 약 절반
CognitionDevin Fusion에서 FrontierCode 66.2점 유지, 비용과 지연은 감소

Rogo의 Alex Wang은 Haiku를 서브에이전트로 쓰는 이유를 이렇게 말했습니다. "믿고 맡길 만큼 정확하고, 여러 번 돌릴 만큼 빠르고 쌉니다." 큰 모델이 재무 프레젠테이션을 만드는 동안 Haiku가 매출 수치 하나를 찾아오는 식입니다.

함께 바뀐 것들

Haiku 5.5 발표에 몇 가지 변경이 같이 묶여 나왔습니다.

  • Sonnet 5.5 캐시 읽기 인하: 100만 토큰당 $0.20에서 $0.10으로 절반이 됐습니다. Anthropic은 대부분의 에이전트 작업에서 Sonnet 5.5 비용이 약 20% 줄어든다고 추정합니다.
  • 구독자 API 크레딧: Max 5x는 매달 $100, Max 20x는 $200, Team은 최대 $500을 팀 공용으로 받습니다. VentureBeat에 따르면 크레딧은 모든 모델에 쓸 수 있습니다.
  • SDK 업데이트: Python과 TypeScript SDK에 컴퓨터 사용과 브라우저 사용이 베타로 들어갔습니다.

보안 제한은 Haiku 4.5보다 엄격

사이버보안 관련 안전장치는 Haiku 4.5보다 엄격하고, 다른 최신 모델보다는 느슨하다고 Anthropic은 밝혔습니다. Sonnet 5.5보다 방어 목적 작업을 더 허용하지만, 침투 테스트처럼 공격자가 쓸 가능성이 큰 기법은 막습니다. 더 넓은 접근이 필요한 조직은 Cyber Verification Program에 신청해야 합니다.

정렬(alignment) 측면에서는 Haiku 4.5보다 부적절한 행동이 크게 줄고, 오용 요청에 협조하는 경향도 낮아졌다고 설명했습니다. 생물학 관련 안전장치는 Sonnet 5, Sonnet 5.5, Opus 5와 같은 수준입니다.

필자의 시각: 소형 모델 경쟁은 이제 "가격 동률"에서 시작한다

아래는 발표 자료를 읽고 정리한 개인적인 해석입니다.

Haiku 5.5와 GPT-6 Luna가 입력 $0.10, 출력 $0.50으로 같은 값에 섰습니다. 소형 모델 시장에서 가격은 더 이상 차별점이 아니라 입장권이 된 셈입니다. 그다음 승부처는 같은 값으로 에이전트 작업을 얼마나 끝까지 해내느냐입니다. Anthropic이 OSWorld와 Terminal-Bench를 표 맨 앞에 둔 것도 그 때문이라고 봅니다.

실무에서 볼 지점은 두 가지입니다. 첫째, 10만 토큰 경계입니다. 긴 문서를 한 번에 넣는 파이프라인이라면 할인 폭이 50%로 줄어드니, 청크를 나누는 편이 더 싼지 계산해 볼 만합니다. 둘째, effort입니다. 벤치마크 점수는 Max에서, 가격 절감은 기본값 기준에서 나온 숫자일 가능성이 있습니다. 둘을 같은 줄에 놓고 비교하면 기대가 어긋납니다.

Haiku 4.5를 서브에이전트로 쓰고 있다면 지금 바로 할 일은 하나입니다. 같은 작업 로그 몇백 건을 Haiku 5.5의 medium effort로 다시 돌려 보고, 토큰 수와 성공률을 나란히 적어 보는 겁니다.

참고

Share
JJY
// AUTHORJJY

AI · WEB SECURITY · DEV ENV

GH

새 글 알림 받기

스팸 없이 새 포스트만 전달합니다.

// RELATED

관련 포스트