본문으로 건너뛰기
HOTAIMODEL

Claude Opus 4.8: '가장 정직한' 프론티어 모델과 1,000개 서브에이전트의 데뷔

10 MIN READBY JJY
#Anthropic#Claude Opus 4.8#Dynamic Workflows#Claude Code#SWE-bench#Mythos#alignment#AI 모델

핵심 요약

Anthropic이 5월 28일 Claude Opus 4.8을 공개했습니다. Opus 4.7이 나온 지 41일 만의 후속작이고, 가격($5/$25 per 1M tokens)은 그대로입니다.

세 가지가 눈에 띕니다. SWE-bench Pro 69.2%(전 세대 64.3%)로 GPT-5.5를 12개 벤치마크에서 앞섰고, Fast Mode는 3배 저렴해졌으며, 최대 1,000개 서브에이전트를 자동으로 굴리는 다이내믹 워크플로가 Claude Code에 들어왔습니다. 결정타는 정렬 점수입니다. Opus 4.8은 안전 평가에서 Claude Mythos Preview와 동급에 도달했습니다. 일반 공개 모델로는 처음입니다.

같은 날 Anthropic은 Series H로 650억 달러를 모으며 기업가치 9,650억 달러를 찍었습니다. OpenAI를 사모 시장 기준으로 추월한 셈입니다.

관련 글: Claude Opus 4.7, 능력을 일부러 줄인 최초의 프론티어 모델

41일 만의 후속작과 GPT-5.5를 넘는 벤치마크

Opus 4.7이 4월 17일이었고, 4.8이 5월 28일입니다. 41일. 6주 주기로 정착하는 분위기입니다. OpenAI의 GPT-5.5가 5월 초 정식 출시된 후 코딩 벤치마크에서 우위를 가져갔다는 평가가 나오던 시점에 맞춰 나온 응수입니다.

수치로 보겠습니다.

벤치마크Opus 4.8Opus 4.7GPT-5.5
SWE-bench Verified88.6%87.6%비공개
SWE-bench Pro69.2%64.3%미달
Terminal-Bench 2.174.6%66.1%우위
GDPval-AA (Elo)189017691769

GDPval에서 Opus 4.8은 GPT-5.5보다 121 Elo 앞섭니다. Anthropic은 "지식 노동, 코딩(이슈 단위), 에이전트 도구 사용, 롱 컨텍스트 등 최소 12개 벤치마크에서 GPT-5.5 일반 모델을 앞섰다"고 밝혔습니다. 다만 터미널 코딩 벤치마크에서는 GPT-5.5가 여전히 1위를 지킨다는 The Decoder의 분석이 있습니다.

Super-Agent라는 종합 벤치마크에서는 Opus 4.8이 모든 케이스를 끝까지 완수한 유일한 모델로 기록됐습니다. GPT-5.5와 동급 비용으로요.

다이내믹 워크플로: 1,000개 서브에이전트의 자동 오케스트레이션

가장 큰 신기능은 Claude Code에 추가된 다이내믹 워크플로(Dynamic Workflows)입니다. 리서치 프리뷰 단계입니다.

구조는 이렇습니다. 사용자가 자연어로 작업을 지시하면, Claude가 그 작업을 수행할 JavaScript 스크립트를 직접 작성합니다. 그 스크립트는 백그라운드 런타임에서 실행되면서 서브에이전트들을 병렬로 분기시킵니다. 한 에이전트가 가설을 세우면, 다른 에이전트가 그 가설을 반박합니다. 결과가 수렴할 때까지 반복되고, 최종 응답은 검증을 거친 뒤 사용자에게 전달됩니다.

용량 제한이 흥미롭습니다. 동시 실행은 최대 16개, 한 번의 실행에서 누적되는 총 에이전트 수는 1,000개. Anthropic은 이 정도 규모면 "수십만 라인 규모의 코드베이스를 통째로 다른 언어로 마이그레이션"할 수 있다고 설명했습니다.

요구사항도 정리하면:

  • Claude Code v2.1.154 이상
  • CLI, 데스크톱, VS Code 확장 모두 지원
  • Max·Team·Enterprise 플랜에서 사용 가능
  • Max·Team에서는 기본값으로 켜져 있음

지금까지의 "에이전트가 도구를 호출한다" 수준이 아닙니다. "에이전트가 다른 에이전트를 만들고 관리하는 메타 오케스트레이터" 단계입니다. 이런 구조는 보통 LangGraph 같은 외부 프레임워크가 담당하던 영역인데, 모델 제공사가 런타임까지 통째로 묶어서 제공한다는 점이 변화입니다.

Fast Mode 3배 인하, Effort Control 추가

Fast Mode는 가격 정책 측면에서 인상적입니다. Opus 4.7과 4.6 시절 Fast Mode는 100만 토큰당 입력 30달러, 출력 150달러였습니다. Opus 4.8에서는 10달러, 50달러로 떨어졌습니다. 정확히 3분의 1입니다.

속도는 2.5배. 즉 프론티어 모델을 2.5배 빠르게, 3배 싸게 쓸 수 있게 됐다는 뜻입니다. Claude Code에서 /fast 명령으로 즉시 토글할 수 있고, Pro·Max·Team·Enterprise 구독자라면 모두 접근 가능합니다.

여기에 더해진 것이 Effort Control입니다. 모델이 한 응답에 얼마나 깊이 사고할지를 사용자가 직접 조절하는 기능입니다.

레벨용도
low단순 응답, 토큰 절약
high (기본값)Opus 4.7 기본값과 유사한 토큰 사용, 더 나은 성능
extra더 깊은 추론
max최대 사고 시간 (API에서는 xhigh로 노출)

토큰 단가는 effort 레벨에 관계없이 동일합니다. 깊이 생각하면 토큰을 더 쓸 뿐, 별도 요금이 붙지 않습니다. 사실상 "어디까지 생각시킬지"를 사용자에게 위임한 구조입니다.

'가장 정직한 모델': Mythos급 정렬을 일반 모델에 가져왔다

Anthropic이 이번 릴리스에서 가장 강조한 것은 정직성입니다. 마케팅 카피가 아니라 실제 평가 결과가 따라옵니다.

핵심 수치 세 가지를 보겠습니다.

첫째, Opus 4.8은 자기가 작성한 코드에 결함이 있을 때 그것을 짚지 않고 넘어갈 확률이 Opus 4.7보다 약 4배 낮습니다. 코드를 던져주고 "다 됐다"고 답하는 빈도가 줄었다는 뜻입니다.

둘째, "결함 있는 결과를 비판 없이 보고하는" 평가에서 Opus 4.8은 0%를 기록했습니다. 역대 Claude 모델 중 처음입니다.

셋째, 기만이나 오용 협조 같은 오정렬(misalignment) 행동의 빈도가 Opus 4.7보다 크게 낮고, Claude Mythos Preview와 비등한 수준에 도달했습니다. Mythos는 사이버보안 능력 때문에 일반 공개되지 않은, Anthropic이 보유한 가장 잘 정렬된 모델입니다. 일반 출시 모델이 Mythos 등급 정렬 평가에 진입한 것은 처음입니다.

Anthropic의 정렬팀은 "사용자 자율성 존중과 사용자 최선의 이익을 위한 행동 같은 친사회적 특성 측정에서 새로운 최고치"라고 평가했습니다. The Next Web의 보도에 따르면, Anthropic은 "Mythos 본 출시까지 몇 주 안에" Opus 4.8 수준의 안전장치를 갖춘 다음 모델을 내놓을 계획입니다.

정직성을 마케팅 포인트로 내세우는 모델이라는 사실 자체가 시장의 변화를 보여줍니다. 코딩 성능 1위를 더 이상 단독으로 자랑할 수 없게 된 상황에서 차별점을 옮기는 중입니다.

출시 당일 $65B 펀딩, Anthropic이 OpenAI를 넘었다

같은 5월 28일, Anthropic은 Series H 라운드로 650억 달러를 모았다고 공식 발표했습니다. 포스트 머니 기업가치는 9,650억 달러입니다. 사모 시장 기준으로 OpenAI를 추월했습니다.

라운드 구성:

  • 리드: Altimeter Capital, Dragoneer, Greenoaks
  • 공동 리드: Sequoia Capital, Capital Group, Coatue, D1 Capital Partners
  • 자금 용도: 컴퓨트 인프라 추가 확보

5월 초 분기 매출 109억 달러로 첫 영업흑자를 예고한 데 이어 한 달 만에 런레이트 매출이 470억 달러를 돌파했다는 수치가 함께 공개됐습니다. 80배 성장 곡선의 정점에서, Anthropic은 모델·돈·정렬 세 가지를 동시에 시장에 던졌습니다.

TheStreet은 이번 출시의 타이밍을 IPO 경쟁의 신호로 해석했습니다. OpenAI가 같은 시기에 1,220억 달러 펀딩 라운드를 마무리하면서 8,520억 달러 밸류에이션을 받았기 때문입니다. 두 회사가 사모 시장의 마지막 라운드를 동시에 정리하고 공모 시장 진입을 준비 중이라는 시각이 우세합니다.

같은 날 GitHub Copilot은 Opus 4.8을 일반 가용 모델로 즉시 추가했습니다. 1차 배포 채널을 GitHub Copilot에 통째로 묶는 전략은 분명합니다. 개발자 시장의 디폴트 자리를 가장 빠르게 확보하겠다는 의미입니다.

전망

개인적으로 두 가지를 주목하고 있습니다.

첫째는 6주 주기 사이클이 굳어지는지입니다. Opus 4.6, 4.7, 4.8이 모두 약 41~45일 간격으로 나왔습니다. 이 속도가 유지된다면, 7월 초에 Opus 4.9 또는 Mythos 본 출시가 예상됩니다. Mythos가 일반 공개로 풀린다면 사이버 보안 산업 전체의 패러다임이 바뀝니다. 이미 Glasswing 파트너십에서 10,000개 이상의 고위험 취약점을 발견한 모델입니다.

둘째는 다이내믹 워크플로가 만들 새로운 SaaS 카테고리입니다. 한 번의 명령으로 16개 에이전트가 병렬로 코드베이스 마이그레이션을 진행하는 환경이 표준이 되면, 기존 컨설팅 회사의 마이그레이션 사업 모델은 흔들립니다. 동시에 LangChain·LangGraph 같은 오케스트레이션 프레임워크의 자리도 좁아집니다. 모델 제공사가 런타임을 통째로 가져가는 흐름이 가속화될 것입니다.

오늘 당장 할 수 있는 일은 단순합니다. Claude Code v2.1.154로 업데이트하고 /fast로 한 번 토글해 보는 것. 같은 작업이 얼마나 빠르고 얼마나 싸게 끝나는지가 체감되면, 이 릴리스의 무게가 와닿을 겁니다.

참고

Share
JJY
// AUTHORJJY

AI · WEB SECURITY · DEV ENV

GH

새 글 알림 받기

스팸 없이 새 포스트만 전달합니다.

// RELATED

관련 포스트