본문으로 건너뛰기
HOTAIMODEL

Qwen3.7-Max: 35시간 자율 실행, 중국 AI가 프론티어를 넘보다

6 MIN READBY JJY
#Alibaba#Qwen3.7#AI 에이전트#코딩 에이전트#중국 AI#LLM#벤치마크#SWE-bench

핵심 요약

2026년 5월 20일, 알리바바는 항저우 Alibaba Cloud Summit에서 Qwen3.7-Max를 공개했다. 이 모델이 주목받는 이유는 단순한 벤치마크 점수가 아니다. 35시간 연속 자율 실행과 1,158회의 도구 호출이라는 실제 작업 기록 때문이다. Anthropic API 프로토콜을 네이티브로 지원해 Claude Code 같은 기존 도구에 설정 변경 없이 바로 연결할 수 있다.

공식 발표 기준으로 SWE-bench Verified 80.4%, MCP-Atlas 76.4로 Claude Opus 4.6 Max와 거의 동급이다. Artificial Analysis의 AI 인텔리전스 인덱스에서 글로벌 151개 모델 중 5위, 중국 모델 중에서는 1위다.

관련 글: Grok Build: xAI의 터미널 코딩 에이전트, Claude Code에 도전장을 내밀다

35시간이라는 숫자

코딩 에이전트의 진짜 병목은 성능이 아닌 지속성이다.

복잡한 소프트웨어 작업은 수백 번의 연속된 판단과 수정을 요구한다. 지금까지 대부분의 에이전트는 컨텍스트가 끊기거나 방향을 잃으며 수십 분, 길어야 몇 시간 안에 멈췄다. 알리바바 공식 블로그에 따르면 Qwen3.7-Max는 GPU 커널 최적화 작업에서 35시간 동안 자율 실행하며 1,158번의 도구 호출을 완료했다. Triton 레퍼런스 대비 10배 속도 향상, Kernel Bench L3 기준 중간값 1.98배, 96% 승률이다.

이 수치는 내부 테스트 결과지만, 알리바바가 공개적으로 발표했다는 점에서 검증 가능한 기준점이 된다. 35시간이라는 숫자 자체가 에이전트 설계의 새로운 기준을 제시하고 있다.

벤치마크: 프론티어와의 실제 거리

알리바바 Cloud 공식 발표 기준 주요 벤치마크를 정리하면 아래와 같다.

벤치마크Qwen3.7-MaxClaude Opus 4.6 MaxDeepSeek V4-Pro Max
SWE-bench Verified80.4%80.8%80.6%
MCP-Atlas76.475.8
MCP-Mark60.8
Terminal Bench 2.069.767.9

SWE-bench에서 Claude Opus 4.6 Max와 0.4%p 차이, MCP-Atlas에서 오히려 0.6포인트 앞선다. Claude Opus 4.6이 4월 기준 글로벌 최고 수준의 코딩 모델이다. 이 영역에서 동률 수준의 수치가 나온다는 사실은 단순한 추격이 아니다.

수학 추론 성능에서는 차이가 더 크다. 여러 독립 분석 서비스에 따르면 GPQA Diamond 92.4로 Claude Opus 4.6 Max(91.3)를 앞서고, Apex Math Reasoning에서는 44.5로 Claude Opus 4.6 Max(34.5)보다 10포인트 높다. GPT-5.5(93.6)와는 1.2포인트 차이다.

Anthropic API를 레일로 쓴다

Qwen3.7-Max가 Anthropic API 프로토콜을 네이티브로 지원한다는 사실은 전략적으로 읽어야 한다.

현재 AI 에이전트 생태계에서 Anthropic API는 사실상 표준 인터페이스에 가깝다. Claude Code, OpenClaw, 수많은 MCP 클라이언트가 이 프로토콜 위에서 동작한다. Qwen3.7-Max가 여기에 drop-in 호환성을 제공한다는 건 기존 인프라를 손대지 않고 모델만 교체해 볼 수 있다는 뜻이다.

xAI의 Grok Build가 자체 ACP 프로토콜을 밀어붙이는 것과 방향이 다르다. Qwen3.7-Max는 기존 생태계를 경쟁 대상으로 보지 않고 레일을 그대로 빌려 탄다. 중국 AI 모델의 글로벌 채택에서 가장 큰 장벽은 성능이 아닌 통합 비용이었다. 이 문제를 Anthropic 호환성으로 직접 해소한 셈이다.

라인업: Max와 Plus

알리바바는 이번에 두 가지 모델을 공개했다.

Qwen3.7-Max는 텍스트 전용 플래그십이다. 클로즈드 웨이트, API 전용으로 제공된다. 컨텍스트 윈도우는 100만 토큰, 입력 $2.50/1M 토큰이다. Claude Opus 4.6 Max($15/1M)에 비해 6분의 1 수준이다.

Qwen3.7-Plus는 멀티모달 버전으로 비전(이미지 처리) 기능을 포함한다. 가격과 세부 사양은 별도 발표 예정이다.

성능이 유사하고 가격이 6배 낮다는 조합은 비용에 민감한 에이전트 워크로드에 직접적인 선택지를 만든다. 동시에 현재는 오픈소스 공개 계획이 없다. Alibaba Cloud Model Studio를 통한 API 접근만 가능하다.

맥락: 중국 AI의 위치

Qwen3.7-Max 이전까지 글로벌 AI 인덱스 상위권은 사실상 서방 모델이 독점했다. DeepSeek이 오픈소스 영역에서 균열을 냈고, Qwen3.7-Max는 클로즈드 플래그십 영역에서 같은 도전을 시도한다.

수학과 추론에서의 수치는 훈련 접근법의 차이를 반영한다. Qwen 팀은 강화학습 기반 수학 최적화에 집중해왔다. 이 강점이 Apex Math 44.5(Claude Opus 4.6 34.5 대비 +10) 같은 수치로 이어졌다.

코딩 에이전트 영역에서는 SWE-bench 기준으로 이미 동점 수준이다. Anthropic API 호환으로 진입 장벽을 낮췄고, 가격 격차가 시험 채택을 유도할 것이다.

전망

Qwen3.7-Max 공개 이후 주목해야 할 변수는 두 가지다.

하나는 Qwen3.7-Plus의 멀티모달 성능이다. 비전 기능을 포함한 에이전트 작업에서 GPT-5.4 Pro, Claude Opus 4.7과 어떻게 비교되는지가 실제 채택을 결정할 가능성이 높다.

다른 하나는 오픈소스 공개 여부다. Qwen 시리즈는 이전 버전까지 지속적으로 오픈소스로 공개해왔다. 이번에도 그 흐름을 이어간다면, 오픈소스 에이전트 생태계에서의 파급력은 지금보다 훨씬 넓어질 것이다. 가격 장벽도 없고, 커스터마이징 자유도도 높다.

35시간 자율 실행은 현재로서는 알리바바 내부 실험 결과다. 이 숫자가 실제 기업 환경에서 재현된다면, 에이전트 워크로드의 경제학 자체가 바뀐다.

참고

Share
JJY
// AUTHORJJY

AI · WEB SECURITY · DEV ENV

GH

새 글 알림 받기

스팸 없이 새 포스트만 전달합니다.

// RELATED

관련 포스트