본문으로 건너뛰기
HOTAIMODEL

Gemini 4 Argon: Google DeepMind가 사이버 디펜더에게 먼저 쥐여준 프런티어 모델

9 MIN READBY JJY
#Gemini 4#Gemini 4 Argon#Google DeepMind#Fairwind Program#CWE-bench#DeepSWE#AI 보안#프런티어 모델

핵심 요약

Google DeepMind가 2026년 9월 30일 Gemini 4 Argon을 공개했습니다. Gemini 3 이후 11개월 만의 세대 교체이자, 2026년 Google의 첫 프런티어급 모델입니다.

일반 공개 모델과 달리 Argon은 소비자 ChatGPT 경쟁 라인으로 바로 풀리지 않았습니다. Fairwind Program에 등록된 사이버 디펜더에게 먼저 쥐여주고, 그 다음 유료 API 고객과 Google AI Ultra 구독자, 마지막으로 일반 사용자로 흘려보내는 단계적 롤아웃을 택했습니다.

핵심 숫자 네 가지. CWE-bench v1 **68%**로 공동 1위, DeepSWE v1.1 77.9%, 컨텍스트 윈도우와 최대 출력 모두 100만 토큰, 그리고 프로모션 가격 입력 100만 토큰당 $2, 출력 $10입니다.

무엇을 공개했나

Gemini 4 Argon은 Google DeepMind의 새 프런티어 모델 라인업의 첫 멤버입니다. 공식 블로그 포스트는 9월 30일에 올라왔고, Google은 Argon을 "소프트웨어 엔지니어링, 엔터프라이즈 업무, 사이버 보안"을 겨냥한 모델로 포지셔닝했습니다.

입력은 텍스트와 이미지, 출력은 텍스트입니다. 멀티모달 출력(이미지, 비디오)은 이번 릴리스에 포함되지 않았습니다. 대신 컨텍스트 윈도우를 100만 토큰으로 유지하면서 최대 출력 토큰을 6만 4천에서 100만으로 확장했습니다. 긴 보고서나 대규모 리팩터링을 한 번의 응답으로 끝낼 수 있는 수치입니다.

이름이 Argon(아르곤)으로 바뀐 점도 눈여겨볼 지점입니다. Gemini 3 Pro, Gemini 3.5 Pro 같은 숫자 기반 버저닝 대신 원소 코드명을 쓴다는 건, 하나의 세대 안에서 여러 변종을 병렬로 운용하겠다는 신호로 읽힙니다. 실제 로드맵의 다음 멤버 코드명은 아직 공개되지 않았습니다.

Fairwind Program이 뭐길래 먼저 풀렸나

Fairwind Program은 Google DeepMind가 "가장 능력 있는 모델"을 중요 인프라를 방어하는 조직들에 선제적으로 제공하는 프로그램입니다. 지금 650곳 이상의 파트너가 이 프로그램에 들어가 있다고 Google은 밝혔습니다.

접근 우선순위는 네 층위입니다.

  • 각국 정부 및 국가 사이버 보안 기관
  • 의료, 통신, 에너지, 금융 등 중요 인프라 운영사
  • 대형 테크 플랫폼
  • 그 외 검증된 보안 연구팀

바꿔 말하면, 민간 개발자가 지금 당장 Argon에 접근할 수 있는 공식 경로는 없습니다. 유료 API 티어가 열릴 때까지, 그리고 Google AI Ultra 구독으로 소비자 UI에 들어올 때까지 기다려야 합니다. Google은 "최대한 빨리 넓히겠다"고 했지만 구체적 일정은 밝히지 않았습니다.

왜 이런 결정을 했을까. 공식 설명은 "공격 쪽이 아니라 방어 쪽에 기술 우위를 먼저 주기 위해서"입니다. Argon이 취약점을 자율적으로 발견, 검증, 패치할 수 있다는 주장을 Google이 함께 내놓았기 때문에, 같은 능력이 공격자 손에 먼저 들어가는 상황을 피하려는 포지셔닝으로 해석됩니다.

벤치마크 숫자 뜯어보기

Google이 발표한 Argon의 벤치마크 점수는 다음과 같습니다. 모두 Google이 자체적으로 보고한 수치이며, 외부 재현 결과는 발표 시점에 공개되지 않았습니다.

벤치마크Argon 점수의미
CWE-bench v168%공동 1위 (취약점 패치)
DeepSWE v1.177.9%실세계 소프트웨어 엔지니어링 1위
Vals Index68.9%종합 지능 지표 1위
AutomationBench (Zapier)51.3%업무 자동화 1위
LVBench91.7%긴 비디오 이해
FrontierSWE v2(뒤처짐)Google은 수치 비공개
Terminal-Bench 4.0(뒤처짐)Google은 수치 비공개

주목할 지점은 두 가지입니다.

첫째, CWE-bench v1 공동 1위가 사이버 디펜더 선공개 전략의 근거입니다. CWE-bench는 모델이 보안 취약점을 얼마나 잘 수정하는지 측정합니다. Argon이 다른 프런티어 모델들과 어깨를 나란히 하는 수준이라는 뜻이고, 자율 패치가 과장이 아닐 수 있다는 신호입니다.

둘째, 18개 벤치마크 중 12개에서 GPT-6 Astra와 Claude Opus 5.5를 앞섰다는 Google의 요약 발언입니다. 뒤집어 말하면 6개에서는 뒤처졌습니다. FrontierSWE v2와 Terminal-Bench 4.0처럼 가장 어려운 코딩 평가에서 Argon이 1위가 아니라는 점을 Google 스스로 인정한 셈입니다.

가격과 접근 조건

Argon은 유료 API에 들어올 때 다음 가격표를 적용합니다. 처음 공개 시점은 프로모션 요율입니다.

  • 프로모션: 입력 $2 / 출력 $10 (100만 토큰 기준)
  • 정상가: 입력 $4 / 출력 $20
  • 캐시된 입력: 입력 토큰 가격의 5% (프로모션 기준 $0.10)

프로모션 종료 시점은 발표하지 않았습니다. GPT-6 Astra의 공개 가격이 입력 $10, 출력 $50라는 점을 고려하면, 프로모션 가격은 Astra 대비 입력 80%, 출력 80% 저렴합니다. 정상가로 올라가도 입력 60%, 출력 60% 저렴한 수준을 유지합니다.

Google AI Ultra 구독자는 소비자 Gemini 앱에서 Argon을 쓸 수 있습니다. 월정액 구독에 Argon을 끼워 넣는 전략은, 토큰 과금 중심인 OpenAI와 다른 접근입니다.

왜 지금 이 모델인가

Gemini 4 Argon 공개는 OpenAI DevDay 2026 다음 날 벌어진 일입니다. OpenAI는 9월 29일에 20개 이상의 발표를 쏟아냈고, 이 중 GPT-6 Astra 기반의 자율 에이전트 'dots', 저렴한 코딩 모델 GPT-6.1 Sol이 포함됐습니다. Anthropic은 Claude Opus 5.5(9월 22일), Sonnet 5.5(9월 28일)를 연달아 공개한 상태입니다.

Google의 선택은 같은 소비자 전쟁터로 뛰어들지 않는 것이었습니다. 대신 Argon을 "방어자용 프런티어 모델"로 묶어 내놓았습니다. 이 포지셔닝은 두 가지 효과를 노립니다.

  • 공격·방어 비대칭을 선점하는 보안 서사
  • 공공 부문과 대형 엔터프라이즈 영업 채널 확보

둘 다 Nvidia GB300·OpenAI AMD 6GW 딜 같은 인프라 뉴스 뒤에 가려지기 쉬운 영역입니다. Argon은 그 틈을 공략하는 모델입니다.

짚고 넘어갈 것들

제한 사항은 분명합니다.

벤치마크는 모두 Google 자체 보고입니다. 독립 재현 결과가 나오기 전까지 수치를 그대로 믿기는 어렵습니다. 특히 DeepSWE v1.1 77.9%는 GPT-6 Astra와 Claude Opus 5.5의 공개 점수를 앞서는 수치이기 때문에, 외부 벤치마커들이 재현에 들어갈 가능성이 높습니다.

멀티모달 출력 부재도 짚을 지점입니다. 경쟁 모델들은 이미지, 비디오, 음성 출력을 통합하는 방향으로 가고 있지만, Argon은 텍스트 출력만 지원합니다. Google은 이 결정에 대해 "엔터프라이즈 안정성 우선"이라는 설명을 내놓았지만, 다음 Gemini 4 변종에서 멀티모달 출력이 추가될지는 미공개입니다.

마지막으로, 사이버 디펜더에게 자율 패치 능력을 쥐여주는 결정 자체가 이중 사용(dual-use) 리스크를 안고 있습니다. 공격자가 Argon을 역설계해 유사 능력을 재현할 가능성, Fairwind Program 파트너사가 유출될 가능성, 모델이 패치하는 과정에서 새로운 취약점을 심을 가능성입니다. Google은 Argon의 안전성 평가 결과(모델 카드)를 함께 공개했지만, 운영 환경 데이터는 아직 쌓이지 않았습니다.

전망

필자의 시각으로는 Argon의 가장 큰 함의는 성능이 아니라 배포 전략에 있습니다.

프런티어 AI 접근을 "정부와 중요 인프라 먼저"로 뒤집은 사례이기 때문입니다. OpenAI와 Anthropic은 소비자, 개발자, 엔터프라이즈 순으로 모델을 열어왔습니다. Google은 이 순서를 뒤집으면서, AI 안전·보안 서사에서 서구 빅테크 중 가장 공격적인 포지션을 잡았습니다.

Fairwind Program이 효과를 입증하면, 경쟁사들도 유사 프로그램을 만들 가능성이 큽니다. 반대로 Argon을 받은 사이버 디펜더가 공격 쪽보다 수개월 앞선 패치 역량을 보여주지 못하면, 이 전략은 설득력을 잃습니다. 다음 분기 CVE 패치 속도 지표와 사고 공개 데이터가 Argon의 진짜 성적표가 될 것입니다.

참고

Share
JJY
// AUTHORJJY

AI · WEB SECURITY · DEV ENV

GH

새 글 알림 받기

스팸 없이 새 포스트만 전달합니다.

// RELATED

관련 포스트