Mistral Large 4: 1조 파라미터 오픈웨이트로 돌아온 유럽의 프런티어 모델
핵심 요약
프랑스 AI 기업 Mistral AI가 2026년 10월 6일 Mistral Large 4(내부 약칭 ML4)를 공개했습니다. 총 1조 개 파라미터 중 49B만 활성화되는 MoE 구조이고, 텍스트와 이미지를 함께 처리하는 네이티브 멀티모달 모델입니다. API는 발표 당일 Mistral Studio에서 퍼블릭 프리뷰로 열렸고, 가중치는 이달 말 공개됩니다.
관련 글: Mistral Large 3와 유럽 AI 주권 경쟁 관련 글: Gemini 4 Argon: Google DeepMind가 사이버 디펜더에게 먼저 쥐여준 프런티어 모델
| 항목 | 내용 |
|---|---|
| 발표일 | 2026년 10월 6일 |
| 총 파라미터 | 1조 (1T) |
| 활성 파라미터 | 49B |
| 구조 | instruct와 reasoning을 합친 하이브리드 MoE |
| 입력 모달리티 | 텍스트, 이미지 |
| 학습 인프라 | NVIDIA Grace Blackwell GPU 3,800개, 유럽 내 자체 데이터센터 |
| 학습 언어 | 160개 이상 (EU 공식 언어 전부 포함) |
| API 가격 | 입력 $1.36, 출력 $4.18 (100만 토큰당) |
| 가중치 공개 | 10월 말 예정 |
Mistral은 ML4를 "미국과 유럽을 통틀어 가장 강한 오픈웨이트 모델"로 소개했습니다. 경쟁 상대로 직접 이름을 올린 쪽은 DeepSeek, Qwen, GLM 같은 중국 오픈 모델입니다.
무엇이 커졌나: Large 3에서 Large 4로
전작 Mistral Large 3는 2025년 12월에 나왔습니다. 675B 파라미터에 활성 41B짜리 희소 MoE였습니다. 이번에는 전체 크기가 1.5배 가까이 늘었지만 활성 파라미터는 41B에서 49B로 8B 늘어나는 데 그쳤습니다.
이 차이가 핵심입니다. 토큰 하나를 만들 때 실제로 계산에 쓰이는 양은 거의 그대로 두고, 모델이 꺼내 쓸 수 있는 지식의 총량만 키운 셈입니다. 추론 비용을 크게 올리지 않고 규모를 키우는 MoE의 전형적인 선택입니다.
| 구분 | Mistral Large 3 | Mistral Large 4 |
|---|---|---|
| 공개 시점 | 2025년 12월 | 2026년 10월 |
| 총 파라미터 | 675B | 1T |
| 활성 파라미터 | 약 41B | 49B |
| 구조 | 희소 MoE | instruct + reasoning 하이브리드 MoE |
Large 4는 instruct와 reasoning을 한 모델에 묶은 하이브리드로 소개됐습니다. 추론 전용 모델을 따로 고르지 않고 한 엔드포인트에서 두 방식을 쓰는 구성입니다.
학습 인프라 숫자는 출처마다 조금 다릅니다. Mistral 공식 발표문은 "3,800개의 NVIDIA Grace Blackwell GPU로 처음부터 학습했다"고 적었습니다. The Next Web은 약 4,000개 GPU로 두 달간 학습했고 전력은 약 10MW였다고 보도했습니다. 학습 기간과 전력 수치는 공식 발표문에서 확인되지 않았습니다.
벤치마크: 코딩과 사이버 보안에 힘을 줬다
아래 수치는 모두 Mistral이 직접 발표한 결과입니다. 외부 기관의 독립 재현 결과는 아직 나오지 않았습니다.
코딩과 에이전트
| 벤치마크 | ML4 점수 | 비고 |
|---|---|---|
| DeepSWE v1.1 | 61.7% | 실세계 소프트웨어 엔지니어링 |
| SWE-Atlas-QnA | 59.4% | 코드베이스 질의응답 |
| Terminal Bench 4.0 | 28.3% | 터미널 작업 |
| Coding Agent Index | 49.8% | DeepSeek V4 Pro 0813, Qwen3.8 Max보다 높음 |
| AutomationBench | 59.9% | 업무 자동화 |
| AA-Briefcase | 1,393 Elo | 에이전트 업무 |
The Next Web이 정리한 비교 수치로 보면, DeepSWE에서 ML4는 62%로 GLM-5.3(61%)과 DeepSeek-V4-Pro(57%)를 근소하게 앞섭니다. 1포인트 차이라서 "압도"라고 부르긴 어렵습니다.
폐쇄형 프런티어 모델과는 아직 거리가 있습니다. Google이 지난주 발표한 Gemini 4 Argon은 같은 DeepSWE v1.1에서 77.9%를 보고했습니다. 두 수치 모두 각 회사의 자체 보고라는 점은 감안해야 합니다.
사람 평가도 하나 공개됐습니다. Surge AI가 진행한 코딩 인간 평가에서 ML4는 5점 만점에 3.74점으로 다섯 모델 중 2위였고, 1위는 4.22점의 Claude Opus 5였습니다.
사이버 보안
Mistral이 가장 강조한 분야입니다.
- Cybench: 보안 CTF 문제 40개 중 93% 해결
- 취약점 재현 테스트(AA Cyber Index): 82%, Mistral은 "테스트한 모든 모델 중 최고"라고 표현
- AA Cyber Index 종합: 전 세계 상위 5위, 중국 외 오픈웨이트 모델 중 1위
공격 능력이 높은 만큼 안전장치 수치도 같이 냈습니다. B3 공격 저항률은 93.3%였고, 사이버 관련 거부율은 다른 오픈소스 경쟁 모델보다 높았다고 밝혔습니다. 가중치 공개 전에 보안 업계와 검증된 파트너, 국가 기관과 함께 실환경 레드팀을 진행했다는 설명도 붙었습니다.
공동 창업자 Guillaume Lample은 The Next Web 인터뷰에서 "폐쇄형 모델을 탈옥해 사이버 공격에 쓰는 위협 행위자로부터 기업과 정부가 스스로를 방어할 수 있게 해준다"고 말했습니다.
금융, 법률, 시각
| 벤치마크 | ML4 | 비교 모델 |
|---|---|---|
| FinWorkBench (금융) | 67% | DeepSeek-V4-Pro 67%, GLM-5.3 65% |
| Harvey Legal Agent (법률) | 15% | Kimi K3 13%, GPT-6 Astra 5% |
| DIOR-RSVG (시각 그라운딩) | 73% | GPT-6 Astra 68% |
| Dense 200 (시각 그라운딩) | 42% | GPT-6 Astra 41% |
위 표에서 FinWorkBench, Harvey, DIOR-RSVG 수치는 The Next Web 보도 기준입니다. 공식 발표문에는 "GPT-6 Astra를 넘었다", "모든 오픈소스 모델을 앞섰다" 같은 문장만 있고 정확한 퍼센트가 빠져 있습니다. Dense 200 수치는 공식 발표문에 그대로 나옵니다.
가격과 공개 일정
API 가격은 100만 토큰당 입력 $1.36, 출력 $4.18입니다. 1조 파라미터급 모델치고는 낮은 편이고, 활성 파라미터가 49B에 머문다는 점이 이 가격을 가능하게 한 것으로 보입니다.
가중치 공개 날짜는 출처마다 표현이 다릅니다.
- Mistral 공식 발표문: "이달 말까지 가중치를 공개한다"
- The Next Web: 10월 27일 공개
라이선스 종류는 공식 발표문에 명시돼 있지 않습니다. "오픈웨이트"와 "셀프 배포"라는 표현만 반복됩니다. Apache 2.0인지, 상업 이용에 조건이 붙는 별도 라이선스인지는 가중치가 나와야 확인할 수 있습니다.
배포 경로는 세 가지입니다. Mistral Studio API, 프라이빗 클라우드, 온프레미스입니다. 유럽 인프라에서의 배포도 함께 언급됐습니다.
경쟁 구도: 같은 주에 나온 Reflection Beam
ML4 발표 하루 전인 10월 5일, 미국 스타트업 Reflection AI도 첫 오픈웨이트 모델 Beam을 공개했습니다. TechCrunch 보도에 따르면 Beam은 총 501B, 활성 23B 파라미터의 텍스트 전용 MoE 모델이고 컨텍스트는 100만 토큰입니다. Reflection은 GLM-5.2와 비슷한 추론 성능을 3~4배 적은 추론 연산으로 낸다고 주장했고, 가중치는 이달 안에 공개할 예정입니다.
| 구분 | Mistral Large 4 | Reflection Beam |
|---|---|---|
| 국가 | 프랑스 | 미국 |
| 총 파라미터 | 1T | 501B |
| 활성 파라미터 | 49B | 23B |
| 모달리티 | 텍스트 + 이미지 | 텍스트 전용 |
| 비교 기준으로 삼은 모델 | DeepSeek, Qwen, GLM-5.3 | GLM-5.2 |
| 가중치 공개 | 10월 말 | 10월 중 |
두 회사가 겨냥한 대상은 같습니다. 오픈웨이트 상위권을 차지하고 있는 중국 모델들입니다. 한쪽은 규모로, 다른 쪽은 효율로 접근했다는 차이가 있습니다.
TNW에 따르면 Mistral은 9월에 30억 유로 규모 시리즈 D를 마무리했고 기업가치는 210억 유로입니다. 자체 데이터센터에서 1조 파라미터 모델을 처음부터 학습할 수 있었던 배경이기도 합니다.
최근 한 달 타임라인
발표 시점만 놓고 봐도 10월 첫 주에 프런티어급 모델이 몰렸습니다.
| 날짜 | 사건 | 출처 |
|---|---|---|
| 2025년 12월 | Mistral Large 3 공개 (675B, 활성 41B) | 이전 글 |
| 2026년 9월 | Mistral, 30억 유로 시리즈 D 마무리 (기업가치 210억 유로) | The Next Web |
| 2026년 9월 30일 | Google DeepMind, Gemini 4 Argon을 사이버 디펜더에게 먼저 공개 | 이전 글 |
| 2026년 10월 5일 | Reflection AI, 501B 오픈웨이트 Beam 발표 | TechCrunch |
| 2026년 10월 6일 | Mistral Large 4 발표, API 퍼블릭 프리뷰 시작 | Mistral 공식 |
| 2026년 10월 말 | Large 4 가중치 공개 예정 (TNW는 10월 27일로 보도) | Mistral 공식, The Next Web |
폐쇄형 진영은 보안 역량을 검증된 사용자에게 먼저 여는 쪽으로, 오픈웨이트 진영은 가중치를 그대로 푸는 쪽으로 움직였습니다. 같은 주에 두 방향이 동시에 나왔다는 점이 이번 발표를 읽는 맥락입니다.
셀프 배포를 생각한다면: 단순 계산
이 섹션은 공식 발표가 아니라 필자의 단순 계산입니다. Mistral은 ML4 셀프 배포에 필요한 하드웨어 사양을 아직 공개하지 않았습니다.
MoE 모델은 토큰당 계산은 활성 파라미터만큼만 하지만, 어떤 전문가가 호출될지 모르기 때문에 전체 가중치를 메모리에 올려둬야 합니다. 그래서 메모리 요구량은 49B가 아니라 1조를 기준으로 잡아야 합니다.
| 정밀도 | 파라미터당 바이트 | 가중치만 올릴 때 (추정) |
|---|---|---|
| BF16 | 2 | 약 2TB |
| FP8 | 1 | 약 1TB |
| 4비트 양자화 | 0.5 | 약 500GB |
여기에 KV 캐시와 런타임 여유분이 더해집니다. 노트북이나 단일 GPU 서버에서 돌릴 수 있는 모델은 아니라는 뜻입니다. 사실상 GPU 여러 장을 묶은 랙 단위 장비나, 양자화 버전을 전제로 한 대형 서버가 필요합니다.
반대로 이 숫자가 Mistral의 주 고객층을 보여주기도 합니다. 은행, 방산, 공공기관처럼 데이터를 외부 API로 보낼 수 없지만 자체 GPU 클러스터는 갖춘 조직입니다. 개인 개발자에게는 API 가격($1.36/$4.18)이 현실적인 접점입니다.
누가 먼저 써볼 만한가
- 보안 운영팀(SOC): 취약점 재현과 CTF 계열 점수가 가장 강한 영역입니다. 내부 로그를 외부로 보내지 않고 분석하려는 팀이라면 가중치 공개 후 바로 평가해볼 만합니다.
- EU 규제 산업: 학습은 유럽 내 자체 데이터센터에서 했고, 유럽 인프라 배포도 지원한다고 Mistral이 밝혔습니다. 데이터 주권 요건이 걸린 프로젝트에서 선택지가 하나 늘었습니다.
- 다국어 서비스: 160개 이상 언어로 학습했다는 점은 한국어처럼 영어 외 언어 비중이 큰 서비스에도 관련이 있습니다. 다만 한국어 성능 수치는 따로 공개되지 않았습니다.
- 기존 Mistral 사용자: Large 3에서 넘어오는 경우 활성 파라미터가 41B에서 49B로 늘어난 만큼 추론 비용 변화부터 확인하는 게 순서입니다.
필자의 시각
여기부터는 개인적인 해석입니다.
ML4에서 가장 눈에 띄는 건 파라미터 숫자보다 사이버 보안 포지셔닝입니다. 미국 프런티어 랩들은 보안 작업에 대한 거부를 늘리거나, Google처럼 검증된 디펜더에게만 먼저 여는 방식을 택하고 있습니다. Mistral은 반대로 "가중치를 직접 내려받아 자기 정책으로 돌리라"는 답을 내놨습니다. 공격자도 같은 가중치를 받는다는 점에서 논쟁이 붙을 지점입니다.
코딩 성능은 오픈웨이트 기준으로 상위권이지만, 폐쇄형 모델과의 격차는 DeepSWE 기준 15포인트 이상 남아 있습니다. 실무에서는 "Claude나 Gemini를 대체한다"보다 "데이터를 밖으로 못 내보내는 조직이 쓸 수 있는 가장 강한 선택지"에 가깝게 쓰일 것 같습니다.
10월 말 가중치가 실제로 공개되면 확인할 것이 두 가지입니다. 라이선스 조건, 그리고 외부 기관이 재현한 벤치마크입니다. 49B 활성 파라미터라도 1조 전체를 메모리에 올려야 하니, 셀프 배포에 필요한 GPU 규모도 같이 봐야 합니다.
참고