Mistral Large 4, 취약점 재현·패치 평가 82% 성과 발표
Mistral은 Large 4가 Artificial Analysis의 실제 오픈소스 취약점 재현·패치 시험에서 82%를 기록했다고 밝혔다. 업무 앱을 연결하는 657개 워크플로 평가 AutomationBench에서는 59.9%를 제시했다. 코딩 에이전트 종합 점수는 49.8%로, 평가 도구 공개 전 비공개로 측정된 결과라고 설명했다.
취약점 재현·패치 시험의 82%는 Mistral이 발표한 수치이며, 회사는 해당 시험에서 가장 높은 점수라고 주장했다.
AutomationBench는 Gmail·Google Sheets·Slack·Salesforce 등 업무 앱을 활용하는 657개 워크플로로 구성된다.
코딩 평가별 점수는 DeepSWE v1.1 61.7%, SWE-Atlas-QnA 59.4%, Terminal-Bench 4 28.3%다.
코딩 점수는 Artificial Analysis가 평가 도구 공개 전에 비공개로 측정했으며, 도구 공개 시 Coding Agent Index에 포함될 예정이다.
기존 게시물의 API 프리뷰·가격·가중치 공개 일정과 별도로, 구체적인 보안·업무·코딩 평가 결과를 다룬다.
취약점을 재현한 뒤 수정하는 작업까지 평가해, 보안 결함 설명을 넘어 실제 대응 절차를 수행하는 능력을 살펴볼 수 있다.
원문
- Mistral Large 4: "Le Chonk"mistral.ai · 원문 2026-10-06