Mistral Large 4, 장시간 도구 사용을 위한 강화학습 구조 공개
Mistral이 Large 4 발표에서 코드 샌드박스·검색·외부 API를 공유하는 강화학습 구조를 설명했다. 회사에 따르면 GPU 약 3000개 규모의 학습 실행은 하루 약 330억 토큰을 생성하며, 필터링·마스킹 뒤 학습에 쓰는 응답은 약 160억 토큰이다. 여러 차례 문맥 압축을 거치는 수백만 토큰의 작업도 지원한다.
공통 인터페이스로 단일 대화, 과학 문제, 안전성, 사실성, 장시간 도구 사용 환경을 한 학습 실행에 결합한다.
과제에 따라 보상 모델·단위 테스트·LLM 평가자·정적 검사를 조합한다.
자동 확장 실행기가 수만 개의 시도를 병렬 생성하고 모델 학습은 비동기로 진행한다.
공개 프리뷰의 강화학습은 계속 진행 중이며, 회사는 가중치를 10월 말 공개할 계획이라고 밝혔다.
같은 학습 실행에 과학 문제와 장시간 도구 사용을 섞고 검증 방식을 조합해, 최종 결과까지 이어지는 작업을 훈련하는 구조다.
원문
- Mistral Large 4: "Le Chonk"mistral.ai · 원문 2026-10-06