ServiceNow, 에이전트 실패를 학습 과제로 바꾸는 AutoSynthData 공개
ServiceNow CoreAI가 10월 2일 기업용 에이전트의 실패를 분석해 합성 학습 과제를 만드는 AutoSynthData를 소개했다. 실행 가능성과 성공 판정 기준을 검사한 뒤 교사 모델의 수행 기록으로 학습한다. 연구팀의 EnterpriseOps Gym 평가에서 Gemma의 ITSM 평균 Pass@1은 18.77%에서 27.18%로 올랐으며, 강화학습 적용은 향후 시험할 계획이다.
목표 모델의 실패와 더 강한 교사 모델의 성공을 비교해 능력별 명세를 만든다. 생성기에는 원래 평가 과제의 프롬프트·개체·수행 기록·검증기 세부 사항을 전달하지 않는다.
과제는 시스템 명세·사용자 요청·검증기로 구성한다. 환경에서 실행 가능하고 실제 업무와 유사하면서 목표 모델의 약점을 드러내도록 설계한다.
이번 설정에서는 목표 모델이 3회 중 최대 1회, 교사 모델이 최소 2회 성공하는 과제를 선호했다. 참조 수행을 실행하고 잘못된 최종 상태도 검사하며, 수정한 과제는 검사를 다시 통과해야 한다.
Hybrid 실험은 Gemma-4-26B-A4B-it와 교사 Qwen3.8-27B를 사용해 약 18시간에 학습 예제 2000개를 생성했다. 최선 체크포인트의 평균 Pass@1은 7.2%포인트 개선됐으며, 검증기 성공률은 63.01%에서 68.55%로 올랐다.
ITSM 실험은 같은 목표 모델과 교사 DeepSeek-V4.1-Flash로 66시간에 예제 1994개를 생성했다. 더 큰 교사 모델을 사용했고 처리량 최적화 이전에 수행해 Hybrid보다 오래 걸렸다는 설명이다.
결과는 EnterpriseOps Gym의 두 영역에서 수행한 지도 미세조정 실험이다. 모델 개선 후 남은 실패를 다음 과제 생성에 반영하며, 강화학습으로의 확장은 아직 시험 계획이다.
정답 실행뿐 아니라 일부러 틀린 결과도 검사해, 잘못된 행동에 보상을 주는 판정 기준을 걸러내는 구조다.
원문
- AutoSynthData: Generating Training Data for Enterprise AgentsHugging Face · 원문 2026-10-02