ServiceNow, 에이전트 실패를 학습 과제로 바꾸는 AutoSynthData 소개
ServiceNow CoreAI가 10월 2일 기업용 에이전트의 취약한 작업을 찾아 학습 데이터를 만드는 AutoSynthData를 소개했다. 실행 가능한 과제와 정답 판정기를 함께 생성·검증한다. 연구진에 따르면 EnterpriseOps Gym의 ITSM 환경에서 합성 데이터로 미세조정한 Gemma의 평균 Pass@1이 18.77%에서 27.18%로 올랐다.
목표 모델의 실패와 더 강한 교사 모델의 성공을 비교해 학습할 역량을 선정한다. 생성기에는 원래 평가 과제의 질문·개체·실행 경로·판정기 세부사항을 전달하지 않는다.
실험에서는 목표 모델이 3회 중 최대 1회, 강한 모델이 최소 2회 성공하는 과제를 선호했다. 정답 경로 실행뿐 아니라 잘못된 결과가 검증을 통과하지 않는지도 확인한다.
Hybrid 환경에서는 약 18시간 동안 2000개 과제를 생성했고, 미세조정 후 평균 Pass@1이 7.2%포인트 상승했다. ITSM에서는 66시간 동안 1994개를 생성했다.
성과는 EnterpriseOps Gym의 두 환경에서 수행한 지도 미세조정 실험 결과다. 강화학습 적용은 향후 시험할 계획이다.
잘못된 결과도 정답으로 인정하는 판정기를 걸러내는 검증이 합성 데이터의 학습 품질을 좌우한다.
원문
- AutoSynthData: Generating Training Data for Enterprise AgentsHugging Face · 원문 2026-10-02