ServiceNow, 에이전트 실패에서 학습 과제를 만드는 AutoSynthData 소개
ServiceNow CoreAI가 10월 2일 에이전트의 실패를 분석해 학습 과제를 생성·검증하는 AutoSynthData를 소개했다. EnterpriseOps Gym 실험에서 Gemma 모델을 합성 데이터로 미세조정하자 Hybrid의 평균 Pass@1이 7.2%포인트 올랐다. ITSM에서도 18.77%에서 27.18%로 개선됐으며 결과는 해당 실험 환경에 한정된다.
대상 모델이 실패하고 더 강한 교사 모델이 해결한 과제에서 부족한 능력을 추려 새로운 과제를 만든다.
생성기는 기존 평가 과제의 원래 질문·개체·실행 경로·검증기 세부정보 대신 정제된 능력 명세를 받는다.
실험 설정에서는 대상 모델이 3회 중 최대 1회, 교사 모델이 최소 2회 성공하는 과제를 선호했다.
Hybrid에서는 약 18시간에 2000개, ITSM에서는 66시간에 1994개의 합성 학습 표본을 생성했다.
정답 실행과 오답 상태 검사를 거치고 실패한 후보는 제한된 횟수만 수정한다. 파생 표본을 다시 확장 원본으로 쓰지 않아 세대를 거치며 과제가 벗어나는 것을 억제한다.
틀린 결과가 검증기를 통과하는지도 검사해, 잘못된 업무 상태를 성공으로 보상하는 학습 데이터가 들어갈 가능성을 줄인다.
원문
- AutoSynthData: Generating Training Data for Enterprise AgentsHugging Face · 원문 2026-10-02