Pulse 게시 ·

ServiceNow, 에이전트 실패에서 학습 과제를 만드는 AutoSynthData 소개

ServiceNow가 10월 2일 기업용 에이전트의 약점을 바탕으로 학습 과제를 생성·검증하는 AutoSynthData를 소개했다. 연구팀의 EnterpriseOps Gym 실험에서 Gemma 모델을 합성 데이터로 미세조정하자 Hybrid 영역의 평균 Pass@1은 7.2%포인트, ITSM은 18.77%에서 27.18%로 올랐다.

대상 모델의 실패와 더 강한 교사 모델의 성공을 분석해 학습할 능력을 정하고, 모델이 개선되면 남은 약점으로 생성 대상을 옮긴다.

평가 과제의 원문·개체·실행 경로·검증기 세부 정보는 생성기에 전달하지 않고, 이를 추상화한 능력 명세를 사용한다.

실험 설정에서는 대상 모델이 3회 중 최대 1회, 강한 풀이 모델이 최소 2회 성공하는 과제를 선호했다. 정답 실행과 잘못된 결과를 모두 검사해 검증기를 점검한다.

Hybrid에서는 Gemma-4-26B-A4B-it와 Qwen3.8-27B를 사용해 약 18시간 동안 2000개 샘플을 생성했다. ITSM에서는 DeepSeek-V4.1-Flash를 교사로 사용해 66시간 동안 1994개를 생성했다.

성과는 EnterpriseOps Gym의 두 영역에서 수행한 지도 미세조정 실험 결과다. 강화학습 적용은 향후 시험할 계획이다.

실제 업무 환경에서 실행 가능한 과제와 오답을 걸러내는 검증기를 함께 만들어, 실패 사례를 반복 학습에 활용하는 방식이다.

원문