Pulse 게시 ·

ServiceNow, 에이전트 실패 사례로 학습 과제 만드는 AutoSynthData 소개

ServiceNow CoreAI가 10월 2일 기업용 에이전트의 취약한 작업을 찾아 합성 학습 데이터를 만드는 AutoSynthData를 소개했다. 과제의 실행 가능성과 정답·오답 판정을 검사한 뒤 학습에 쓴다. EnterpriseOps Gym의 ITSM 실험에서 Gemma 모델의 평균 Pass@1은 18.77%에서 27.18%로 올랐다.

대상 모델의 실패와 더 강한 교사 모델의 성공을 비교해 부족한 능력을 추린다. 생성기에는 평가 과제 원문 대신 정리된 능력 명세를 제공한다.

이번 구성에서는 대상 모델이 3회 중 최대 1회, 교사 모델이 최소 2회 성공하는 과제를 선호했다.

Hybrid 실험은 Gemma-4-26B-A4B-it와 Qwen3.8-27B를 사용했다. 약 18시간에 학습 표본 2000개를 생성했고, 최적 체크포인트의 평균 Pass@1이 7.2%p 올랐다.

ITSM 실험은 같은 대상 모델과 DeepSeek-V4.1-Flash를 사용해 66시간에 표본 1994개를 생성했다. 실험은 지도 미세조정에 집중했으며 강화학습 적용은 향후 시험할 계획이다.

성공 경로뿐 아니라 잘못된 결과도 검사해, 부실한 채점기가 오답을 학습 보상으로 인정하는 문제를 줄이는 방식이다.

원문