Pulse 게시 ·

ServiceNow, 에이전트 실패에서 학습 과제를 만드는 AutoSynthData 소개

ServiceNow CoreAI가 10월 2일 기업용 에이전트의 실패를 분석해 합성 학습 과제를 만드는 AutoSynthData를 소개했다. 실제 환경에서 과제·해법·성공 판정을 검증한 뒤 학습에 쓴다. 연구팀에 따르면 EnterpriseOps Gym의 ITSM 실험에서 Gemma 모델의 평균 Pass@1이 18.77%에서 27.18%로 올랐다.

목표 모델의 실패와 더 강한 교사 모델의 성공을 비교해 부족한 능력을 정리하고, 이를 바탕으로 새로운 과제를 생성한다.

생성기는 원래 평가 과제의 프롬프트·개체·실행 경로·검증기 세부 내용을 받지 않고 정제된 능력 명세를 사용한다.

해당 실험 설정에서는 목표 모델이 3회 중 최대 1회, 강한 모델이 최소 2회 성공하는 과제를 우선한다.

정답 실행 경로가 성공 판정을 받는지 확인하고, 결과를 변형한 오답이 거부되는지도 검사한다.

ITSM에서는 Gemma-4-26B-A4B-it와 교사 DeepSeek-V4.1-Flash를 사용해 66시간 동안 학습 샘플 1994개를 생성했다. 성능 개선은 해당 실험 환경에서 측정됐다.

Hybrid에서는 Qwen3.8-27B를 교사로 사용해 약 18시간 동안 2000개를 생성했으며, 평균 Pass@1이 7.2%포인트 개선됐다고 보고했다.

합성 요청의 양보다 실행 가능한 과제와 잘못된 결과를 걸러내는 검증기를 함께 만드는 방식이 핵심이다.

원문