Pulse 게시 ·

ServiceNow, 에이전트 실패에서 학습 과제를 만드는 AutoSynthData 소개

ServiceNow가 10월 2일 기업용 에이전트의 실패 유형을 분석해 합성 학습 과제를 만드는 AutoSynthData를 소개했다. 실행 가능성과 정답 판정기를 검증한 과제로 Gemma를 미세조정했다. EnterpriseOps Gym 실험에서 Hybrid의 평균 Pass@1은 7.2%p, ITSM은 18.77%에서 27.18%로 올랐다.

목표 모델의 실패와 더 강한 교사 모델의 성공을 분석해 역량 명세를 만들며, 생성기에 원래 평가 과제의 프롬프트·개체·실행 경로·판정기 세부사항을 전달하지 않는다.

생성 과제의 기준 해법을 실제 환경에서 실행하고, 잘못된 결과 상태가 정답으로 인정되지 않는지도 검사한다. 실패한 후보는 횟수를 제한해 수정한다.

실험 설정에서는 목표 모델이 3회 중 최대 1회, 교사 모델이 최소 2회 성공하는 과제를 선호했다.

Hybrid에서는 Gemma-4-26B-A4B-it와 Qwen3.8-27B로 약 18시간 동안 2000개 샘플을 생성했다. ITSM에서는 DeepSeek-V4.1-Flash를 교사로 사용해 66시간 동안 1994개를 만들었다.

결과는 해당 기업 업무 평가 환경의 지도 미세조정 실험에서 얻었으며, 강화학습 적용은 향후 시험할 계획이다.

모델이 이미 잘하는 작업보다 실패가 남은 업무 흐름에 데이터 생성 예산을 집중하는 방식이다.

원문