NVIDIA, NeMo Relay로 에이전트 실행 경로·도구 수정 효과 추적
NVIDIA가 9월 30일 Hermes Agent의 모델·도구 호출을 NeMo Relay로 추적하는 실습을 공개했다. 별도 108회 비교 실험에서는 도구 수정 후 Qwen3 Coder 30B의 성공이 27회 중 19회에서 22회로 늘었지만 평균 실행 시간도 27초에서 42초로 늘었다. 호출·오류·재시도 기록을 성공 판정과 함께 분석한다.
ATOF는 시작·종료·시점별 이벤트를 JSONL로 기록하고, ATIF는 이를 단계별 에이전트 실행 기록으로 구성한다.
OpenTelemetry·OpenInference 형식으로 Phoenix 등 호환 도구에서 호출 시간·토큰·오류를 살펴볼 수 있다.
터미널 실습은 네트워크·저장소·API 키에 접근하지 못하는 Docker 컨테이너에서 실행하고 정확한 출력으로 성공을 판정한다.
비교 실험은 9개 과제를 모델별·기준 및 수정 버전별로 각각 3회 실행했으며, 프롬프트·도구·실행 제한·성공 기준을 고정했다.
Qwen의 평균 모델 호출은 3.8회에서 4.9회, 도구 호출은 2.8회에서 3.9회로 증가했다. 일부 검색 과제에서는 추가 탐색이 늘어나는 회귀도 관찰됐다.
Claude Sonnet 4.5는 성공이 24/27에서 23/27로 바뀌어, 같은 수정이 두 모델에 일관된 개선을 보이지는 않았다.
오류 복구를 개선하면 포기하던 작업을 끝내는 대신 호출과 지연이 늘 수 있어, 도구 수정의 목표를 성공률과 비용 중 어디에 둘지 정해야 한다.
원문
- Tracing Agent Harness Behavior with NVIDIA NeMo RelayNVIDIA Developer · 원문 2026-10-01