NVIDIA, 작은 모델의 데이터 분석 에이전트 설계 사례 공개
NVIDIA가 10월 8일 KDD Cup 2026 데이터 에이전트 부문 2위 팀의 설계를 공개했다. 작고 고정된 LLM에 맞춰 CSV·JSON을 SQLite로 통합하고, 분석 전에 테이블·조인 키·데이터 문제를 제공했다. 문서 추출은 별도 모델 호출로 분리하고 도구·출력 경로를 제한해 오류와 문맥 소모를 줄였다는 설명이다.
대회는 데이터베이스·CSV·JSON·문서·PDF·영상에 걸친 자연어 질문을 다뤘으며, 작은 고정 LLM을 사용하도록 요구했다.
구조화 데이터를 하나의 SQLite 질의 경로로 통합하고 schema()·sql(query)로 조회하게 했다.
사전 스키마 탐색은 조인 키·단위·중복 이름·결측 패턴·행 단위의 의미를 제공했다.
상태를 유지하는 Python 환경에서 중간 결과를 재사용하고, 미들웨어가 잘못된 도구 호출을 복구했다.
문서는 제한된 미리보기·정규식 검색으로 관련 부분을 찾은 뒤 별도 LLM 호출로 규칙이나 표를 추출했다.
반복 실행과 답변 선택은 비용·지연을 늘리므로 가치·불확실성에 따라 선택적으로 적용하라고 제안했다.
실행 기록에서 첫 오류가 난 지점을 분류하면, 모델 교체에 앞서 조인 정보·문서 조회·출력 도구 중 어디를 고칠지 판단할 수 있다.
원문
- Building Reliable Data Analytics Agents: Lessons from the KDD CupNVIDIA Developer · 원문 2026-10-09