Pulse 게시 ·

Telegraph Test, 전보체 요약으로 모델 간 기록 전달 비용 절감 실험

10월 4일 공개된 Telegraph Test 글은 50개 지문·약 1300개 질문 실험에서 일부 모델의 전보체 기록이 출력 토큰을 40~49% 줄였다고 보고했다. 다른 모델이 기록을 읽고 답한 정확도 비율은 일반 요약 대비 0.99~1.10이었다. 다만 gpt-5-mini는 압축 시 추론 비용이 늘어 기록 작성 비용이 약 두 배가 됐다.

연구자는 재현용 평가 도구·고정 기록·실행 노트북을 GitHub의 Travis42/telegraph-test에 공개했다.

소문자 전보체 지시를 적용한 기록 작성에서 Gemma는 40.4%, Qwen은 48.9%, GLM-5.3-Flash는 48.4%의 토큰 절감을 보고했다.

다른 모델의 읽기 평가는 같은 질문과 고정 채점 규칙을 사용했다. 정확도 비율은 각 조건의 일반 텍스트 대조군을 1.00으로 정규화한 값이다.

전체 지문을 읽고 답변 자체를 전보체로 작성한 조건은 일반 답변 대비 정확도 비율 0.81이었다. 압축된 요약을 읽는 조건과 결과가 달랐다.

전보체라는 역사적 표현 없이 단순히 간결하게 쓰도록 지시하는 대조 실험은 수행하지 않았다.

연구자는 추론을 끌 수 없는 gpt-5-mini에서는 짧아진 출력보다 늘어난 추론 비용이 더 컸다고 설명했다.

답을 만드는 도중보다 내용이 확정된 뒤 에이전트 메모리나 인계 기록을 압축하는 용도에 맞는다. 작성 단계부터 전보체를 쓰는 조건에서는 정확도가 떨어졌다.

원문