GPT‑6 운영 가이드: 작업별 모델 선택과 비용·속도 최적화
OpenAI는 작업 난도에 따라 Astra·Sol·Luna를 선택하고 추론 강도와 속도를 함께 조정하라고 권한다. 실제 업무의 성공률·지연시간·성공한 작업당 비용을 비교하고 캐싱·문맥 압축으로 운영 효율을 높이는 것이 핵심이다.
모델 선택: 어려운 추론은 Astra, 복잡한 코딩·연구·컴퓨터 사용은 Sol, 송장 추출·요청 분류·구조화 요약 같은 반복 작업은 Luna를 권장한다.
추론과 속도: 단순 추출은 Low, 판단·계획은 Medium, 어려운 디버깅·검토는 High가 출발점이다. Max는 개선이 시간·비용을 정당화할 때 사용한다. Fast·Ultrafast는 추가 비용을 고려해야 한다.
캐시와 문맥: 고정 지침·자료를 입력 앞에 두고 도구 정의를 유지한다. 최대 95% 할인은 캐시 입력 토큰 조건이며 전체 작업 비용 절감률이 아니다. 긴 대화는 문맥 압축으로 이어갈 상태를 보존한다.
운영 검증: 배포 전 대표 업무에서 성공률·지연시간·성공한 작업당 비용을 측정한다. 결과물·제약·완료 기준과 독립 진행·승인 경계를 명시한다.
장기 작업: 실행 중 수정 지시는 진행 중 도구를 취소하거나 완료한 행동을 되돌리지 않는다. 비동기 실행 중 독립 작업은 계속하되 의존 작업은 결과를 기다린다. Sol의 API 다중 에이전트는 베타다.
가장 강한 모델을 모든 업무에 쓰기보다 대표 업무로 비교해 필요한 수준을 선택하라는 가이드다. 모델별 정확한 가격표·비교 벤치마크·자동 전환 임계값은 이 글에서 제시하지 않는다.
원문
- A model guide for the GPT-6 familyOpenAI · 원문 2026-10-03