NVIDIA, HSTU 추천 모델의 컴파일·캐시 기반 배포 절차 공개
NVIDIA가 9월 30일 recsys-examples 저장소의 HSTU 추천 모델 배포 절차를 소개했다. PyTorch AOTI로 C++ 실행용 모델을 만들고 FlexKV로 사용자 이력의 연산 결과를 재사용한다. RTX PRO 6000 Blackwell 실험에서 배치 8·GPU 캐시 적중률 100%일 때, 8층 모델의 지연은 캐시 없는 동일 AOTI 구성 대비 최대 5.93배 개선됐다.
사용자 맥락·상품·행동을 하나의 시퀀스로 처리하는 HSTU 랭킹 모델을 내보내고, 네이티브 C++ 검증을 거쳐 Dynamo-Triton에서 제공한다.
KV 캐시는 GPU와 호스트 저장소를 사용하며, GPU 공간이 부족하면 오래 사용하지 않은 사용자 데이터를 퇴출한다.
임베딩 테이블 전체는 CPU 메모리에 두고 자주 사용하는 항목만 GPU에 저장해 GPU 메모리 요구량을 줄인다.
벤치마크는 KuaiRand-1K 구성과 단일 GPU를 사용했다. 배치 8·캐시 적중 조건에서 논리 요청당 지연은 3층 모델 0.423ms, 8층 모델 0.678ms였다.
지연 측정에는 데이터 로딩, 서버 시작, 워밍업 등이 포함되지 않았다.
사용자 이력의 앞부분이 유지되는 반복 요청에서 재계산을 줄이는 구조라, 긴 이력과 깊은 모델일수록 캐시 재사용 효과가 커질 수 있다.
원문
- Deploying an HSTU Generative Recommender with NVIDIA Dynamo-TritonNVIDIA Developer · 원문 2026-10-01