Ai2, GPU 시간 예산·선점 도입으로 디버깅 대기 단축
Ai2가 GPU 스케줄러를 프로젝트별 시간 예산·계층형 공정 배분·시간 분할 방식으로 바꾼 결과를 공개했다. 연구소에 따르면 디버깅 대기시간 90백분위는 2시간→30초로 줄고 점유율은 98%를 유지했다. 최대 H100 클러스터의 대기 중앙값도 5분→24초로 줄었다. 다만 대화형 세션은 최대 8시간의 선점 보호 이후 상태를 잃을 수 있어 CPU 전용 클러스터·복원 기능을 추진한다.
약 150명의 내부 연구자를 위해 수천 개의 H100·B200·B300 GPU를 운영하며, 제출된 요청량은 가용 GPU의 2~3배다.
관리자가 연구 조직 구조에 따라 GPU 시간 예산을 배분한다. 스케줄러는 기본 7일의 사용 이력을 기준으로 배분 대비 덜 사용한 작업을 우선한다.
작업이 선언한 최소 실행시간 동안 선점을 보호하며, 상한은 8시간이다. 재개 가능한 작업은 이후 선점해 대기열에 다시 넣을 수 있다.
예산에 청구하지 않는 작업은 처음부터 선점 가능하다. 이 작업들이 전체 제공 GPU 시간의 18%를 차지해 빈 자원을 활용했다.
30일 시험에서 실제 수요를 반영한 팀별 배분 의무 시간의 98%를 제공했다. 15개 팀 중 13개는 95% 이상을 받았고 최저는 90%였다.
점유율은 변경 전후 모두 98%였으며, 사람 개입이 필요한 수리는 연구소 집계상 74% 줄었다.
GPU를 미리 점유해 두는 작업도 팀 예산을 소비하게 만들어, 자원 확보 경쟁을 우선순위 상향에서 프로젝트별 시간 배분 협의로 옮긴 방식이다.
원문
- Impactful scheduling for GPU clustersHugging Face · 원문 2026-10-10