원문 발표 ·

Kolibri 공개, 활성 30억·전체 780억 파라미터 MoE

Aleph Alpha가 10월 3일 영어·독일어 모델 Kolibri의 가중치를 Apache 2.0으로 공개했다. 총 780억 파라미터 중 토큰마다 약 30억 개를 활성화하는 MoE 구조로, 최대 100만 토큰 문맥을 지원한다고 밝혔다. 직접 운영할 때는 활성 파라미터 수만 보고 작은 모델로 판단하지 말고, 전체 가중치를 담을 메모리도 따져야 한다.

10월 3일 영어·독일어 모델의 전체 가중치를 Apache 2.0 라이선스로 공개했다고 밝혔다.

본문 표의 정확한 규모는 전체 78.1B, 토큰당 활성 3.46B 파라미터다.

최대 1M 토큰 지원과 별도로, 본문 표의 최장 학습 길이는 262144 토큰이다.

추론 노력 수준 none·low·medium·high를 지원한다고 소개한다.

활성 파라미터 수는 토큰당 연산 규모이며 전체 가중치 규모와 다르므로, 자체 운영 판단에서 두 수치를 구분해야 한다.

원문