Pulse 게시 ·

Liquid AI, 텍스트·이미지·음성 판단용 d1 모델 가중치 공개

Liquid AI가 d1-3B와 실험적 d1-omni-600M의 가중치를 공개했다. 토큰을 생성하지 않고 한 번의 순전파로 판단하며, 3B는 텍스트·이미지, omni는 텍스트와 이미지 또는 음성을 받는다. 회사가 NVIDIA와 측정한 3B의 단일 질문 응답 시간은 Jetson AGX Thor 16ms, Orin Nano 50ms였다.

두 모델 모두 Hugging Face에서 가중치를 내려받을 수 있다.

d1-3B는 LFM2.5-VL-3B 기반이며, d1-omni-600M은 양방향 인코더에 시각·음성 인코더를 결합했다.

회사 평가에서 d1-3B는 Decision Index 0.2.1에서 48.57점을 기록했다.

d1-omni-600M은 초기 연구 공개 단계로 속도 수치를 제시하지 않았다. 두 모델의 시각·음성 벤치마크 결과도 공개하지 않았다.

실행에는 transformers 5.14 이상과 모델 자체 코드 로딩이 필요하다.

답변 문장보다 분류·점수·선택 결과가 필요한 요청 라우팅이나 기기 내 판단에 활용할 수 있다.

원문