Liquid AI, 텍스트·이미지·음성 판단용 d1 모델 가중치 공개
Liquid AI가 d1-3B와 실험적 d1-omni-600M의 가중치를 공개했다. 토큰을 생성하지 않고 한 번의 순전파로 판단하며, 3B는 텍스트·이미지, omni는 텍스트와 이미지 또는 음성을 받는다. 회사가 NVIDIA와 측정한 3B의 단일 질문 응답 시간은 Jetson AGX Thor 16ms, Orin Nano 50ms였다.
두 모델 모두 Hugging Face에서 가중치를 내려받을 수 있다.
d1-3B는 LFM2.5-VL-3B 기반이며, d1-omni-600M은 양방향 인코더에 시각·음성 인코더를 결합했다.
회사 평가에서 d1-3B는 Decision Index 0.2.1에서 48.57점을 기록했다.
d1-omni-600M은 초기 연구 공개 단계로 속도 수치를 제시하지 않았다. 두 모델의 시각·음성 벤치마크 결과도 공개하지 않았다.
실행에는 transformers 5.14 이상과 모델 자체 코드 로딩이 필요하다.
답변 문장보다 분류·점수·선택 결과가 필요한 요청 라우팅이나 기기 내 판단에 활용할 수 있다.
원문
- Multimodal open d1 decision models for the edgeHugging Face · 원문 2026-10-08