Liquid AI, 텍스트·이미지·음성용 d1 판단 모델 2종 가중치 공개
Liquid AI가 10월 7일 d1-3B와 실험 단계 d1-omni-600M의 가중치를 공개했다. 토큰을 생성하지 않고 한 번의 순전파로 구조화된 판단을 반환한다. 회사에 따르면 d1-3B의 단일 질문 응답은 Jetson AGX Thor에서 16ms였다. omni는 텍스트와 이미지 또는 음성을 입력받으며, 속도 수치는 공개하지 않았다.
d1-3B는 LFM2.5-VL-3B 기반으로 텍스트·이미지를 지원하고, d1-omni-600M은 양방향 인코더에 시각·음성 인코더를 추가했다.
Liquid AI는 d1-3B가 Decision Index 0.2.1에서 48.57점을 기록했다고 밝혔다. 공개 데이터셋 7종의 평균 점수는 82.9였다.
d1-3B의 단일 질문 응답 시간은 Jetson AGX Orin 64GB에서 26ms, Orin Nano에서 50ms였다. 384px 이미지 처리 시간은 각각 83ms와 202ms였다.
시각·음성 벤치마크는 제시하지 않았다. d1-omni-600M은 추가 개발 중인 초기 연구 공개판이다.
Hugging Face에서 가중치와 데모를 제공하며, 실행에는 transformers 5.14 이상과 모델 자체 코드 로딩이 필요하다.
고객 문의의 담당 팀·환불 여부·긴급도를 한 번에 판정하는 등, 자유로운 답변보다 정해진 분류가 필요한 작업에 맞는다.
원문
- Multimodal open d1 decision models for the edgeHugging Face · 원문 2026-10-08