Pulse 게시 ·

Liquid AI, 엣지용 멀티모달 판단 모델 d1 2종 가중치 공개

Liquid AI가 10월 7일 토큰 생성 없이 한 번의 순전파로 판단하는 d1-3B·실험적 d1-omni-600M의 가중치를 공개했다. 3B는 텍스트·이미지, 600M은 텍스트와 이미지 또는 음성 조합을 처리한다. 회사 측 단일 질문 측정에서 3B의 응답시간은 Jetson AGX Thor 16ms, Orin Nano 50ms였으며, 600M의 속도는 공개하지 않았다.

내용·출처 업데이트 · 2026. 10. 10. 오후 3:21

두 모델 모두 Hugging Face에서 가중치를 내려받을 수 있으며, System One Arcade 데모도 제공한다.

d1-3B는 decoder-only인 LFM2.5-VL-3B를 기반으로 한다. d1-omni-600M은 양방향 인코더 LFM2.5-Encoder-350M에 시각·음성 인코더를 추가한 초기 연구 버전이다.

Liquid AI 평가에서 d1-3B의 Decision Index 0.2.1 점수는 48.57이었다. 별도 공개 데이터셋 7개의 평균 점수는 3B가 82.9, 600M이 78.4였다.

시각·음성 벤치마크 결과는 제시하지 않았다. 공개 데이터셋 평균 점수를 멀티모달 성능 수치로 해석할 수는 없다.

Jetson AGX Thor에서 질문 3개를 함께 처리하는 시간은 20ms였다. 같은 장치에서 3.4K 토큰 입력은 220ms, 384px 이미지 입력은 35ms로 입력 조건에 따라 달랐다.

실행 예시는 transformers 5.14 이상을 요구하며, 모델 자체 코드를 불러오기 위해 trust_remote_code=True를 사용한다.

같은 입력에 대한 분류·긴급도 등 여러 판단을 한 번에 처리할 수 있어, 요청 라우팅이나 엣지 장치의 조건 판정에 활용할 수 있다.

원문