Pulse 게시 ·

Liquid AI, 텍스트·이미지·음성 판단용 d1 모델 2종 공개

Liquid AI가 10월 7일 판단용 모델 d1-3B와 실험 단계의 d1-omni-600M 가중치를 공개했다. 토큰을 생성하지 않고 한 번의 연산으로 답하며, 각각 텍스트·이미지와 텍스트·이미지 또는 텍스트·음성을 받는다. 회사가 측정한 d1-3B의 단일 질문 응답 시간은 Jetson AGX Thor에서 16ms, Orin Nano에서 50ms다.

두 모델의 가중치는 Hugging Face에서 제공한다.

d1-3B는 LFM2.5-VL-3B 기반이며, 회사가 보고한 Decision Index 0.2.1 점수는 48.57이다.

d1-omni-600M은 초기 연구 공개 단계로 추가 개발 중이며, 이번 발표에는 속도 측정값이 없다.

영상·음성 판단 벤치마크 결과는 공개하지 않았다.

실행에는 transformers 5.14 이상과 모델 자체 코드 로딩이 필요하다.

같은 입력에서 환불 여부·담당 부서·긴급도를 함께 판단할 수 있어 고객 문의 분류 같은 정형 작업에 활용할 수 있다.

원문