Liquid AI, VLM 추론 최대 3.13배 빠른 DSpark 공개

Liquid AI가 비전-언어 모델 LFM2.5-VL-3B용 실험적 드래프트 모델 DSpark를 공개했습니다. 스펙큘레이티브 디코딩 방식으로 출력 품질은 그대로 유지하면서 온디바이스에서 최대 3.13배, H100 GPU에서 최대 2.66배 디코딩 속도를 높입니다. 모델은 Hugging Face에 Safetensors와 GGUF 형식으로 공개돼 llama.cpp, MLX-VLM, SGLang에서 바로 쓸 수 있습니다.
1/LFM2.5-VL-3B용 드래프트 모델 공개
Liquid AI가 자사 비전-언어 모델(VLM) LFM2.5-VL-3B를 위한 실험적 드래프트 모델 DSpark를 내놨습니다. 8월에 공개한 텍스트 전용 LFM2.5-DSpark 드래프터와 같은 방식으로, 스펙큘레이티브 디코딩(speculative decoding) 경로를 추가해 출력 품질을 바꾸지 않으면서 메모리 사용량을 조금 늘리는 대신 추론 속도를 높입니다. 비전 드래프터는 텍스트 드래프터와 동일한 아키텍처를 쓰되, 타깃 모델의 특정 레이어에서 나온 은닉 상태(hidden state)를 참고해 한 번에 k개의 후보 토큰을 미리 만들어냅니다. 이미지 패치와 텍스트 토큰은 이 레이어에 들어가기 전에 같은 표현 공간으로 투사되기 때문에, 입력이 이미지든 텍스트든 드래프터는 동일한 차원의 은닉 상태 벡터를 다루고 추론 알고리즘 자체는 텍스트 모델과 달라지지 않습니다.
2/온디바이스 최대 3.13배, H100서 최대 2.66배
Liquid AI는 일반 VQA, 텍스트 VQA, 이미지 캡셔닝, 차트 VQA, 복합 추론, 멀티턴 대화 등 6가지 비전 과제로 구성된 MMSpec 벤치마크로 성능을 측정했습니다. 블록 크기 8을 기준으로 Apple M5 Max에서 MLX로 구동하면 디코딩 속도가 과제별로 2.30배~3.13배, 종단간(end-to-end) 지연은 1.56배~2.62배 개선됩니다. Apple M3 Ultra에서 llama.cpp로 구동하면 디코딩은 1.57배~2.14배, 종단간은 1.30배~1.77배 개선됩니다. H100 GPU에서는 같은 드래프터가 디코딩을 20.4배에서 2.66배까지(원문 표기 그대로), 종단간 지연은 1.64배~2.27배 개선한다고 밝혔습니다. 이런 속도 향상을 위해 드래프터는 2억 8천만(280M) 개 파라미터를 추가하는데, 이는 30억 파라미터 타깃 모델 대비 8.9% 늘어난 수치입니다.
3/SGLang·llama.cpp·MLX-VLM에서 바로 사용 가능
DSpark 드래프트 모델은 LFM2.5-VL-3B를 지원하는 SGLang(PR #40651), llama.cpp(PR#29339), MLX-VLM(PR#2280) 빌드에서 각각 쓸 수 있습니다. SGLang은 --speculative-algorithm DSPARK 등의 옵션으로 드래프트 모델(LiquidAI/LFM2.5-VL-3B-DSpark)을 타깃 모델에 붙여 실행하고, OpenAI 호환 엔드포인트(http://localhost:30000/v1)로 질의합니다. llama.cpp와 MLX-VLM도 각각 -md, --draft-model 옵션으로 드래프트 모델을 지정해 구동합니다. 스펙큘레이티브 디코딩은 '정확(exact)'하게 동작해, 타깃 모델이 드래프터가 제안한 토큰을 모두 검증하기 때문에 그리디(greedy) 출력 결과는 타깃 모델 단독 실행과 같습니다. 모델은 Hugging Face에 Safetensors와 GGUF 형식으로 공개돼 있습니다.
4/무료 공개, 다만 속도 향상은 디코딩 구간에만
이 드래프트 모델은 오픈 웨이트로, Hugging Face에서 무료로 내려받아 파인튜닝·배포할 수 있습니다. 공지에 별도 단가는 없습니다. 다만 스펙큘레이티브 디코딩은 디코딩 구간만 빠르게 할 뿐 이미지 인코딩이나 프리필(prefill) 구간은 그대로입니다. VLM은 이미지가 먼저 비전 인코더를 거친 뒤 수백 개의 시각 토큰이 텍스트 프롬프트와 함께 언어 모델에 들어가기 때문에, 연산 자원이 적은 엣지 기기일수록 프리필이 전체 지연에서 차지하는 비중이 커집니다. Liquid AI는 이를 암달의 법칙(Amdahl's law)으로 설명하며, 가속되지 않는 구간이 남아 있는 한 전체 속도 향상에는 한계가 있다고 밝혔습니다.
5/텍스트에 이어 비전까지, LFM 패밀리 추론 최적화 확대AMEET 해석
Liquid AI는 8월에 텍스트 전용 LFM2.5-DSpark 드래프터를 낸 데 이어 한 달여 만에 비전-언어 모델까지 같은 기법을 적용했습니다. 온디바이스·서버 양쪽에서 llama.cpp, MLX-VLM, SGLang을 day-one으로 지원한다는 점은 스마트폰이나 맥처럼 연산 자원이 제한된 환경에서 이미지 이해 모델을 돌리려는 개발자들에게 실질적인 선택지가 됩니다. 다만 원문이 밝힌 것처럼 속도 향상은 디코딩 구간에 한정되므로, 이미지 처리량이 많은 워크로드에서는 체감 개선폭이 벤치마크 수치보다 작을 수 있습니다.