Speculative decoding is a common trick for speeding up text models; Liquid AI says the same recipe carries over to vision-language models, where image prefill usually dominates latency on smaller devices.
Liquid AI ships experimental speculative-decoding drafter for its 3B vision-language model, claiming up to 3.13x faster decoding
Liquid AI released LFM2.5-VL-3B-DSpark, an experimental 280M-parameter drafter it says speeds decoding of its LFM2.5-VL-3B vision-language model by up to 3.13x.