24 сентября 2026 г.
LFM2.5-VL-3B локально генерирует текст быстрее: до 3,13× на M5 Max
24 сентября Liquid AI показала DSpark для LFM2.5-VL-3B: на M5 Max генерация ускорилась в 2,30–3,13 раза. Полный ответ VLM пришёл в 1,56–2,62 раза быстрее. Веса уже доступны на Hugging Face в Safetensors и GGUF.

LFM2.5-VL-3B генерировала каждый токен сама. Теперь draft-модель LiquidAI/LFM2.5-VL-3B-DSpark предлагает блоки по 8 или 9 токенов, а target-модель их проверяет. Draft добавляет 279,5 млн параметров, или 8,9% к LFM2.5-VL-3B, а greedy output совпадает с запуском target-модели без draft.
Как запустить. На Apple Silicon нужен MLX-VLM с PR #2280 и команда `mlx_vlm.server --model LiquidAI/LFM2.5-VL-3B --draft-model LiquidAI/LFM2.5-VL-3B-DSpark`. На SGLang нужен билд с PR #40651, `flashinfer`, block size 9 и отключённый radix cache. PR в main с 22 сентября: на одном H100 80 GB тест из 600 samples и 723 turns дал 2,08× end-to-end без сбоев.
На H100 в BF16 decode ускорился в 2,04–2,66 раза, а полный ответ в 1,64–2,27 раза. Для llama.cpp нужен билд с PR #29339, базовый GGUF, mmproj и draft-файл LFM2.5-2.6B-DSpark-F16.gguf с `--spec-type draft-dspark --spec-draft-n-max 8 -fa on -ngl 99 -c 8192`; PR вошёл в master 23 сентября.
DSpark не ускоряет vision encoder и prefill, поэтому полный VLM-ответ растёт медленнее, чем скорость decode.
Первоисточник
