20 августа 2026 г.
LFM2.5 на MacBook отвечает вдвое быстрее: 61 → 139 токенов в секунду
Liquid AI выложила драфт-файлы DSpark: та же модель выдаёт тот же ответ, но в 2.27x быстрее.

LFM2.5-2.6B на MacBook M4 Max выдавала 61 токен в секунду. Теперь 139 — ответ тот же, слово в слово.
Liquid AI выложила 20.08.2026 три драфт-чекпойнта DSpark примерно по 300M параметров к своим моделям LFM2.5. Маленькая модель бежит вперёд и угадывает следующие токены, основная проверяет догадки и отбрасывает неверные. Последовательность на выходе идентична обычной генерации, поэтому точность на бенчмарках остаётся прежней.
Замер на сервере. На одной H100 80GB через SGLang LFM2.5-2.6B ускорилась в 2.67x, с 323 до 864 токенов в секунду. У модели 1.2B прирост 2.10x, у 8B-A1B — 2.54x с пиком 3.18x. Числа замеряла сама Liquid AI, batch 1, 20.08.2026.
На макбуке скромнее. LFM2.5-1.2B в llama.cpp на M4 Max разгоняется в 2.54x, с 138 до 350 токенов в секунду. MoE-модель 8B-A1B почти не выигрывает: 1.18x, и Liquid AI объясняет это тем, как MoE сейчас считается на Metal и сколько памяти забирает основная модель.
Плата за скорость — второй файл на диске. F16 весит 664 МБ и угадывает лучше всех, Q8_0 занимает 349 МБ и теряет 2% попаданий, Q4_K_M ужимается до 191 МБ ценой 3%. Ниже Q4_K_M Liquid AI квантовать не советует.
Как запустить. Готовые GGUF ставятся без сборки: `ollama run hf.co/LiquidAI/LFM2.5-2.6B-DSpark-GGUF:Q4_K_M`. LM Studio открывает модель одной ссылкой `lmstudio://open_from_hf?model=LiquidAI/LFM2.5-2.6B-DSpark-GGUF`, работают также Jan и llama.cpp.
В llama.cpp драфт подключается флагами к своей основной модели: `llama-server -m LFM2.5-2.6B-F16.gguf -md LFM2.5-2.6B-DSpark-F16.gguf --spec-type draft-dspark --spec-draft-n-max 10 --spec-draft-n-min 0 -fa on -ngl 99`. Поддержка уже в mainline (PR #27383/#25173). На сервере нужен билд SGLang с DSpark (PR #31041), флаг `--speculative-algorithm DSPARK`, дальше запросы идут по обычному OpenAI-совместимому адресу localhost:30000/v1.
Первоисточник