1 сентября 2026 г.
Модель весом 105 ГБ идёт на обычном MacBook: slotstream грузит в память только часть весов
Qwen3.8 на 105 ГБ весов выдаёт 12 токенов в секунду на MacBook M5 Pro с 48 ГБ памяти (замер автора, 01.09.2026).

Веса модели занимают 105 ГБ, памяти в ноутбуке 48 ГБ. Модель всё равно поехала: 12 токенов в секунду.
Раньше локальный запуск упирался в простую арифметику: модель целиком грузилась в память, поэтому гигант на 125 млрд параметров требовал больше 100 ГБ. Slotstream при старте поднимает только trunk на 3.8 ГБ, а автосайзинг держит пик на 32 ГБ и пересчитывает границу каждые 15 секунд, отдавая память другим приложениям.
Ставится одной командой. `curl -fsSL https://raw.githubusercontent.com/carloslfu/slotstream/main/install.sh | sh` кладёт бинарь в `~/.slotstream/bin`, повторный запуск той же команды обновляет. Дальше `slotstream doctor` проверяет машину, `slotstream pull` качает веса, `slotstream run --prompt "..."` запускает без сервера.
Требования жёсткие: только Apple Silicon и macOS 14 или новее. Веса лежат в 25 файлах на 105.3 ГБ, свободного места нужно около 110 ГБ. Реалистичный минимум — Mac с накопителем на 512 ГБ. Python ставить не нужно, движок написан на Swift поверх MLX и Metal. Модель поддерживается ровно одна, qwen3.8-flash-next:4bit.
Скорость упирается в память. Замеры автора через `slotstream doctor --sim-ram N`: 8 ГБ дают около 3 токенов в секунду, 16 ГБ около 4, 24 ГБ около 8, 48 ГБ и выше около 12. Выше 33 ГБ смысла нет, между 34 и 84 ГБ прироста не измерено.
Платить приходится ожиданием первого токена. На том же 48-ГБ M5 Pro первый токен приходит через 9 секунд при промпте в 2 000 токенов, через 39 секунд при 8 000 и через три минуты при 32 000.
Приложения можно не переписывать. `slotstream serve` слушает порт 11434 и отдаёт API, совместимые с Ollama и OpenAI. В версии 0.2.0 CLI Ollama к нему не подключался из-за строгого валидатора, в свежих сборках это починили.
Обещанный MTP-модуль уже выехал: спекулятивный декод в релизах 0.2.0–0.2.2 поднял скорость на 48-ГБ Mac с 10.3 до 12.8 токена в секунду, плюс 24%. Черновая голова весит 1.47 ГБ, принимается 85.8% черновых токенов, переключатель `--mtp auto|on|off`.
На Show HN 1 сентября проект собрал 229 баллов и больше сотни комментариев. В треде появились чужие замеры: на 16-ГБ M3 вышло 7–8 токенов в секунду, а на Mac mini M2 с внешним USB-диском 0.5. Скорость накопителя решает не меньше объёма памяти.
Последний релиз 0.2.6 вышел 3 сентября, а модель в списке поддерживаемых пока одна.
Первоисточник