2 сентября 2026 г.
Модель на своём ноутбуке вместо чужого API: Qwen3.6-27B выдаёт 25 токенов/с на MacBook
Гергей Орос хочет «достаточно хорошую» модель на своём ноутбуке, чтобы прайс чужого API перестал быть его проблемой.

Gergely Orosz
@gergelyorosz
И ещё: локальные модели выглядят неизбежными. Я хочу запускать «достаточно хорошую» модель на своём ноутбуке или даже на телефоне и не зависеть от платного API, цены которого меняют без меня. ИИ-лабораториям такое будущее не понравится, а вот облачные провайдеры будут в восторге.
На этом этапе я просто хочу, чтобы модели стали быстрее и дешевле. Интеллекта мне хватает. Пожалуйста, размер больше не важен, мне нужна производительность.
· 13,4 тыс. просмотров
6 августа 2026 DeepSeek повесил на страницу документации предупреждение: цены API вырастут «значительно».
Ни процента, ни даты компания не назвала. Совет разработчикам был один: планировать использование соответственно.
Орос выводит из таких историй правило. Пока модель крутится не у тебя, чужой прайс остаётся частью твоей сборки, и вернуть контроль можно только одним способом: запустить модель у себя.
Раньше и теперь. Открытая модель рабочего уровня требовала фермы видеокарт. Теперь это файл на 18 ГБ и одна команда в терминале: `ollama run qwen3.6:27b` поднимает Qwen3.6-27B с окном в 256K токенов.
Замер на живом железе тоже есть. Саймон Уиллисон 22.04.2026 запустил 16,8 ГБ сборку Qwen3.6-27B на MacBook Pro M2 с 64 ГБ памяти и получил 25,57 токена/с: ответ печатается быстрее, чем успеваешь читать глазами. Та же модель показывает 77,2% на SWE-bench Verified.
На телефоне это приложение Google AI Edge Gallery из Google Play (Android 12+) или App Store (iOS 17+), которое крутит Gemma 4 офлайн, без интернета на сам ответ. Уиллисон 06.04.2026 гонял на iPhone модель Gemma 4 E2B: загрузка 2,54 ГБ, разбор картинок и расшифровка аудио до 30 секунд, история чатов при этом не сохраняется.
Код, написанный под облако, переезжает сменой адреса. Кукбук OpenAI разбирает это на gpt-oss:20b: `ollama pull gpt-oss:20b`, минимум 16 ГБ памяти, локальный OpenAI-совместимый эндпоинт на http://localhost:11434/v1.
Арифметика против. Шон Гедеке 11.08.2026 посчитал облачный инференс примерно в 30 раз эффективнее домашнего по ресурсам: датацентровый B200 даёт втрое больше вычислений на ватт, чем потребительский RTX 4090, а сотни запросов там идут одной пачкой. Электричество домашней сборки обходится в $50–300 в месяц.
Пока облако держит тридцатикратную фору по эффективности, локальный запуск остаётся страховкой от прайса, а не заменой API.
Первоисточник