28 августа 2026 г.
Локальный ИИ тянет и на старом ПК: 6–8 токенов в секунду на GeForce GTX 1070
Компьютеру 2011 года хватило 8 Гбайт видеопамяти: Qwen 3.5 9B весит 5,4 Гбайт и печатает со скоростью чтения.

Максим Белоус запустил локальную модель на компьютере 2011 года. Core i7-2700K, 24 Гбайт памяти, видеокарта GeForce GTX 1070 с 8 Гбайт видеопамяти.
Qwen 3.5 9B в квантизации Q4 занимает 5,4 Гбайт и выдаёт 6–8 токенов в секунду. Ответ набирается примерно со скоростью чтения, ждать нечего.
Запуск в три шага. Скачать пакет, выбрать в модель-хабе приложения модель и квантизацию, нажать Run. Демонстрацию автор сделал на Unsloth Desktop, веса взял с Hugging Face. Приложение бесплатное, в статусе беты, сборки есть под macOS, Windows и Linux.
Unsloth Desktop сам раскидывает слои по оперативной памяти и видит несколько видеокарт, работает на NVIDIA, AMD, Intel, Apple Silicon и на голом процессоре. Вышло приложение 11 августа 2026, за 17 дней до статьи. Рядом стоят Ollama с командной строкой и LM Studio с обычным окном.
Потолок виден сразу. Qwen 3.8 27B в Q4 весит 16,1 Гбайт и в 8 Гбайт видеопамяти не влезает. При выгрузке в оперативную память скорость падает до 0,2–0,3 токена в секунду, и на сотню токенов уходит около семи минут. Комфортный порог по статье — видеокарта на 16 Гбайт и 64 Гбайт оперативной памяти.
Облачный ChatGPT домашняя сборка не заменит. DeepSeek-V4-Pro-0813 даже в сжатом виде весит 850 Гбайт, такое домашним железом не берётся.
Следующий рубеж домашнего железа — 16 Гбайт видеопамяти, за которыми открывается 27B.
Первоисточник