14 сентября 2026 г.
Локальные модели обслуживают больше запросов: доля выросла до 71,3%
С 2023 по 2025 год локальные модели подняли долю обслуженных запросов с 23,2% до 71,3% (arXiv, 11.11.2025). Исследование охватило 20 с лишним локальных языковых моделей, 8 локальных и облачных ускорителей и 1 млн реальных одноходовых chat- и reasoning-запросов. Локальные модели ответили правильно в 88,7% случаев.

IPW равен средней точности, делённой на средней мощности во время инференса. Каждый запрос запускали отдельно, с batch size = 1.
Раньше и теперь. В 2023 году локально выполнялась доля 23,2% запросов, а в 2025-м она достигла 71,3% (arXiv, 11.11.2025). IPW за тот же период вырос в 5,3 раза: 3,1 раза дали модели, 1,7 раза ускорители (блог Hazy Research, 11.11.2025).
Проверка на железе. Для одной и той же Qwen3-32B IPW на Apple M4 Max оказался в 1,5 раза ниже, чем на облачном NVIDIA B200 (блог Hazy Research, 11.11.2025). Выбор ускорителя меняет результат сильнее, чем кажется по названию модели.
Как повторить замер. Для profiler нужны Python >=3.13, uv, Rust stable и protoc >=3.0. На Apple Silicon поддерживаются macOS 13+ и чипы M1–M4, а замер мощности требует sudo-доступа к `powermetrics` (доки Hazy Research, 11.11.2025).
Автоустановка начинается с `git clone`, затем идут `cd intelligence-per-watt` и `bash intelligence-per-watt/scripts/setup.sh`. После установки Ollama профилируется командой `ipw profile --client ollama --model llama3.2:1b --client-base-url http://localhost:11434`, а результаты разбираются через `ipw analyze` и `ipw plot` (репозиторий Hazy Research, 11.11.2025).
Гибридный роутер из исследования снизил энергозатраты на 64%, вычисления на 62%, а стоимость на 59% против отправки всех запросов в cloud (блог Hazy Research, 28.11.2025).
Первоисточник
