1 сентября 2026 г.
Нейросети в браузере ускорились в 2,5 раза: Hugging Face выложила WebGPU-ядра
Hugging Face открыла 207 WebGPU-ядер: на 809 тест-кейсах они считают в среднем в 2,57 раза быстрее ONNX Runtime Web.

Операция CumSum в браузере ускорилась в 301 раз, Einsum больше чем в 10 000.
Это крайние точки замера, который Hugging Face опубликовала 1 сентября вместе с библиотекой @huggingface/kernels. На 809 сравнимых тест-кейсах на GPU Apple M4 её ядра обогнали ONNX Runtime Web в среднем в 2,57 раза, медиана 1,90.
Считает при этом железо пользователя: модель работает прямо в его браузере. Ядро — это кусок кода, который выполняет одну математическую операцию модели, и от его скорости зависит, сколько человек ждёт ответа.
Ставится одной командой. `npm install @huggingface/kernels@preview`, пакет пока выходит под тегом preview. Вызов ядра занимает три строки: `getKernel("webgpu-kernels/ai.onnx.Add", { version: 1 })`, дальше передаёшь массивы и их форму. Загрузчик сам скачивает ядро с Hub, собирать ничего не нужно. Работает там, где есть WebGPU: проверка в коде одна строка, `"gpu" in navigator`. Доступность зависит от браузера, ОС, видеокарты и драйвера.
Разброс по операциям большой. Add ускорился в 3,52 раза, Softmax в 2,11, а MatMul всего в 1,14. Свой прогон гоняет Fleet, браузерный стенд на webgpu-kernels-fleet.hf.space: он прогоняет те же тесты и замеры на твоём железе, а результаты с согласия пользователя уходят в общую базу.
Раньше в Hugging Face ускоряли рантайм целиком. В феврале 2026 года компания вместе с командой ONNX Runtime переписала WebGPU-рантайм Transformers.js на C++: около 200 архитектур, запуск в Node, Bun и Deno, вчетверо быстрее на BERT-эмбеддингах. Теперь ускорение разложили на отдельные ядра, по репозиторию на ONNX-операцию, у каждого свой контракт, тесты корректности и кейсы замера.
Hugging Face называет 207 ядер стартовой точкой и обещает переносить улучшения в апстрим ONNX Runtime Web.
Первоисточник