20 августа 2026 г.
Российская LLM обошлась без NVIDIA: Cotype выдаёт 9 токенов в секунду на китайских GPU
Rubytech прогнала Cotype Pro 3 на восьми китайских ускорителях: первый токен через 8 секунд, дальше около 9 токенов в секунду.

Восемь китайских ускорителей, ни одной карты NVIDIA, российская модель на 27 млрд параметров. Rubytech замерила, что из этого вышло.
Для всех, кто считает инференс на своём железе, появился ориентир в числах: 8 секунд до первого токена и дальше около 9 токенов в секунду. Ответ идёт по словам, целым полотном текст не появляется.
Cotype Pro 3 от MWS AI подняли в ПАК «Машина искусственного интеллекта» Скала^р на восьми графических процессорах китайского производства. Ни производителя, ни модель ускорителей Rubytech не называет, так что повторить конфигурацию один в один не получится. Контекст замера — 27 тыс. токенов, около 10% от окна модели в 262 тыс.
Половину скорости дали руки. Настройка драйверов, программного окружения и средств оркестрации плюс контейнерная архитектура подняли показатели в 2–2,2 раза к исходной среде. До этого те же восемь карт выдавали вдвое меньше.
Rubytech называет результат сопоставимым с конфигурациями на NVIDIA H100 в популярных сценариях инференса. Замеров самой H100 компания не публикует, так что сравнивать пока не с чем.
Что можно потрогать. На Hugging Face у MTSAIR открыта Cotype-Nano на 2 млрд параметров (Apache 2.0, обновлена 29.11.2024). Pro и Light MWS AI ставит в закрытом контуре заказчика на Astra Linux, то есть через поставщика. Сама Cotype Pro 3 вышла 15.07.2026 и держит третье место на бенчмарке MERA.
Rubytech обещает следующий заход на новом поколении китайских ускорителей и на более широком наборе российских ИИ-сервисов.
Первоисточник