20 августа 2026 г.
Корпоративный ИИ можно собрать без NVIDIA: Rubytech прогнала Cotype 3 на китайских GPU
Rubytech собрала корпоративный ИИ на восьми китайских ускорителях: 8 секунд до первого токена на контексте в 27 тысяч.

Ускорителей NVIDIA в стойке нет вовсе. Российская модель на китайских GPU отдаёт первый токен за 8 секунд.
Rubytech завершила испытания Cotype 3 от MWS AI на модификации своего комплекса «Машина искусственного интеллекта Скала^р» с восемью китайскими ускорителями. Компания называет результат сопоставимым с конфигурациями на NVIDIA H100 в самых частых сценариях инференса.
Что намерили. На контексте в 27 тысяч токенов первый токен приходит примерно через 8 секунд, дальше каждый следующий добавляется за 111 мс и выше. Получается около девяти токенов в секунду (замеры 3DNews и ServerNews, 20.08.2026).
Раньше Скала^р МИИ продавали как функциональный аналог NVIDIA DGX SuperPOD и Huawei Atlas 900 PoD, до 1,5 петафлопс на кластер, из компонентов реестров Минпромторга и Минцифры. Теперь ту же коробку собрали на китайских GPU и запустили на ней российскую модель.
Выигрыш дала обвязка. Инженеры перебрали драйверы, программное окружение и оркестрацию и в отдельных сценариях получили в 2–2,2 раза больше, чем на исходной программной среде тех же ускорителей. Контейнерная архитектура, по словам компании, сокращает путь от тестов до промышленной эксплуатации.
Cotype 3 у MWS AI выходит в двух размерах: Pro на 27 млрд параметров и Light на 9 млрд. Обе мультимодальные, окно контекста 262 000 токенов, около 600 страниц, ставятся в закрытый контур заказчика с поддержкой Astra Linux и дообучением на корпоративных данных (Ведомости, 15.07.2026). Light помещается в 18 ГБ видеопамяти и работает на одном ускорителе уровня A100 или L4, в MERA набрала 0,792 (kod.ru, 02.04.2026).
Комплекс не лежит на витрине. Конфигурацию подбирает отдел продаж Скала^р по адресу info@skala-r.ru и телефону +7 495 234 2222. Публичного прайса, сроков поставки и инструкции по развёртыванию на сайте продукта нет, а максимальный масштаб заявлен как 32 узла по 8 GPU с обучением и инференсом одновременно, без остановки сервиса.
Первоисточник