17 августа 2026 г.
Порядок задач вместо новых GPU: загрузка кластера выросла на 33 пункта
Dharma AI не добавила ни одной карты: та же восьмёрка GPU выдала 87% загрузки вместо 53,6%.

Прибавку дал не апгрейд, а очередь: карты те же, поменялся порядок задач.
Dharma AI прогнала семь сценариев на своём кластере и 17 августа выложила таблицу. Для тех, кто платит за GPU почасово, речь о деньгах: та же аренда отдаёт больше работы.
Что переставили. Раньше real-time inference жил на фиксированной резервации карт, а всё остальное вставало в очередь по времени прихода. Теперь резервации убраны, спрос на inference считают динамической кривой, а batch-задачи раскладывают по приоритету.
Горизонт планирования 24 часа с пересчётом каждые 30–60 минут, но на карты уходит только текущий шаг. Само размещение считается за 1–2 мс на пяти сценариях с конкуренцией за карты и за 15 мс на стенде из 64 GPU.
Загрузка выросла в шести сценариях из семи. На самом крупном стенде (64 GPU, 30 задач) она осталась ровно прежней: 44,9% до и 44,9% после. Причину ничьей авторы не разбирают.
Полезный выход с поправкой на приоритет задач вырос во всех семи прогонах: от 24,6% до 105,1%, в среднем на 52%. Заголовочные 33 пункта пришли из одного сценария, training-heavy на восьми картах и шестнадцати задачах.
Проверить нечем. Методики замера в посте нет: ни слова о том, гоняли это на живом кластере или в симуляции, только формула «на идентичном железе, на идентичных нагрузках». Прогноз длительности обучающих задач строится на 22 признаках, точность прогноза не приводится.
Взять аллокатор негде. В посте нет ни репозитория, ни пакета, ни API, ни демо, ни листа ожидания, а на странице организации Dharma-AI лежат OCR-модель на 4B, её бенчмарк и демо распознавания.
первоисточник