19 июля 2026 г.
Ужать веса модели можно без дообучения: NVIDIA расписала PTQ во 2-й части из 3
19 июля NVIDIA выложила вторую статью из цикла в три части - целиком про post-training quantization в NVIDIA Model Optimizer. PTQ работает с уже обученной моделью: чекпоинт есть, дообучать ничего не надо. Первая часть объясняла сами понятия и зачем это нужно, третья обещает сборку inference-движка из FP8-чекпоинта.

Почему это важно: Первая часть цикла была теорией: что такое квантование и почему оно важно. Вторая перешла к рукам - конкретный инструмент и конкретный метод. Разница для инженера простая. Дообучать модель под низкую точность - это отдельный проект с данными и железом. PTQ - это прогон готового чекпоинта через утилиту. Из вводки не видно, какие модели брали в пример и сколько на них теряет точность: за цифрами придётся идти в сам текст.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
Что дальше: Третья часть цикла - про то, как из FP8-чекпоинта собрать движок инференса. Пока её нет, стоит взять свою модель, прогнать через Model Optimizer и сравнить качество с исходным чекпоинтом на своём наборе задач.
Первоисточник