./новости · 19 июля 2026 г.
новость
Сжать модель без переобучения: NVIDIA описала PTQ в Model Optimizer во второй части из трёх
источник: developer.nvidia.com·
машинная выжимка · сверена с источником
19 июля NVIDIA выпустила вторую часть серии про квантование: она целиком про post-training quantization в Model Optimizer. Первая часть объясняла, что такое квантование и какие бывают методы. Третья покажет, как собрать инференс-движок из FP8-чекпоинта.
Почему это важно: Раньше у NVIDIA по этой теме была общая теория: типы квантования, методы, зачем оно нужно. Теперь есть практическая часть: какой инструмент взять и в каком порядке жать уже обученную модель. Post-training quantization переобучения не требует - берёшь готовый чекпоинт и сжимаешь его. Сколько при этом теряется качества и сколько прибавляется скорости, в анонсе не сказано.
Что дальше: Третья часть серии - про превращение FP8-чекпоинтов в инференс-движки. До неё прогони свою модель через Model Optimizer и замерь задержку и качество на своём наборе до и после сжатия.
первоисточник