16 сентября 2026 г.
AMD matrix cores можно проверять до запуска расчёта: 20 млн тестов без расхождений
15 сентября авторы выпустили MATLAB Tensor Core v0.6 с моделями matrix cores для трёх архитектур AMD CDNA и tensor cores NVIDIA. Финальная валидация на 20 млн тестов для binary8 и ещё по 10 млн для fp16, bf16 и tf32 не нашла расхождений. Верхняя оценка вероятности ошибки составила от 6,91×10⁻⁷ до 1,38×10⁻⁶.

Статья описывает схему накопления, а MATLAB Tensor Core v0.6 превращает её в модель для прогона. Практик получает способ сравнивать поведение расчёта в одинаковых демонстрациях.
Три поколения AMD. Модели покрывают CDNA 1 для MI100, CDNA 2 для MI210 и MI250, CDNA 3 для MI300A и MI300X. CDNA 1 использует полноточное накопление, CDNA 2 последовательное pair-wise accumulation на базе FMA, CDNA 3 отдельную схему interleaved odd-even accumulation.
Разница видна в расчёте. В эксперименте с multi-word arithmetic на fp8-e5m2 MI300X и NVIDIA B200 расходились при большой внутренней размерности матриц или при шести словах. Ошибка B200 росла вместе с размерностью n.
Поставить можно. Нужно настроить CPFloat и добавить каталоги `models/` и `models/tools` в MATLAB search path. Toolbox работает без изменений в GNU Octave, а из Python подключается через MATLAB Engine API или Oct2Py. Исходники демонстраций находятся в каталоге `experiments`.
В демонстрации SMD авторы использовали матрицу 8×8, полиномиальный порядок 8, пороги ε=μ=10⁻⁴ и лимит 250 итераций. MI210 показал сравнительно большие отличия, но авторы называют этот результат предварительным.
Результат SMD пока остаётся предварительным.
Первоисточник
