16 сентября 2026 г.
Бенчмарки по физике завышали провалы ИИ: аудит подтвердил 12 ошибок моделей
В 502 случаях после экспертной проверки 6 закрытых physics-бенчмарков 143 ошибки признали дефектами задач, 95 ошибками grader и только 12 реальными ошибками моделей (препринт arXiv, 11.09.2026). На HLE-Physics GPT-5.6-Sol поднялся с 47,28% до 78,66% по mean@4, а corrected pass@4 достиг 91,38%.

Цифра physics-бенчмарка описывает не только модель, но и качество задач с проверяющей системой.
Раньше. На публичных наборах GPT-5.6-Sol показывал 26,50% на PHYBench, 13,00% на PRISM-Physics и 83,00% на UGPhysics. После аудита те же наборы дали 90,23%, 94,59% и 92,07%.
Три проверки. На CMT-Benchmark результат вырос с 61,00% до 87,24% по mean@4, а pass@4 с 72,00% до 97,96%. Из 50 задач сохранили 49. На CritPt исходный mean@5 GPT-5.6-Sol составлял 32,29% на 70 задачах. После аудита mean@4 достиг 87,50%, а pass@4 94,44% на 54 сохранённых задачах.
Причина разрыва. Эксперты нашли дефекты в 30 из 50 задач CMT-Benchmark и в 21 из 56 задач CritPt. В трёх аудитах публичных наборов 148 из 152 отклонённых ответов отнесли к ошибкам бенчмарка или grader, и только 4 к ошибкам модели. На PHYBench evaluator поставил 0 корректному ответу GPT-5.6-Sol из-за математически эквивалентной формы, отличавшейся от reference solution.
Граница вывода. Препринт проверяет well-posed closed-form задачи с проверяемым финальным ответом. Эксперты сверяли формулировки, reference solutions и ответы моделей. Авторы не связывают эти результаты со способностью моделей самостоятельно вести открытое physics-исследование.
Дальнейшие сравнения моделей в физике придётся читать вместе с аудитом задач и grader, а не по одной итоговой цифре.
Первоисточник
