9 июля 2026 г.
OpenAI: 30% задач в SWE-Bench Pro сломаны, бенчмарк отозван
OpenAI проверила SWE-Bench Pro и признала, что 30% задач бракованные, а сам бенчмарк больше не измеряет уровень фронтир-моделей в кодинге. Если вы выбираете модель по этому рейтингу, его результатам теперь верить нельзя.
Первоисточник