22 сентября 2026 г.
Бенчмарки можно перепроверить: UK AISI выложил конфигурации 5 тестов
22 сентября UK AISI выложил в Evaluation Cards результаты, контекст и конфигурации 5 бенчмарков. В набор вошли HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro и Terminal-Bench 2.0. Релиз охватывает Claude Opus 4, 4.5 и 4.6, а также GPT-5, 5.2 и 5.4.

9 июня Evaluation Cards в beta показывали 101 955 результатов для 638 бенчмарков. Теперь UK AISI добавил к пяти тестам проверенные прогоны вместе с настройками и контекстом, по которым их можно повторить.
Свои результаты. Every Eval Ever принимает данные в schema version 0.3.0 после локальной проверки. Логи Inspect AI, HELM и lm-evaluation-harness конвертируются штатными командами, а итоговый PR в datastore Hugging Face проверяет участник EvalEval.
Проверка участником EvalEval остаётся последней ступенью перед публикацией результата в Every Eval Ever.
Первоисточник
