30 августа 2026 г.
Модели для кода сравнили без усреднения баллов: 11 рейтингов сложили по местам
Гайд LLMLearner свёл 11 таблиц лидеров по коду в один зачёт: 268 дедуплицированных результатов, формула и веса опубликованы.

HumanEval выдаёт модели три результата подряд: pass@1, pass@10 и pass@100. В сводном зачёте это один голос, а не три.
Гайд LLMLearner собирает такой зачёт по коду и показывает каждый шаг счёта. Снапшот на 30.08.2026: 99 представителей модельных серий, 11 таблиц лидеров, 268 дедуплицированных результатов «модель–бенчмарк».
Место вместо балла. Сырые баллы разных шкал автор усреднять отказался: в зачёт идёт место модели в поле. Формула опубликована целиком — percentile = 1 − (rank − 1) / (field size − 1).
Ранг 1 из 21 даёт 100 из 100, ранг 11 даёт 50, последний ранг даёт 0. Сырые баллы остаются видны на страницах таблиц, но между собой не усредняются.
Общий зачёт складывается из четырёх частей: работа с репозиторием 40%, агентные задачи 35%, live coding 20%, генерация функций 5%. В «best overall» пускают только модели с доказательствами по репозиторию и хотя бы одним агентным или live-результатом.
Таблица идёт в расчёт от 15 оценённых моделей. Порог прошли 11, от LiveCodeBench со 111 моделями до CodeForces с 15.
Пропуск не ноль. Нет замера — доступные веса перенормируются, а рядом встаёт отдельная метка покрытия. High достаётся моделям с результатами во всех четырёх семействах задач, medium ставят при двух семействах и трёх результатах.
Наверху зачёта Claude Fable 5 с 98 из 100, и метка покрытия у него medium: три результата, квалифицированных live- и function-замеров нет. Слабое место метода автор называет сам — перцентиль прячет разрыв в сырых баллах и зависит от состава поля.
Гайд открыт бесплатно и без регистрации, там же фильтры по покрытию, открытым весам, цене и контексту, страницы моделей и попарные сравнения. Пересчёт видно по RSS-фиду без почты и аккаунта, последняя сборка датирована 30.08.2026.
Первоисточник