Методология / LLM Index V0 / 25 июля 2026
Как читать рейтинг моделей
В рейтинге четыре независимых источника: Artificial Analysis, DeepSWE, SWE-Rebench и Aider. Каждый таб сортирует до 14 моделей по метрике источника и показывает лучший effort/config модели именно для этого прогона.
Vibecoding AI Coding Index - другой слой. Это наш внутренний композит четырёх сигналов, не пятый источник и не скрытая сортировка табов. Curated metadata добавляет тариф, провайдера, контекст и дату релиза, но не двигает модель в рейтинге источника.
Коротко
Активный таб определяет всю строку: оценку, место, плашку конфигурации, дату среза и свежесть. Если источник не измерял модель, она не попадает в его список. Оценка соседнего источника не подставляется вместо пропуска.
Публичный таб = метрика одного источника Vibecoding Index = внутренний взвешенный композит Curated metadata = справочные поля, не оценка
Проверять строку нужно внутри выбранного таба: там один источник, одна метрика и одна дата. Сравнивать места модели между табами можно, складывать сырые проценты напрямую нельзя.
Что попадает в главную таблицу
Сервер отдельно собирает до 14 строк каждого источника. Одна и та же модель может войти в несколько табов с разной конфигурацией; в активном табе остаются только его строки. По умолчанию открыт AA Index.
- Оценка и место - только из активного источника.
- Effort/config - лучший вариант модели для этого источника.
- Цена/задача - только фактическая цена, которую публикует активный источник. Тарифный proxy сюда не подставляется.
- $/1M output, провайдер, контекст и релиз - curated metadata. Это справочные поля, не компоненты оценки активного источника.
Машиночитаемый ItemList следует тому же правилу: он содержит только строки AA Index, до 14 моделей. Union нужен интерфейсу для переключения табов и не публикуется как отдельный рейтинг.
Как устроены данные
Первый слой - сырые observations. Это append-only журнал фактов: одна конфигурация модели, один источник, одна метрика и одна дата наблюдения. Новое значение создаёт новую запись, старое остаётся в истории.
Второй слой - cooked snapshots. Он хранит исходную оценку каждого источника отдельно, внутренний Vibecoding Index и curated metadata. Совпадение этих полей в одной записи не превращает метаданные или композит в источник.
Третий слой собирает публичный борд: выбирает лучший effort/config каждой модели отдельно для Artificial Analysis, DeepSWE, SWE-Rebench и Aider, затем обрезает каждый рейтинг до 14 строк. Браузер переключает готовые срезы и не пересчитывает формулу.
Как собираем источники
У каждого источника есть adapter. Adapter делает четыре вещи: забирает данные, парсит таблицу или API, проверяет поля и нормализует результат в общий формат. После этого данные попадают в raw observations.
API и JSON считаются источниками первого класса. HTML-таблицы тоже можно использовать, но мы считаем их более хрупкими и помечаем как scraped. Если источник временно упал, сайт не должен пустеть: старый snapshot остается на месте, ошибка логируется, источник идет на review.
Источники V0
Четыре источника оценок работают в двух ролях. На публичной странице это четыре самостоятельных таба. Во внутреннем индексе те же сигналы получают веса, указанные ниже; вес не меняет место модели внутри таба источника.
| Источник | Таб и метрика | Зачем нужен | Вес в композите |
|---|---|---|---|
| Artificial Analysis | AA Index: coding index | внешняя проверка силы модели в кодинге | 10% |
| DeepSWE | DeepSWE: pass@1 | якорь внутреннего композита; repo-agent задачи в реальном репозитории | 60% |
| SWE-Rebench | SWE-Rebench: resolved rate | SWE-подобный сигнал с отдельным набором задач | 20% |
| Aider | Aider: percent correct | практический сценарий редактирования кода через Aider | 10% |
Как считаем внутренний индекс
Формула ниже относится только к Vibecoding AI Coding Index. Она не меняет порядок четырёх табов источников. DeepSWE - обязательный якорь: без него модель не получает внутренний композит, но может оставаться в рейтинге другого источника.
DeepSWE 60% SWE-Rebench 20% Artificial Analysis 10% Aider 10%
Если DeepSWE есть, но нет одного из дополнительных источников, он не считается нулем. Доступные дополнительные источники нормализуются вместе с DeepSWE. Это сохраняет рейтинг похожим на рейтинг DeepSWE, а SWE-Rebench, Artificial Analysis и Aider уточняют внутреннюю оценку, но не могут сами создать композит без DeepSWE.
DeepSWE = 70 Artificial Analysis = 60 Vibecoding Score = (70 * 60 + 60 * 10) / (60 + 10) = 68.6
Почему цена отдельно
Цена/задача появляется только там, где активный источник публикует фактическую и сопоставимую стоимость задачи. Общий расход прогона без известного числа задач, оценка по токенам или тарифный proxy в эту колонку не попадают.
$/1M output - отдельный тарифный факт из curated metadata. Он помогает оценить бюджет, но не принадлежит прогону источника и не меняет ни его рейтинг, ни внутренний индекс.
Зачем confidence внутреннему индексу
Confidence показывает покрытие внутреннего композита. Если у модели есть DeepSWE-score, но нет подтверждения из других источников, индекс можно посчитать, однако доказательств у него меньше.
Отсутствующий дополнительный источник не считается нулем и не штрафует score напрямую. Он снижает coverage/confidence. В публичном табе действует другой контракт: нет измерения - нет строки, а свежесть показана датой и индикатором самого источника.
Как обновляется сайт
Backend сохраняет новые observations и пересчитывает snapshots. Затем сервер страницы заново выбирает лучший конфиг и до 14 моделей отдельно для каждого источника. У таба своя дата, свежесть и покрытие: обновление Artificial Analysis не перекрашивает старый Aider.
Frontend не считает внутренний индекс и не сливает источники. Расширенные сигналы, provenance и история изменений остаются в snapshots и карточках; публичный таб показывает только данные, нужные для проверки места модели.
Что индекс не обещает
Vibecoding Index V0 не означает, что vibecoding.ru сам прогнал модели через лабораторный бенчмарк. Он агрегирует опубликованные сигналы и остаётся внутренним аналитическим слоем, а не источником измерения.
Рейтинг источника и композит не заменяют проверку на своём проекте, стеке и бюджете. Начните с таба, чья методика ближе к вашей задаче, затем проверьте лидеров на собственном коде.