22 сентября 2026 г.
Быстрее всего ИИ-продукт двигают свои замеры: Килпатрик советует отдать им больше четверти времени
Свой бенчмарк собирается восемью командами Kaggle CLI, а прогон моделей упирается в квоту $5 в сутки.

Logan Kilpatrick
@officiallogank
Если вы строите продукт на ИИ, больше четверти времени у вас должно уходить на то, чтобы делать бенчмарки и добиваться, чтобы лаборатории моделей этими бенчмарками заинтересовались. Самый простой способ ускорить развитие компании.
· 13,2 тыс. просмотров
Свой бенчмарк перестал быть проектом на квартал. Восемь команд в терминале и квота в $5 в сутки.
Публичные рейтинги, включая наш Индекс, отвечают на вопрос «какая модель сильнее вообще». Продукту нужен другой ответ: какая модель не ломает его сценарий. Собрать такой замер теперь может тот же агент, который пишет код.
Раньше и теперь. 14.01.2026 Kaggle открыл Community Benchmarks: любой собирает свой набор задач, прогоняет его и ранжирует модели Google, Anthropic и DeepSeek, доступ бесплатный в пределах квоты. 4.06.2026 сборка переехала в локальную среду (Antigravity, VSCode, Cursor) через Kaggle CLI и SDK kaggle-benchmarks. К этому дню сообщество накопило больше 10 000 задач-замеров.
Как собрать свой. Поставьте агенту скилл write-kaggle-benchmarks из репозитория Kaggle kaggle-skills, дальше задача формулируется обычным языком: «собери задачу, которая спрашивает модель, верно ли 300+140=460». Полный цикл укладывается в восемь шагов CLI. Сначала `kaggle b init -y`, потом питон-файл с декоратором `@kbench.task` и локальный прогон `python task.py`. Дальше пуш задачи, запуск на выбранной модели, `status`, `download` и `publish`.
Прогоны упираются не во время, а в деньги. Квота Model Proxy считается в долларах, в доках примеры $5 в сутки и $100 в месяц, остаток показывает `kaggle benchmarks quota`. Локальный init даёт урезанный список моделей, полный каталог работает на инфраструктуре Kaggle.
Без Kaggle есть Inspect, открытый фреймворк UK AI Security Institute и Meridian Labs: `pip install inspect-ai`, больше 200 готовых оценок, прогон командой `inspect eval simpleqa.py --model openai/gpt-4o`. Anthropic в своих доках по оценкам советует брать объёмом и автоматикой. Ответ сверяют с эталоном, считают близость по смыслу или судят другой моделью по шкале от 1 до 5. Много кейсов с авто-оценкой полезнее горстки ручных.
19.09.2026 в подкасте Sequoia Логан Килпатрик назвал замер, которого рынку не хватает, Harness Bench: никто не меряет, насколько модели приспосабливаются к разным обвязкам.
Первоисточник
