13 августа 2026 г.
Бенчмарк под свою задачу: Optima от Artificial Analysis гоняет твои примеры по ведущим моделям
Artificial Analysis отдала свой метод замеров наружу: с 13.08 в Optima можно собрать бенчмарк на собственных данных.

Artificial Analysis
@artificialanlys
Мы запускаем Optima. Теперь кто угодно может собрать собственный бенчмарк под свою задачу, опираясь на исследования и платформу Artificial Analysis. Строить и гонять бенчмарки трудно. Мы упаковали исследования и опыт Artificial Analysis в разработке бенчмарков в Optima - новую платформу, где модели меряются на ваших собственных нагрузках, а качество, скорость и цена сравниваются между собой. С Optima вы находите лучшую модель под свою задачу или равную по качеству замену текущей связке, которая обойдётся в 10 раз дешевле или быстрее. Мы вшили исследования и опыт Artificial Analysis в бенчмарках во весь рабочий процесс Optima: ➤ Стройте бенчмарки на своих данных и кейсах: собрать бенчмарк в Optima можно тремя способами. Залейте готовый датасет для оценки из своих файлов или с @huggingface, импортируйте трейсы агентов из платформ вроде @arizeai, @braintrust и @langfuse. Поставьте скилл Optima, чтобы собрать бенчмарк из контекста вашей рабочей среды и прошлых сессий. Либо просто опишите свой кейс, дайте примеры входов и ответов - и Optima соберёт бенчмарк за вас. ➤ Гоняйте на свежих моделях: запускайте один и тот же бенчмарк на ведущих моделях в один клик и держите свой лидерборд в актуальном виде сразу после выхода новых моделей. ➤ Приносите оценку Artificial Analysis в свой бенчмарк: оценивайте ответы по объективным критериям рубрики или парным сравнением - тем же подходом, что в бенчмарках Artificial Analysis, включая GDPval-AA и AA-Briefcase. Для парного сравнения выберите предпочтительные ответы на выборке, и Optima по этим предпочтениям проранжирует модели на всём вашем тестовом наборе. ➤ Сравнивайте качество, цену и время: Optima меряет не только качество модели. Рядом с оценками бенчмарка отслеживаются Cost per Task и Time per Task, есть разбивка по категориям и поддержка собственных метрик - так вы сравниваете компромиссы между моделями под свой конкретный кейс. К запуску - несколько примеров вопросов, на которые наши бета-тестеры ответили с помощью Optima: ➤ Какая модель сэкономит мне 10x на цене без заметной потери качества для моего агента по финансам и бухгалтерии? ➤ Какая модель лучше всего попадает в стиль письма юристов для моего юридического агента? ➤ Какая модель лучше всего распознаёт разные элементы в моём наборе картинок? Optima доступна уже сегодня. Соберите свой бенчмарк: https://artificialanalysis.ai/optima
Artificial Analysis мерила, кто умнее вообще. Optima меряет, кто умнее на твоей задаче.
Общий лидерборд собран под вопрос индустрии, а не под твой пайплайн. Ради этого Optima и сделана: найти модель, которая тянет ту же работу вдесятеро дешевле или быстрее текущей.
Свой бенчмарк раньше означал свой стенд: скрипты прогона, судью, хранение результатов и ручной пересчёт на каждой новой модели. Теперь один и тот же тест запускается по ведущим моделям в один клик, а лидерборд обновляется с выходом новой.
Откуда берётся тест. Готовый датасет заливается файлом или из HuggingFace. Трейсы агентов импортируются из Arize, Braintrust и Langfuse.
Данных нет - опиши задачу и приложи примеры входов и ответов, дальше Optima соберёт бенчмарк сама. Для кодинга ставится скилл Optima: он берёт контекст рабочей среды и прошлых сессий.
Как считают ответы. Оценка идёт по объективным критериям рубрики либо парным сравнением, тем же методом, что в GDPval-AA и AA-Briefcase. Размечаешь предпочтения на выборке, дальше Optima ранжирует модели по всему тесту.
Рядом со скором Optima пишет цену за задачу и время на задачу, разбивку по категориям и свои метрики. Бета-тестеры так искали замену модели в агенте для финансов вдесятеро дешевле, подбирали модель под стиль письма юристов и сравнивали распознавание объектов на своём наборе картинок.
Optima открыта с 13.08, цену прогонов Artificial Analysis не называет.
первоисточник