18 августа 2026 г.
Выбор поисковика для агента решает меньше, чем сам поиск: между первым и последним 10 баллов
Модель без поиска набирает 33 балла, с любым из семи провайдеров от 65 до 75. Индекс Artificial Analysis вышел 18.08.

Artificial Analysis
@artificialanlys
Представляем Artificial Analysis Search Index: замер того, как поисковые API-провайдеры работают по качеству, цене и скорости, когда ими пользуется агент. Начинаем покрытие с Parallel, Exa, Firecrawl, You (точка) com, Tavily, Keenable и Brave Поиск — один из самых важных инструментов для агентов. Провайдеры по-разному ищут, ранжируют и упаковывают результаты, и эти решения меняют то, что читает модель и как она действует. Мы расширяем покрытие бенчмарков на поисковые API, чтобы разработчики выбирали провайдера по измеренным качеству, цене и скорости. Каждый результат — это связка поискового провайдера с одной и той же моделью, GPT-5.6 Luna (medium). Модель работает внутри Stirrup, нашего open-source агентского харнесса, с инструментами поиска и загрузки страниц из веба. Меняется только поисковый провайдер за инструментом поиска. На старте в лидерборде 11 результатов по 7 поисковым провайдерам, и мы продолжим расширять покрытие: наша цель — самый точный и полный бенчмаркинг поисковых провайдеров для использования AI-агентами. Ключевые элементы Artificial Analysis Search Index: ➤ Три равновзвешенных бенчмарка: Search Index — это среднее по DeepSearchQA (900 широких исследовательских вопросов, требующих множества поисков, оценка по F1 на элементах ответа), BrowseComp (сложная подвыборка из 200 фактов, требующих многошагового браузинга) и AA-Omniscience (закрытая подвыборка из 600 вопросов, сбалансированная по 6 доменам) ➤ Один агент, разные поисковые провайдеры: у агента есть 25 ходов на задачу. Его инструмент веб-поиска возвращает нативный ответ провайдера (режимы контента приведены к сниппетам), максимум 10 результатов, источники-загрязнители отфильтрованы ➤ Базовая линия «только модель»: мы сравниваем результаты поискового агента с той же моделью, отвечающей одним выстрелом без инструментов, — видно, насколько каждый провайдер поднимает модель над её внутренними знаниями ➤ Цена и время на задачу: мы складываем время и деньги, потраченные и на инференс модели, и на поиск. Это принципиально: у поисковых API разная структура цены и задержек, но они окупаются там, где помогают агенту потратить меньше ходов и сэкономить на дорогом инференсе языковой модели Ключевые результаты: ➤ Самые сильные общие результаты — у Parallel, Exa и Firecrawl: 75, 74 и 73 балла Artificial Analysis Search Index на старте ➤ Все протестированные поисковые провайдеры заметно улучшают результаты на бенчмарках знаний: базовая линия «только модель» набирает 33 балла Search Index, а результаты с поиском — от 65 до 75 ➤ Точные результаты поиска снижают траты на инференс модели: Parallel Search (advanced) стоит за задачу дороже, чем Parallel Search (basic), но в сумме дешевле ($0,084 против $0,11). Более качественные результаты урезали расход токенов модели больше чем на 40% — это с запасом перекрыло возросшую цену поиска, да ещё и с более высокими баллами на бенчмарках ➤ Быстрые поисковые вызовы не гарантируют быстрых задач: у Parallel Search (turbo) самые быстрые поисковые вызовы среди линеек Parallel (0,51 с на запрос против 1,03 с у Parallel Search (basic)), но basic выше по качеству (73 против 67), а по общему времени на задачу они сходятся
Один агент, одна модель, семь поисковиков. По качеству разброс всего 10 баллов, по цене — девятикратный.
Artificial Analysis 18.08 открыла Search Index: замер того, как поисковый API работает под агентом, а не под человеком.
Стенд один на всех. Раньше провайдера брали по документации и цене за запрос. Теперь всем дают одну модель GPT-5.6 Luna (medium), харнесс Stirrup, 25 ходов агента на задачу и до 10 результатов на запрос. Меняется только поисковик за инструментом `web_search`.
Итоговый балл складывается из трёх бенчей поровну: DeepSearchQA (900 исследовательских вопросов, оценка по F1), BrowseComp (200 сложных задач с переходами по ссылкам) и AA-Omniscience (600 фактологических вопросов по 6 доменам).
Поиск решает больше вендора. Без инструментов модель набирает 33 балла. С поиском выходит от 65 до 75. Верх борда: Parallel (advanced) 75, Exa (auto) 74, Firecrawl 73. Внизу Tavily (basic) 66 и Brave 65.
Счёт за поиск на 1000 задач разлетается в 9 раз:
- Parallel (turbo): $13,64 - Keenable (pro): $23,69 - Firecrawl: $30,48 - Parallel (advanced): $47,93 - Exa (auto): $65,57 - Brave: $71,61 - Exa (fast): $78,11 - Tavily (basic): $126
Дорогой поиск экономит на токенах. Parallel (advanced) берёт за сам поиск больше, чем basic, а задача целиком выходит в $0,084 против $0,11. Точные результаты срезали расход токенов модели больше чем на 40%. Быстрый запрос быструю задачу тоже не гарантирует: turbo отвечает за 0,51 с против 1,03 с у basic, по времени на задачу они сходятся, а по качеству basic впереди — 73 против 67.
первоисточник
