1 сентября 2026 г.
Mercury 2.5 пишет ответ не по слову, а пачками: Inception заявляет 1 107 токенов в секунду
Mercury 2.5 Preview открыли на OpenRouter 31 августа, и до 8 сентября миллион входных токенов стоит $0.04.

OpenRouter
@openrouter
1/ Самая быстрая рассуждающая LLM теперь работает эксклюзивно на OpenRouter. Mercury 2.5 Preview от @_inception_ai выдаёт 1 107 токенов/сек за счёт параллельной генерации токенов. Уровень reasoning настраивается, инструменты вызываются параллельно, JSON приходит по схеме. Сделана для задач, где важна задержка.
Обычная модель выдаёт ответ по одному токену. Mercury 2.5 порождает и уточняет сразу несколько.
Так устроена вся линейка диффузионных моделей Inception, первый Mercury 2 вышел 24 февраля 2026. Считать секунды приходится там, где ответа ждёт живой человек или другой агент: голосовые пайплайны, поисковые агенты, сабагенты для кода.
Замер площадки. Цифру 1 107 токенов в секунду называет Inception, замер сделан на стандартных GPU. В карточке модели у OpenRouter медианная скорость стоит почти вчетверо ниже, 282 токена в секунду (2 сентября 2026).
У Mercury 2 контекст держался на 128K, а миллион входных токенов стоил $0.25. Mercury 2.5 Preview берёт 260K контекста и просит $0.04 за миллион входных и $0.15 за выходные. Вход подешевел в 6 раз, выход в 5. Скидку в 80% Inception держит до 8 сентября 2026, 07:00 UTC. Чтение кэша считают отдельно, по $0.004 за миллион.
Как подключить. Взять модель пока можно только через OpenRouter, вейтлиста и отдельного ключа Inception не нужно. В обычном OpenAI-совместимом запросе меняется слаг модели на `inception/mercury-2.5-preview`. Уровень reasoning настраивается, инструменты модель вызывает параллельно, JSON отдаёт по схеме через `response_format`.
По качеству Inception обещает уровень недорогих моделей первого ряда: GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite и Claude Haiku 4.5.
8 сентября 2026 в 07:00 UTC скидка Inception кончается, и станет видно цену без неё.
Первоисточник
