2 сентября 2026 г.
Gemini 3.8 Flash пишет вдвое быстрее соперников: 305 токенов в секунду на выходе
Быстрее всех в замере, но по уму чуть ниже группы: 59 баллов против 60–66 у соперников.
305 токенов в секунду на выходе. Второй в том же замере выдаёт 154.
Скорость решает там, где модель пишет длинный ответ или агент гоняет цикл правок: та же работа занимает вдвое меньше времени.
Artificial Analysis намерила у Gemini 3.8 Flash около 300 токенов в секунду и 59 баллов Intelligence Index на режиме high. Задача на high проходит за 2,5 минуты, на low за 0,8 минуты.
Обратная сторона. Первый токен модель отдаёт через 13,3 секунды при медиане класса 2,99. В чате это заметная пауза перед ответом. На длинном прогоне агента она растворяется.
Модель много думает вслух: на прогоне бенчмарков она потратила 120M выходных токенов против медианных 71M, на 70% больше. Дешёвый тариф частично съедается этим объёмом.
Вводная цена держится до 31 декабря 2026 года: $0,75 за миллион входных токенов и $3,75 за миллион выходных.
Как переехать. В вызове API достаточно поменять строку модели на `gemini-3.8-flash`. Прежний параметр `thinking_budget` заменён на `thinking_level` с тремя значениями: low, medium по умолчанию и high. Значение minimal возвращает ошибку, а Gemini 3.7 Flash остаётся полностью поддержанной.
Разработчикам модель доступна в Google AI Studio, Android Studio, Antigravity и Stitch. Обычным пользователям её открыли в приложении Gemini, AI Mode в поиске и Google Sheets по подписке Google AI Pro или Ultra.
Прирост к предшественнику скромный: на HLE-Verified 54,9% против 53,6% у 3.7 Flash. Сама 3.8 Flash построена на базе 3.7 Flash, а не на новой базовой модели. Контекстное окно осталось прежним, миллион токенов.
Вводная цена кончается 31 декабря 2026 года: с 1 января тарифы удваиваются до $1,50 и $7,50 за миллион токенов.
Первоисточник