./новости · 25 июля 2026 г.
новость
Ling-3.0-flash держит 256K контекста при 5,1B активных параметров: бесплатно до 3 августа
источник: @r/ArtificialInteligence на X ↗·
машинная выжимка · сверена с источником
Ling-3.0-flash отдаёт первый токен быстрее 100 мс. Модель Ant inclusionAI: 124B параметров всего, 5,1B активных на запрос, 256K контекста, режим рассуждений включается переключателем. Доступ через OpenRouter, только API, весов не выкладывают; до 3 августа бесплатно.
Почему это важно: Обычный агентный цикл сегодня крутится на одной модели: она и планирует шаги, и дёргает инструменты, и каждый вызов идёт по полному прайсу большой модели. Ling-3.0-flash продаёт другую схему: планировщиком остаётся крупная модель, а исполнителем становится разреженная MoE с 5,1B активных параметров - её и тюнили под длинные цепочки вызовов инструментов и следование инструкциям. Границы названы честно: узкие доменные знания и мультимодальность - не её сильные стороны, фронтир-рассуждения она не заявляет вовсе. О цене после 3 августа в анонсе молчат.
Что дальше: Бесплатное окно закрывается 3 августа. До этой даты стоит прогнать свой агентный сценарий в двух раскладках - всё на текущей модели против «планировщик + Ling-3.0-flash на вызовах инструментов» - и сравнить время до первого токена и итоговый счёт.