3 сентября 2026 г.
Алиса читает текст и картинки одной моделью: 57% против 43% в дуэли со старой версией
Яндекс год сводил текстовую и визуальную модели Алисы в одну. Омнимодель уже отвечает всем пользователям Alice AI.

Два года назад та же затея у Яндекса разваливалась: любая добавка картинок в обучение портила ответы на тексте.
Помогла смена архитектуры. На MoE картинки и текст ужились без заметной потери текстового качества, и Alice AI получила одну модель вместо двух. Устроен MoE так: на каждый запрос просыпается часть модели, а не вся целиком.
Раньше и теперь. До этого под капотом Алисы работали две генеративные модели: текстовая LLM и визуальная VLM. Между ними стояла стена из непрозрачного роутинга, разных форматов ответа и разной вёрстки. Теперь текст и картинку принимает одна модель. На сборку ушёл почти год.
Кому проигрывает, кому нет. Яндекс показал парные сравнения ответов:
- февральская версия Алисы, 57 на 43 в пользу омнимодели; - Qwen 3.5 397B без размышлений, 59 на 41 в пользу омнимодели; - тот же Qwen 3.5 с размышлениями, 53 на 47 против неё; - Gemini 3.1 Pro, 58 на 42 против неё.
Самым болезненным оказалось дообучение под задачи. RLVR переехал на большую модель легко: так дообучают на задачах с проверяемым ответом, вроде визуальной математики, геометрии и OCR. RLHF, дообучение на человеческих оценках, рассыпался. Модель-оценщик, обученную на версии 32b, на большую перенести не вышло.
Дообучение по картинкам дало +5 п. п. на геометрии относительно прода. В проде с апреля стоит решатель учебных задач Alice AI. Успешность каждого эксперимента Яндекс мерил тремя сотнями бенчмарков.
Претрейн, SFT и RL Яндекс делает сам, но стартует с открытых весов ради экономии вычислений и скорости разработки. Текстовая часть Alice AI выросла из весов Qwen3-235B.
До Gemini 3.1 Pro омнимодели пока 16 п. п. в парных сравнениях.
Первоисточник