2 сентября 2026 г.
Маленькая модель забирает мысли большой напрямую: мост закрыл половину разрыва в точности
Модуль-мост между двумя замороженными моделями поднял точность малой на 25% и обошёл передачу текстом на 10 пунктов.
Модель на 4 млрд параметров прошла половину пути до модели на 753 млрд. Веса обеих при этом не тронули.
Стартап Mostik показал 2 сентября 2026 года, как соединить две модели без текста. Между ними обучается отдельный модуль-мост, который переносит скрытые состояния (hidden states) из одной в другую, а сами модели остаются замороженными.
Почему не текстом. Перед тем как выдать один токен, модель строит больше сотни скрытых векторов: миллион чисел, 2 МБ внутреннего состояния. В текст уходит малая часть, остальное пропадает. Так авторы Mostik объясняют свою ставку.
В демо-связке задачу читает GLM-5.2 на 753 млрд параметров, а ответ пишет Qwen-3.5 на 4 млрд. Мост закрывает половину разрыва в точности между ними: маленькая модель прибавляет 25% к своей точности, на самых трудных задачах результат вырастает вдвое.
Раньше две модели связывали текстом: одна пишет, вторая читает написанное. Передача через мост обгоняет текстовую на 10 процентных пунктов при равных вычислениях. Вся связка требует в 2,5 раза меньше вычислений, чем одна модель среднего размера того же качества.
Мост построили 15 человек за четыре месяца, 12 из них с PhD. Среди них филдсовский лауреат 2010 года Станислав Смирнов, профессор Женевского университета. Автор подхода — CEO Саша Малышева, за плечами DeepMind и Google X.
Потрогать нечего. У Mostik нет ни публичного API, ни кода, ни статьи, ни списка ожидания: на сайте только адрес info@mostik.ai. Цифры из анонсного твита про 80% точности самых сильных моделей при 20-кратной скорости на технической странице компании нет.
Заявку Mostik на первое место в ARC-AGI-3 подтвердит или снимет только конец соревнования.
Первоисточник