./новости · 24 июля 2026 г.
новость
Русско-казахскую смесь стало чем переводить: модель на синтетике обошла коммерческие системы
источник: Хабр·
машинная выжимка · сверена с источником
24 июля MWS AI и несколько университетов показали модель, которая переводит смешанную русско-казахскую речь лучше известных коммерческих систем: так решила ручная оценка. Обучали её на синтетическом датасете. Реальных параллельных данных под языковую смесь почти нет, поэтому пары собрали из обычных казахско-русских корпусов.
Почему это важно: Раньше любой машинный перевод спотыкался на фразе, где половина слов казахские, а половина русские: учить его было не на чем. В Казахстане так говорят и пишут каждый день - в переписке, соцсетях, быту, - а размеченных пар под эту кашу в открытом доступе нет. Теперь пары делают из того, что уже лежит: берут обычные параллельные корпуса на двух языках и генерируют из них смешанные примеры. Практику это даёт рецепт, а не готовый сервис: ценность работы - в способе собрать датасет под язык, которого нет в обучающих наборах. Ни размера датасета, ни имени модели, ни того, где её взять, в анонсе не назвали.
Что дальше: Прочитать саму работу и повторить генерацию на своей паре языков: собрать смешанные примеры из двух обычных корпусов, дообучить и сравнить ручной оценкой с коммерческим API. Метрики автоматом на code-switching врут, поэтому сравнивать придётся людьми - как это сделали авторы.
первоисточник