Новость
Перевод смешанного русского и казахского: обучение модели на синтетических данных
Статья разбирает научную работу по решению проблемы машинного перевода смешанных языковых кодов (кодопереключения) русского и казахского. Авторы предлагают генерировать синтетические датасеты на основе существующих параллельных корпусов, компенсируя нехватку реальных данных. Обученная на такой синтетике модель показала результаты лучше известных коммерческих систем в узком сценарии.