Назад к дайджесту
Новость

Омнимодель для Алисы AI: как нам удалось подружить VLM и LLM

Команда Яндекса рассказывает, как в течение года объединяла текстовую LLM и визуальную VLM в единую омнимодель для Алисы, способную воспринимать текст и изображения целостно. Описываются технические сложности: проблемы ранних подходов, роль MoE-архитектуры, особенности омнипретрейна и различия в переносимости разных видов RL на большую модель. Статья сфокусирована на болезненной части — алайнменте.