Назад к дайджесту
Reddit

GigaChat 3.1 Audio 10B: мультимодальная модель для работы со звуком

Представлена мультимодальная модель GigaChat Audio 10B, способная понимать и обрабатывать аудио напрямую. Архитектура использует Conformer-энкодер и MoE-декодер для сохранения качества текста и добавления функций распознавания речи. Модель обучена на датасете TimeGround-1M и поддерживает задачи временной привязки событий, суммаризации с таймкодами и работы с инструментами.

score 40r/LocalLLaMA