Новость
Локальный ассистент для созвонов, часть 3: кто говорит — и почему я трижды ошибся, отвечая на этот вопрос
Автор делится результатами честного тестирования локальных моделей распознавания речи и диаризации (определения говорящих) на реальных рабочих созвонах. Выяснилось, что найденные дефекты оказались ошибками измерительного стенда, а не системы, а позиции в бенчмарке VoxCeleb не предсказали реальное качество эмбеддеров на живой записи.