Reddit
Стабильность против скорости: переосмысление ASR в эпоху голосовых агентов
Автор обсуждает, что традиционные системы распознавания речи предполагают чтение текста человеком, но для голосовых агентов ошибки в распознавании могут приводить к неверным действиям. Предлагается сместить фокус с скорости и точности на стабильность, например, принцип «никогда не редактировать, только добавлять». Упоминается модель Confucius r2t2, которая рассматривает ожидание/подтверждение как часть декодирования, и её открытый исходный код может стать основой для голосовых агентов.
score 40r/artificial