Назад к дайджесту
Reddit

Вышел Inflect v2: две сверхкомпактные модели синтеза речи менее 4 и 10 млн параметров

Автор опубликовал обновлённую версию Inflect v2 — две локальные модели синтеза речи на 3.96 и 9.36 млн параметров. В отличие от предыдущей версии, это полноценные системы без внешних вокодеров, работающие на CPU или CUDA. Модели демонстрируют высокую эффективность: Nano работает в 10 раз быстрее реального времени, Micro — в 6 раз, с качеством речи UTMOS около 4.4.

score 55r/LocalLLaMA