Reddit
Scenema Audio теперь в ComfyUI: запуск на 8 ГБ видеопамяти
Scenema Audio стал нативным узлом для ComfyUI — модель квантована для работы на видеокартах с 8 ГБ VRAM. Это диффузионная TTS-модель с zero-shot клонированием голоса и эмоциональной выразительностью, использующая Gemma 3 12B как текстовый энкодер.
score 40r/StableDiffusion