Назад к дайджесту
Reddit

Scenema Audio теперь в ComfyUI: запуск на видеокартах с 8 ГБ памяти

Сервис выразительного текст-в-речь Scenema Audio стал нативным узлом для ComfyUI с квантованной моделью, работающей на 8 ГБ VRAM. Система поддерживает zero-shot клонирование голоса, эмоциональные директивы в тексте и использует Gemma 3 12B как текстовый энкодер.

score 40r/LocalLLaMA