Reddit
Идея проекта: аудио-RefMods для MiniMax-H3 — перенос механики IP-Adapter на тембр голоса и звуковой стиль
Предлагается создать аудио-адаптеры, аналогичные визуальным IP-Adapter, для модели MiniMax-H3. Вместо обработки полной временной последовательности аудио, предлагается сжимать аудио-латентные признаки в несколько токенов (4-16) с помощью пулинга и внедрять их через кросс-внимание, что позволит эффективно передавать стиль голоса, акустику помещения или жанр музыки, экономя VRAM. Автор ищет отзывы и соавторов для создания прототипа.
score 40r/StableDiffusion