Назад к дайджесту
Reddit

Трюк с RefMod для сохранения консистентности локаций в Minimax H3

Пользователь Reddit представил метод поддержания визуальной целостности помещений при генерации видео с помощью модели Minimax H3. Суть подхода заключается в создании единого референсного изображения (RefMod) в виде сетки из 20 фотографий, где каждый кадр частично перекрывает предыдущий, что позволяет модели точно воспроизвести геометрию и расположение объектов. Использование нескольких отдельных референсов оказалось неэффективным, тогда как объединение их в одно изображение размером 2048×2048 пикселей обеспечило стабильность сцены.

score 40r/StableDiffusion