Reddit
Трюк с RefMod для сохранения консистентности локаций в Minimax H3
Пользователь Reddit представил метод поддержания визуальной целостности помещений при генерации видео с помощью модели Minimax H3. Суть подхода заключается в создании единого референсного изображения (RefMod) в виде сетки из 20 фотографий, где каждый кадр частично перекрывает предыдущий, что позволяет модели точно воспроизвести геометрию и расположение объектов. Использование нескольких отдельных референсов оказалось неэффективным, тогда как объединение их в одно изображение размером 2048×2048 пикселей обеспечило стабильность сцены.
score 40r/StableDiffusion