Reddit
Технический отчет SenseNova-U1.5: генерация в нативном 4K без VAE с пространственной реконструкцией патчей
SenseNova представила технический отчет по модели SenseNova-U1.5 — унифицированной модели на 8B параметров для понимания, генерации и редактирования изображений. Модель не использует внешний визуальный энкодер или VAE: изображения напрямую преобразуются в визуальные токены, каждый из которых соответствует области 32×32 пикселя. Ключевое улучшение по сравнению с U1 — совместная пространственная реконструкция соседних областей вместо независимого декодирования, что обеспечивает нативную генерацию в разрешении 4096×4096 и улучшает качество текста, инфографики и редактирования.
score 55r/StableDiffusion