Исходный размер 1140x1600

Бумажный домик

Проект принимает участие в конкурсе

NSTPAPER — мир, собранный из бумаги

NSTPAPER — экспериментальный проект по обучению Stable Diffusion XL авторскому визуальному стилю многослойной бумажной диорамы.
В основе проекта лежит идея перенести окружающий мир в условную материальную реальность, в которой люди, архитектура, растения, природные ландшафты и предметы будто вручную вырезаны из цветной бумаги и собраны из множества отдельных слоёв.
Главная задача состояла не в том, чтобы научить модель воспроизводить конкретный объект, а в том, чтобы передать ей целостный визуальный язык, который можно применять к совершенно разным сюжетам.
Характерными элементами NSTPAPER стали матовая бумажная фактура, видимые края вырезанных элементов, физическая толщина слоёв, упрощённые формы и мягкие тени, создающие ощущение настоящей бумажной конструкции.

0

Визуальный язык:1. Многослойность
Изображение строится как физическая композиция из отдельных бумажных планов.2. Материальность
Поверхности сохраняют матовую неоднородную фактуру бумаги и картона.3. Бумажный край
Контуры объектов выглядят не нарисованными, а физически вырезанными.4. Мягкая глубина
Тени между слоями создают объём без стремления к фотореализму.5. Упрощение формы
Сложные реальные объекты превращаются в более чистые и графичные силуэты.

Обучающий материал

Для обучения модели был сформирован датасет из 13 квадратных изображений, объединённых единой визуальной стилистикой.
При отборе изображений было важно сохранить разнообразие сюжетов, но сделать визуальные характеристики максимально последовательными. Благодаря этому модель должна была научиться связывать триггер NSTPAPER не с конкретным изображённым объектом, а с системой визуальных признаков.В основе изображений датасета лежат мои собственные фотографии.

Процесс обучения

В качестве базовой модели использовалась Stable Diffusion XL 1.0. Для адаптации модели под собственный стиль применялся метод LoRA (Low-Rank Adaptation), позволяющий обучить визуальные особенности без полного переобучения исходной модели.
Для каждого изображения датасета с помощью BLIP было автоматически сформировано текстовое описание. К captions добавлялся специальный триггер:
NSTPAPER
Он стал условным обозначением нового визуального стиля для модели.
Обучение проводилось на 13 изображениях при разрешении 512 px в течение 500 шагов.

Исходный размер 1024x1024

Бумажный город

Архитектурная сцена показывает, как NSTPAPER работает со сложной системой геометрических объектов.
Фасады, крыши, окна и элементы улицы разделяются на отдельные плоскости. Особенно хорошо стиль проявляется на границах зданий: вместо реалистичных материалов появляются бумажные поверхности, а пространство формируется за счёт наложения слоёв и теней между ними.
Архитектура при этом остаётся узнаваемой, но становится ближе к макету или декорации.

Исходный размер 1024x1024

Человек внутри бумажного мира

Генерация персонажа была необходима для проверки более сложных органических форм.
В отличие от архитектуры, человеческая фигура содержит множество плавных линий и мелких деталей. Модель сохраняет читаемый силуэт человека, одновременно упрощая его и подчиняя общей бумажной пластике изображения.
Окружение и персонаж существуют в одном материальном пространстве — человек не выглядит фотографией, помещённой поверх стилизованного фона.

Исходный размер 1024x1024

Бумажный ландшафт

Природный пейзаж оказался особенно подходящим для принципа многослойности.
Горы, река, деревья и облака естественным образом разделяются на планы. За счёт этого эффект бумажной диорамы становится частью самой пространственной структуры изображения: передний, средний и дальний планы воспринимаются как отдельные физические слои.

Исходный размер 1024x1024

Когда модель сопротивляется стилю

Генерация отдельного предмета стала наиболее показательным экспериментом.
При первой попытке модель стремилась изобразить фотоаппарат как реалистичный объект: появлялись пластик, металл, стекло и характерные для предметной фотографии поверхности.
Поэтому prompt был дополнительно уточнён характеристиками colored paper, cardboard, visible paper edges, layered paper pieces, а в negative prompt были добавлены реалистичные материалы.
После этого предмет стал значительно лучше соответствовать обученному визуальному языку.

Что модель смогла выучить?

Наиболее устойчивым результатом стала не конкретная цветовая гамма или определённый тип объектов, а сама логика построения изображения.
Во всех работах повторяются характерные признаки NSTPAPER: разделение объектов на слои, выраженные края элементов, матовые поверхности, упрощённая геометрия и мягкие контактные тени.
При этом стиль проявляется по-разному.
В архитектуре доминирует геометричность и ощущение макета. В природной сцене бумажные слои одновременно становятся пространственными планами. В изображении человека модель должна балансировать между узнаваемостью фигуры и стилизацией. Предметная генерация, напротив, показала границу возможностей LoRA: сильные знания базовой SDXL о внешнем виде реальных предметов иногда конкурируют с обученным стилем.
Таким образом, итоговая серия показывает не повторение одного изображения, а перенос единого визуального принципа на разные категории объектов.

Техническая часть

В проекте прилагается Google Colab Notebook, содержащий полный процесс подготовки датасета, формирования captions, настройки Stable Diffusion XL, обучения LoRA и проверки полученной модели.[https://drive.google.com/file/d/1PTUTzWiq-nTefZXfqjdJJeecPGHzFAP7/view?usp=share_link]

Описание применения генеративной модели

В проекте использовалось несколько инструментов на основе искусственного интеллекта.Основной генеративной моделью стала Stable Diffusion XL 1.0. На её основе методом LoRA была обучена собственная модель NSTPAPER, предназначенная для генерации изображений в разработанной стилистике.BLIP Image Captioning использовалась для автоматического создания текстовых описаний изображений обучающего датасета.ChatGPT (OpenAI) использовался как вспомогательный инструмент при работе с кодом, формулировании prompts и подготовке текстового описания проекта.ChatGPT (OpenAI), использовалась для преобразования исходных авторских фотографий в стилизованные изображения, из которых был сформирован обучающий датасет.

Бумажный домик
Проект создан 26.09.2026
Мы используем файлы cookies для улучшения работы сайта НИУ ВШЭ и большего удобства его использования. Более подробную...
Показать больше