Исходный размер 1800x2400

Создание инфраструктуры креативного производства инструментами ИИ

Проект принимает участие в конкурсе
big
Исходный размер 1672x941

Календарь продолжается — эксперимент по обучению Stable Diffusion XL на моей авторской серии из 22 календарных иллюстраций, посвящённых праздникам и дням рождения известных личностей.

В основе проекта моя серия из 22 квадратных иллюстраций для календаря, последовательно распределённых по датам с 23 января по 13 февраля. Поводами для изображений становились праздники, памятные даты и дни рождения известных людей.
Главной задачей исходной серии было не буквальное изображение события, а поиск простой визуальной метафоры. Каждый сюжет строился вокруг одного образа или действия: предмет мог менять свою функцию, увеличиваться в масштабе, соединяться с другим объектом или превращаться во что-то неожиданное.

Я хотела проверить, сможет ли модель подхватить не только ограниченную палитру, неровную линию и условных персонажей, но и сам принцип проекта — построение изображения вокруг одной простой визуальной метафоры.

big
Исходный размер 2170x1094

Календарь праздников, иллюстрации с помощью нейросети и человека

Исходная серия

Исходный размер 1656x1292

Календарь праздников, ручные иллюстрации

Для обучения я использовала 22 собственные иллюстрации размером 700 × 700 px.
Все изображения были созданы до начала работы с нейросетью и объединены общей визуальной системой: ограниченной палитрой, плоскими цветовыми пятнами, тёмным неровным контуром, упрощёнными персонажами и лаконичной композицией.
Несмотря на разные сюжеты, в серии сохраняется общий принцип: в центре изображения обычно находится одна визуальная ситуация, которая должна считываться быстро, но не быть полностью буквальной.

Исходный размер 2956x3481

Календарь праздников с 23 января по 13 февраля, ручные иллюстрации

Подготовка датасета

Исходный размер 1672x941

В датасет вошли только отдельные квадратные иллюстрации без календарной сетки, дат и типографики. Это было сделано специально, чтобы модель обучалась именно на изображениях, а не на оформлении календаря.
Для каждого изображения была автоматически создана текстовая подпись с помощью BLIP. К ней добавлялся общий маркер стиля:
metaphorical flat illustration in KSCALSTYLE style
Автоматические подписи оказались не всегда точными. Особенно сложно модели было описывать изображения, построенные на метафоре: она часто буквально перечисляла предметы и персонажей, не считывая отношения между ними.
Этот этап сам по себе показал разницу между распознаванием объектов и пониманием визуальной идеи.

Обучение модели

Исходный размер 1672x941

Для проекта использовалась Stable Diffusion XL с методом DreamBooth LoRA.
LoRA позволяет дообучить базовую модель на собственном наборе изображений, не переобучая Stable Diffusion целиком. В результате создаётся отдельный небольшой файл весов, который затем подключается к исходной SDXL для генерации.
Обучение проводилось в Google Colab на GPU T4.
Основные параметры первого обучения:
— датасет — 22 изображения;
— разрешение обучения — 512 × 512 px;
— 500 шагов;
— learning rate — 1e-4;
— mixed precision — fp16;
— использовались индивидуальные captions;
— промежуточные checkpoint сохранялись после 250 и 500 шагов.
После 500 шагов был получен файл LoRA pytorch_lora_weights.safetensors.

Генерация

Исходный размер 1810x1038

Сравнение стилистики ручных иллюстраций и нейросети

После обучения я стала использовать маркер KSCALSTYLE в новых промптах.
Первые эксперименты показали интересную особенность. Модель довольно быстро переняла внешние признаки серии — цвета, характер линии и тип персонажей, — но сама по себе не всегда продолжала принцип визуальной метафоры.
Например, если в запросе было только название праздника, модель могла создавать декоративную композицию из многочисленных тематических символов.
Поэтому структура промптов постепенно изменилась. Вместо общего: a metaphorical illustration for Valentine’s Day in KSCALSTYLE style
я стала описывать конкретную визуальную ситуацию: two small figures assembling one heart from two separate pieces или:
a person climbing a ladder toward a small moon Дополнительно в промптах использовались формулировки: simple composition, one central visual metaphor, white background. Так генерации стали ближе к композиционному принципу исходной серии.

Итоговая серия

Исходный размер 1622x1802
Исходный размер 1622x1802
Исходный размер 1622x918
Исходный размер 3268x1508
Исходный размер 1800x2400

Что модель смогла перенять

Наиболее устойчивым результатом оказалась палитра. В новых изображениях постоянно возвращаются розовый, сиреневый, жёлтый и тёмно-синий цвета исходного проекта.
Хорошо сохранились и другие формальные признаки:
— плоские цветовые пятна;
— тёмный рисованный контур;
— упрощённые человеческие фигуры;
— отсутствие реалистического объёма;
— намеренно немного наивная пластика;
— крупные предметы и изменение привычного масштаба.
В некоторых изображениях модель довольно точно продолжает и композиционный принцип серии: одна фигура взаимодействует с одним сильно увеличенным предметом, и именно это взаимодействие становится метафорой.

Что оказалось сложнее

Хуже всего модель воспроизводит не визуальный стиль, а логику метафоры.
Она может прекрасно повторить палитру и линию, но при слишком общем запросе заменяет метафору набором очевидных символов. Например, тема любви легко превращается в большое количество сердечек, а тема космоса — в декоративный набор планет.
Таким образом, обучение на авторской серии не означает, что модель автоматически усвоила способ придумывания образов.
Для получения наиболее убедительных результатов метафору приходилось сначала сформулировать текстом, а затем просить модель выразить её в изученном визуальном языке.
Это стало одним из основных выводов проекта.

Исходный размер 1672x941

Вариативность результатов

Создание инфраструктуры креативного производства инструментами ИИ
Проект создан 25.09.2026
Мы используем файлы cookies для улучшения работы сайта НИУ ВШЭ и большего удобства его использования. Более подробную...
Показать больше