Исходный размер 2480x3500

Обучение нейросети в стиле Jelenhule

Идея проекта

Интересно наблюдать, как искусственный интеллект пытается повторить чужой стиль, привнося в него свои интерпретации. В данном проекте использовалась генеративная нейросеть Stable Diffusion, обученная на моих собственных иллюстрациях, чтобы понять, насколько хорошо она сможет воспроизвести и интерпретировать мой стиль.

Основной задачей было исследовать, насколько нейросеть способна уловить ключевые элементы и особенности моего стиля, который отличается достаточно высоким уровнем детализации, но в то же время варьируется в зависимости от времени и используемых техник. Стиль одного художника может развиваться и меняться, и было важно понять, насколько нейросеть может распознать общие тенденции в разных примерах.

Для обучения нейросети была собрана коллекция моих работ, представляющих собой изображения, выполненные в разных годах. Все изображения либо в соотношении 1:1 (квадрат), либо очень близки к этому формату. Работы были подобраны так, чтобы в них чётко прослеживались характерные персонажи, и каждое изображение отражало разные этапы моего творчества, включая некоторые вариации в технике и стилистике.

Цель заключалась в том, чтобы нейросеть сама выявила характерные элементы, которые делают мой стиль уникальным, и начала воспроизводить их при генерации новых изображений.

Папка с изображениями

Список использованных в проекте инструментов:

— Stable Diffusion — обучение генеративной нейросети под свой стиль; — Google Colab — выполнение кода и генераций; — Hugging Face — получение токена для обучения нейросети, загрузка полученной модели на сайт; — Adobe Photoshop — изменение формата изображения (для обложки), создание коллажей.

Исходные изображения

Мой стиль можно охарактеризовать как семиреалистичный, с акцентом на детализированные лица и фигуры. Важным аспектом является выраженная динамичность в изображённых персонажах, а также искажение анатомических пропорций — все фигуры вытянутые, удлинённые. Цветовая палитра в моих работах чаще всего холодная, преобладают фиолетовые, синие и розовые оттенки. Многие из моих картин имеют темный тон.

big
Исходный размер 5262x1713

Примеры моих иллюстраций

Описание процесса обучения

В данном проекте использовалась генеративная нейросеть Stable Diffusion, основанная на модели Stable Diffusion XL, для обучения на моем собственном художественном стиле. Процесс обучения был проведён с использованием DreamBooth и LoRA.

Для удобства хранения данных и моделей был настроен доступ к Google Диску. Все изображения для обучения, а также результаты модели, такие как чекпоинты, сохранялись в папке на Google Диске, что позволило легко управлять файлам и сохранять результаты.

Исходный размер 570x83

Фрагмент кода

Изменение в настройках обучения

Процесс обучения был настроен с определёнными параметрами, которые были адаптированы для оптимизации работы модели, чтобы избежать перегрузки памяти и завершения работы с ошибками из-за слишком высоких настроек.

— Количество шагов обучения было уменьшено с 500 до 300. Это изменение было сделано для того, чтобы сократить время обучения и избежать перегрузки памяти, сохраняя при этом эффективность модели. — Чекпоинты были настроены на сохранение каждые 150 шагов. Это позволяет регулярно сохранять промежуточные результаты, что важно для предотвращения потери данных при возможных сбоях и для возможности продолжения обучения в любой момент. — Размер батча (train_batch_size) был установлен в 1, что является стандартной практикой при обучении моделей на ограниченных вычислительных ресурсах. Это уменьшает нагрузку на память и позволяет работать с большими моделями, хотя и снижает скорость обучения. — Разрешение (resolution) было уменьшено до 256, поскольку при более высоких значениях (например, 512) обучение останавливалось из-за нехватки ресурсов. Это также помогло сэкономить память и ускорить процесс генерации изображений.

Исходный размер 684x477

Фрагмент кода

В остальном, процесс обучения использовал стандартный код из репозитория SDXL DreamBooth LoRA, который включает в себя следующие этапы:

Загрузка предобученных моделей: Модель Stable Diffusion XL загружалась из репозитория stabilityai/stable-diffusion-xl-base-1.0, а также использовалась предобученная модель vae для улучшения качества изображений. Обучение модели на подготовленных данных, где нейросеть должна была уловить ключевые характеристики моего стиля, такие как яркие цвета, текстуры и характерные черты персонажей.

Процесс обучения

— Загрузка и подготовка данных: данные (мои изображения) загружались и обрабатывались с использованием предварительно подготовленных файлов (например, metadata.jsonl), которые содержали описания изображений. — Обучение модели: на этом этапе модель обучалась распознавать характерные элементы моего стиля, такие как цветовые переходы, текстуры, форма персонажей и их выражения. Применялись различные параметры, такие как градиентный чекпойнтинг и смешанная точность (FP16) для ускорения обучения и экономии памяти. — Сохранение чекпоинтов: промежуточные результаты сохранялись каждые 150 шагов с использованием параметра checkpointing_steps, что позволяло предотвратить потерю прогресса. — Генерация изображений: в конце обучения модель генерировала изображения, которые сравнивались с исходными, чтобы проверить, насколько точно нейросеть воспроизводит мой стиль.

Промт: art in Jelenhule style, a woman with black hair in the hat

Первая попытка генерации оказалась успешной в плане воспроизведения стиля. В сгенерированных изображениях действительно узнавались несколько ключевых элементов моего стиля и персонажа, который чаще всего встречался в работах, использовавшихся для обучения. Это подтвердило, что нейросеть смогла уловить основные характеристики, которые я стремилась передать.

Однако, как и в случае с любыми генеративными моделями, без огрехов не обошлось. Одной из основных проблем была анатомия персонажей, которая сохранилась в области лица, но с рядом ошибок в других частях тела. Особенно это было заметно в руках, которые традиционно являются слабым местом для большинства генеративных нейросетей. Нейросеть не обошла проблему и вместо нормальных пальцев создала осьминогоподобные конечности.

Исходный размер 1024x1024

Первая генерация, женский портрет по плечи

Промт: art in Jelenhule style, a full body woman looking at the camera, her skin is bright and her hair is brown and long

Исходный размер 1024x1024

Вторая генерация, женский портрет по плечи

Интересным моментом является то, что нейросеть смогла выделить ключевые особенности моего стиля, такие как удлинённые шеи и характерная вытянутость фигур и лиц. Это оказалось как плюсом, так и минусом: в процессе генерации нейросеть гипертрофировала эти черты, что делало персонажей всё более далекими от анатомической правильности, но в то же время сохраняло особую узнаваемость стиля.

Другим интересным моментом было то, что на моих изображениях присутствовали подписи. Нейросеть, заметив это, пыталась также воссоздавать эти элементы.

Промт: art in Jelenhule style, a portrait of a man with a beard and glasses, wearing a black hat and a focused expression

Исходный размер 1024x1024

Третья генерация, мужской портрет по плечи

Несмотря на то, что в обучающем наборе было всего одно изображение мужчины, нейросеть смогла успешно воспроизвести мужской образ в моём стиле. Она точно передала характерный стиль покраса, анатомические особенности и цветовую гамму, характерные для моих работ. Это показало, что нейросеть способна обобщать и применять принципы, даже если таких примеров в обучении было мало.

Удачные генерации

Портрет по плечи

Исходный размер 2607x2575

Генерации, женский портрет по плечи

Обучение нейросети в стиле Jelenhule
Проект создан 24.03.2026
Подтвердите возрастПроект содержит информацию, предназначенную только для лиц старше 18 лет
Мне уже исполнилось 18 лет
Отменить
Подтвердить
Мы используем файлы cookies для улучшения работы сайта НИУ ВШЭ и большего удобства его использования. Более подробную...
Показать больше