Исходный размер 736x977

Обучение генеративной нейросети

Проект принимает участие в конкурсе

Концепция

Проект исследует пересечение классического балетного костюма и высокой моды через призму генеративного искусства. В основе лежит идея создания универсальной «модели-конструктора», способной интерпретировать балетную эстетику в современных материалах и цветах.

исходные изображения

Объект обучения: Сложносочиненное балетное платье, сочетающее элементы сценической пачки и вечернего наряда от кутюр.

Ключевой токен: TOKSTYLE.

исходные изображения

Задача проекта состояла в том, чтобы на основе небольшого датасета обучить нейросеть узнаваемому визуальному стилю. Необходимо было добиться того, чтобы модель понимала принципы построения сложного балетного платья и могла генерировать новые вариации, сохраняя уникальную эстетику в разных цветах, формах и ракурсах.

Процесс обучения

Процесс строился по следующим этапам:

Настройка среды: Google Colab (GPU Nvidia T4). Библиотеки: diffusers, accelerate, bitsandbytes. Модель: Stable Diffusion XL (SDXL 1.0) + LoRA. Параметры: 500 шагов обучения, разрешение 512px, оптимизатор 8-bit Adam. Тайминг: Само обучение длилось 52 минуты. Пост-обработка: Использование SDXL-Refiner (Upscaling) для прорисовки текстур.

Для обучения использовалась архитектура Stable Diffusion XL (SDXL) и метод LoRA (Low-Rank Adaptation), который позволяет «вживить» новый стиль в мощную базовую модель.

Датасет: Серия из 12 изображений-референсов, отобранных по принципу визуальной консистентности.

big
Исходный размер 1126x1192

Подготовка: Каждое изображение прошло автоматическую разметку моделью BLIP, что позволило нейросети понять нюансы: «layered tulle», «intricate embroidery», «bodice».

Параметры: 500 шагов обучения при разрешении 512px. Использование оптимизатора 8-bit Adam позволило сохранить высокую детализацию при ограниченных ресурсах GPU.

Исходный размер 1614x1042

Результат

Итоговая серия изображений представляет собой виртуальную капсульную коллекцию, созданную обученной моделью. Я специально вынесла объекты из контекста сцены в минималистичное пространство фотостудии, чтобы подчеркнуть детализацию самих изделий.

Исходный размер 803x803

Первоначальная идея заключалась в переносе сложной деконструкции балетного костюма в формат высокой моды. Нейросеть успешно усвоила и воспроизвела ключевые визуальные маркеры:

Архитектоника силуэта: Модель четко передает контраст между жестким, расшитым лифом (корсетная часть) и облаком многослойного тюля юбки. Удалось сохранить «балетную» посадку платья, характерную для классических пачек, но адаптированную под длину миди и макси.

Детализация фактур: На изображениях отчетливо видны микро-фактуры: плетение кружева, зернистость фатина и тяжелый глянец шелка. Нейросеть не просто рисует «белое пятно», она имитирует физические свойства тканей и их взаимодействие со светом.

0

Обучение LoRA (SDXL): Благодаря качественной разметке датасета через модель BLIP, нейросеть «поняла» семантику таких понятий, как intricate embroidery (сложная вышивка) и mannequin (манекен). Это позволило вычленить объект из хаотичного фона и представить его в чистом студийном пространстве.

Метод Upscaling & Refinement: Для финализации образов применялся метод «изображение-в-изображение» (Img2Img) с низким коэффициентом изменения (denoising strength 0.3). Это позволило «проявить» детали: кристальную вышивку и тонкие бретели, которые на базовом разрешении могли выглядеть размытыми.

Визуальный анализ и вариативность

Цветовая палитра: при изменении цветового промпта (от Ivory White до Emerald Green) нейросеть не просто перекрашивает пиксели, а меняет характер декора. Например, в темных вариантах (сапфировый, изумрудный) вышивка становится более контрастной и рельефной, имитируя золотое шитье.

Индивидуальность моделей: каждое платье в серии уникально по крою: в одном акцент сделан на объемные рукава-фонарики из прозрачного органзы, в другом — на каскадную структуру юбки. Это подтверждает, что модель не «копирует» исходники, а генерирует новые формы на основе выученных закономерностей.

Работа с пространством: использование светлой фотостудии с естественным боковым светом подчеркивает объем изделий. Тени ложатся мягко, что создает ощущение реального физического объекта, стоящего на манекене.

Заключение и инструменты

Задача проекта выполнена, удалось успешно интегрировать авторский визуальный код в нейросеть: модель «выучила» стиль и корректно воспроизводит его по запросу. Обучение на небольшой, но выверенной коллекции из 12 образов позволило создать цифровую «ДНК» уникального стиля. Теперь возможно управлять процессом создания целых коллекций, сохраняя авторский почерк в каждой детали от пышности фатина до блеска вышивки.

Использованные инструменты:

Google Colab / Python: среда разработки и код обучения. Diffusers / SDXL: базовая архитектура нейросети. Chatgpt: помощь в написании текста и промтов BLIP: автоматическая генерация текстовых описаний для датасета.

Файл с кодом

Обучение генеративной нейросети
Проект создан 27.03.2026
Мы используем файлы cookies для улучшения работы сайта НИУ ВШЭ и большего удобства его использования. Более подробную...
Показать больше