Концепция
Каждый человек в детстве думал, кем он станет, фантазировал на эту тему, примерял на себя разные образы. В проекте я решила воплотить эти детские представления с помощью нейросети: взять свои детские фотографии и показать, какими мы могли бы быть в своих мечтах.
Мне интересно, как технология может соединить детское воображение и взрослое восприятие — вернуть то чувство игры, где можно быть любым.
Подготовка окружения
Для начала проверяем подключение к GPU, устанавливаем нужные библиотеки, обновляем diffusers до актуальной версии и скачиваем скрипт обучения DreamBooth SDXL. Это шаг, который создаёт техническую основу для всего проекта.
Подготовка датасета
Теперь подготавливаем датасет из 21 детской фотографии: размер фотографий небольшой 512x512 для оптимизации процесса. На этом этапе задаётся папка "cher", куда будут загружаться фотографии, на которых нейросеть обучится распознавать образ.
Также выводим 5 случайных снимков, чтобы убедиться, что всё установилось как нужно.
Подготовка окружения к обучению
Далее с помощью BLIP к каждой фотографии из датасета генерируем подписи, к которым добавляем префикс (a photo of TOK girl), который в дальнейшем используем для генерации изображений. Обязательно освобождаем немного памяти, чтобы не нагружать среду.
Теперь устанавливаем необходимые библиотеки и авторизуемся на Hugging Face. Это обезопасит в случае слёта кода в Google Colab, так как можно будет продолжить генерировать изображения на сайте (туда перенесётся обученная модель).
Обучение модели
Теперь переходим к обучению самой модели. В параметрах задаем 500 и 250 шагов, для ускорения процесса обучения и меньшей задействованности GPU. Также обязательно передаем префикс к промтам, который присутствовал в обучающей выборке. Сохраняем модель на Hugging Face и получаем ссылку на страницу.
Генерация изображений
Изначально я начала генерировать изображения в Goggle Colab c помощью простых промптов. Результат выходил плохим: кривая анатомия, пугающие изображения. Было принято решение увеличить количество шагов до 1000, однако системе не хватило мощности GPU и генерации в Colab перестали работать. Хорошо, что мы перенесли обученную модель на Hugging Face.
Было принято решение продолжить генерировать изображения там, но с использованием нейросети Midjourney для написания подробных промтов. Результат получился намного лучше.
a photo of TOK girl, realistic portrait of a child as a princess, preserving original facial features and proportions, natural expression, correct anatomy, soft lighting, detailed realistic textures, high-quality photography, cinematic look, subtle background, gentle color grading, 8k detailed, depth of field
a photo of TOK girl, realistic portrait of a child as an astronaut, wearing a detailed space suit, stars reflecting in the helmet glass, preserving original facial features, natural expression, cinematic lighting, 8k detailed, depth of field, gentle cosmic glow
a photo of TOK girl, realistic portrait of a child as a forest fairy, glowing wings, soft light through leaves, natural facial features, serene expression, dreamy atmosphere, cinematic photography, detailed textures, bokeh background
a photo of TOK girl, realistic portrait of a child as a singer on stage, holding a vintage microphone, soft spotlight on face, natural smile and expressive eyes, detailed realistic textures, cinematic lighting, bokeh background, warm stage colors, lifelike skin and proportions, 8k photography




