Исходный размер 1296x1728

Обучение генеративной нейросети для создания интернет-героя

Список использованных в проекте инструментов:

[1] Stable Diffusion — для обучение генеративной нейросети для изображения питомца; [2] ChatGPT 5.3 — для уточнения и улучшения качества промптов; [3] Google Colab — для выполнения кода и создания генераций; [4] Adobe Photoshop — для создания коллажей в лонгриде.

Концепция

post

Главный герой этого проекта — кошка по имени Кошка. Она не просто домашний питомец, а настоящий персонаж с характером: всегда в движении, всегда с эмоцией на морде, всегда в какой-то невероятной позе. Её фотографии невозможно пролистать равнодушно. Они вызывают моментальную реакцию, потому что в них есть что-то абсурдное и живое одновременно.

Кошка уже сама по себе — мем. Именно поэтому я решила превратить её в интернет-персонажа официально. Для этого я хочу обучить генеративную нейросеть на её фотографиях, чтобы модель могла воспроизводить её образ в любых ситуациях и передавать то, что делает Кошку Кошкой: её узнаваемую внешность и природную абсурдность.

Задача проекта

Создать цифровой прототип Кошки и обучить модель так, чтобы она стабильно воспроизводила её внешность и смешные экспрессии в разных локациях, и на основе этого сформировать образ интернет-персонажа, узнаваемого визуально и выразительного через текст.

Исходные изображения

Для обучения нейросети я собрала датасет из 20 фотографий Кошки из личного архива.

Исходный размер 1920x1596

Все изображения обрезались до формата 1:1 и сжимались до 512×512 px.

Процесс обучения

Сначала я проверяю доступна ли видеокарта NVIDIA и в каком она состоянии. И после этого я устанавливаю основные библиотеки для работы и обучения моделей ИИ, включая оптимизацию памяти и инструменты для LoRA.

Далее я скачиваю и устанавливаю свежую версию библиотеки diffusers напрямую с GitHub для работы со Stable Diffusion и DreamBooth.

Исходный размер 1650x1194

Теперь я подключаю хранилище, и потом подготавливаю функцию для показа изображений. Затем я загружаю картинки (датасет) и в конце проверяю их визуально.

Исходный размер 2122x1262

Теперь у меня подгружается предобученная модель BLIP и процессор для подготовки изображений. Затем создаётся функция, которая генерирует текстовые описания для изображений. После этого из папки собираются все изображения для обработки.

После этого для каждого изображения автоматически создаётся подпись, и результат сохраняется в файл metadata.json, формируя пары «изображение — описание» для последующего обучения модели.

0

Теперь я очищаю память и удаляю ранее загруженную модель, чтобы освободить ресурсы. Затем настраиваю кодировку UTF-8 для корректной работы с текстом. После этого инициализирую и конфигурирую библиотеку Accelerate для эффективного запуска обучения.

В конце я выполняю авторизация в Hugging Face для доступа к моделям и ресурсам, подготавливая систему к обучению.

Исходный размер 1552x588

Здесь можно увидеть основные парметры которая я задала для обучения модели. Такие как базовая модель, путь к датасету, размер изображений, шаги обучения, learning rate и другие настройки LoRA.

Этот блок запускает обучение модели и показывает его прогресс в реальном времени.

Исходный размер 1612x1228

Теперь я получаю готовую модель и формирую ссылку, по которой её можно открыть или использовать.

Исходный размер 2242x700

И в конце, я оформляю модель и публикую её на Hugging Face, чтобы можно было пользоваться ей и делиться с другими людьми. Это финальная часть кода.

0

Итоговые изображения

Сначала я попробовала сделать первый тестовый промпт с использованием созданного мной стиля "MRs cat":

[1] prompt = "MRs cat in disco club"

Исходный размер 1920x1080

Дальше я попробовала чуть конкретизировать промпт, чтобы выйти на более чистую стилистику изображения:

[2] prompt = "MRs cat working as a surgeon in MRs cat style, operating room, surgery tools, serious atmosphere"

И еще решила добавить "35mm" для более интересного эффекта:

[3] prompt = "MRs cat filing taxes in style, realistic photo, cinematic lighting, 35mm"

Обучение генеративной нейросети для создания интернет-героя
Проект создан 27.03.2026
Мы используем файлы cookies для улучшения работы сайта НИУ ВШЭ и большего удобства его использования. Более подробную...
Показать больше