Список использованных в проекте инструментов:
[1] Stable Diffusion — для обучение генеративной нейросети для изображения питомца; [2] ChatGPT 5.3 — для уточнения и улучшения качества промптов; [3] Google Colab — для выполнения кода и создания генераций; [4] Adobe Photoshop — для создания коллажей в лонгриде.
Концепция
Главный герой этого проекта — кошка по имени Кошка. Она не просто домашний питомец, а настоящий персонаж с характером: всегда в движении, всегда с эмоцией на морде, всегда в какой-то невероятной позе. Её фотографии невозможно пролистать равнодушно. Они вызывают моментальную реакцию, потому что в них есть что-то абсурдное и живое одновременно.
Кошка уже сама по себе — мем. Именно поэтому я решила превратить её в интернет-персонажа официально. Для этого я хочу обучить генеративную нейросеть на её фотографиях, чтобы модель могла воспроизводить её образ в любых ситуациях и передавать то, что делает Кошку Кошкой: её узнаваемую внешность и природную абсурдность.
Задача проекта
Создать цифровой прототип Кошки и обучить модель так, чтобы она стабильно воспроизводила её внешность и смешные экспрессии в разных локациях, и на основе этого сформировать образ интернет-персонажа, узнаваемого визуально и выразительного через текст.
Исходные изображения
Для обучения нейросети я собрала датасет из 20 фотографий Кошки из личного архива.
Все изображения обрезались до формата 1:1 и сжимались до 512×512 px.
Процесс обучения
Сначала я проверяю доступна ли видеокарта NVIDIA и в каком она состоянии. И после этого я устанавливаю основные библиотеки для работы и обучения моделей ИИ, включая оптимизацию памяти и инструменты для LoRA.
Далее я скачиваю и устанавливаю свежую версию библиотеки diffusers напрямую с GitHub для работы со Stable Diffusion и DreamBooth.
Теперь я подключаю хранилище, и потом подготавливаю функцию для показа изображений. Затем я загружаю картинки (датасет) и в конце проверяю их визуально.
Теперь у меня подгружается предобученная модель BLIP и процессор для подготовки изображений. Затем создаётся функция, которая генерирует текстовые описания для изображений. После этого из папки собираются все изображения для обработки.
После этого для каждого изображения автоматически создаётся подпись, и результат сохраняется в файл metadata.json, формируя пары «изображение — описание» для последующего обучения модели.
Теперь я очищаю память и удаляю ранее загруженную модель, чтобы освободить ресурсы. Затем настраиваю кодировку UTF-8 для корректной работы с текстом. После этого инициализирую и конфигурирую библиотеку Accelerate для эффективного запуска обучения.
В конце я выполняю авторизация в Hugging Face для доступа к моделям и ресурсам, подготавливая систему к обучению.
Здесь можно увидеть основные парметры которая я задала для обучения модели. Такие как базовая модель, путь к датасету, размер изображений, шаги обучения, learning rate и другие настройки LoRA.
Этот блок запускает обучение модели и показывает его прогресс в реальном времени.
Теперь я получаю готовую модель и формирую ссылку, по которой её можно открыть или использовать.
И в конце, я оформляю модель и публикую её на Hugging Face, чтобы можно было пользоваться ей и делиться с другими людьми. Это финальная часть кода.
Итоговые изображения
Сначала я попробовала сделать первый тестовый промпт с использованием созданного мной стиля "MRs cat":
[1] prompt = "MRs cat in disco club"
Дальше я попробовала чуть конкретизировать промпт, чтобы выйти на более чистую стилистику изображения:
[2] prompt = "MRs cat working as a surgeon in MRs cat style, operating room, surgery tools, serious atmosphere"
И еще решила добавить "35mm" для более интересного эффекта:
[3] prompt = "MRs cat filing taxes in style, realistic photo, cinematic lighting, 35mm"




