Концепция
Я посвятил проект визуальному исследованию автомобильной среды Таиланда через персонально дообученную генеративную модель. Целью было обучить LoRA так, чтобы она передавала характерные черты автомобилей: форму кузова, яркость и разнообразность цветов. А так же окружение в виде городской атмосферы или природы.


Исходные данные для обучения
Для обучения я использовал свой датасет: 62 фотографии автомобилей, снятых в Таиланде. Все изображения были приведены к формату 1:1 и подготовлены для обучения.
Триггер-токен модели: thaicar2026. Пример базового текстового запроса: a photo of thaicar2026 car


Процесс обучения
Обучение выполнено локально на MacBook Pro (Apple M3 Max, 48 GB RAM) в формате LoRA на базе runwayml/stable-diffusion-v1-5. Основные параметры:
resolution: 512×512 train steps: 1000 batch size: 1 gradient accumulation steps: 4 learning rate: 1e-4 Результат обучения: файл весов pytorch_lora_weights.safetensors.
Итоговая серия
В финальную серию вошли 9 изображений, отобранных по критериям:
читаемый силуэт автомобиля, целостная композиция кадра, стабильная передача стиля и атмосферы, вариативность сцен: город, природа, трасса вдоль деревни.


Анализ результата
В итоговых изображениях хорошо переданы:
общий характер автомобилей тайланда, вариативность кузовов, а так же индивидуальность каждого автомобиля (разнообразие необычных деталей на авто имитирует разнообразие тюнинга в Тайланде).
А так же передана общая атмосфера всегда ясной погоды, хаотичности города и красоты природы вокруг.


Описание применения генеративной модели
В проекте использовалась генеративная модель Stable Diffusion (runwayml/stable-diffusion-v1-5) с дообучением LoRA на собственном датасете. Назначение ИИ: генерация итоговой визуальной серии на основе пользовательского триггер-токена thaicar2026.
Активация виртуального окружения: задается VIRTUAL_ENV, PATH и префикс (.venv) в терминале.
Блок аргументов обучения: путь к датасету, prompt, resolution, batch size, max train steps, learning rate.


Загрузка изображений датасета через PIL, из-за этого в папке должны быть только картинки
Успешное завершение тренировки LoRA на 1000 шагах.
Итоговые веса LoRA сохранены в pytorch_lora_weights.safetensors и checkpoint-папках.
Вывод
В итоговой серии получилось передать главное, что я и хотел: узнаваемость тайских машин и окружения вокруг. Тот, кто был в Тайланде, увидев сгенерированные фото сразу поймет, что это именно Тайланд.
Так же пришлось поработать над тем, чтобы фотографии выглядели реалистично, потому что изначально генерировалось мыло слабо похожее на машины. В целом результатом доволен, сгенерированные фото не сильно отличаются от реальной фотографии на превью проекта.
