Loading prices...

Диффузионная модель

Обновлено 11.08.20261 мин

Диффузионная модель создаёт изображение, постепенно убирая шум: начинает со случайных пикселей и за десятки шагов превращает их в картинку, соответствующую запросу. На этом принципе работает большинство генераторов изображений.

Как это работает

При обучении к настоящим изображениям пошагово добавляют шум, пока не останется случайность, и модель учится обращать этот процесс — предсказывать, как выглядел кадр на шаг раньше. Научившись этому, она умеет идти от чистого шума к изображению.

Текстовый запрос направляет этот путь. Описание превращается в вектор, и на каждом шаге очистки модель сдвигает результат в сторону соответствия ему. Поэтому одна и та же формулировка при разном начальном шуме даёт разные картинки.

Число шагов определяет компромисс между качеством и скоростью: меньше шагов — быстрее и грубее, больше — дольше и детальнее.

Что стоит понимать

  • Модель не копирует картинкиОна усвоила закономерности, а не хранит исходные изображения. Хотя при переобучении отдельные фрагменты воспроизводятся почти дословно.
  • Текст на изображениях даётся тяжелоБуквы для такой модели — та же текстура, что и всё остальное, поэтому надписи часто выходят искажёнными.
  • Права на результат неочевидныПравовой статус сгенерированных изображений и обучающих данных различается по юрисдикциям и продолжает меняться.
  • Одинаковый запрос — разный результатПовторяемость обеспечивается фиксацией начального шума, а не текстом запроса.