Skip to main content

Дифузійні моделі (Diffusion Models)(Дифузійні моделі на пальцях: як нейромережі малюють шедеври з чистого шуму)

Архітектура генеративних моделей (Stable Diffusion, Midjourney, FLUX), заснована на принципах нерівноважної термодинаміки. Працює у два етапи: пряма дифузія (поступове руйнування фото випадковим шумом) та зворотна дифузія (поетапне очищення шуму до кришталево чистого образу за текстовим описом).

1. Огляд концепції та призначення

Коли людина вперше бачить, як Midjourney чи FLUX генерує фотореалістичний портрет за описом «дівчина в неоновому дощовику під дощем у Токіо», здається, що модель просто «вирізає та склеює» готові шматочки чужих фотографій із Google.

Це поширена помилка. ШІ нічого нізвідки не вирізає.

В основі сучасного графічного ШІ лежить фундаментальна фізична концепція — Дифузійні моделі (Diffusion Models):

  • Вони не малюють пензлем, як художник.
  • Вони починають із полотна, повністю залитого випадковим білим шумом (як незахищений телевізійний канал без антени).
  • Крок за кроком модель видаляє цей шум, виявляючи з нього знайомі образи.

Ключовий інженерний принцип: як скульптор, який бере безформну брилу мармуру і за 25 ударів зубилом збиває все зайве, залишаючи прекрасну статую.

2. Процес народження образу: від шуму до фотографії

Крок 0 (100% шум) ──> Крок 8 (Плями світла) ──> Крок 16 (Контури) ──> Крок 25 (Шедевр!)
┌─────────────────┐   ┌─────────────────┐   ┌─────────────────┐   ┌─────────────────┐
│ ░▒▓█░▒▓█░▒▓█░▒▓ │   │  ░▒   ████   ▒░ │   │   ╭─────╮       │   │    👩‍🦰         │
│ ▓█░▒▓█░▒▓█░▒▓█░ │ ➔ │ ░▒  ████████ ▒░ │ ➔ │   │ ● ● │       │ ➔ │  Портрет дівчини│
│ ▒▓█░▒▓█░▒▓█░▒▓█ │   │   ░▒▒  ██  ▒▒░  │   │   ╰───╯         │   │  з неоновими    │
│ █░▒▓█░▒▓█░▒▓█░▒ │   │      ▒▒  ▒▒     │   │   /│   │\       │   │  відблисками    │
└─────────────────┘   └─────────────────┘   └─────────────────┘   └─────────────────┘

3. Чому текстовий промпт керує шумом

У процесі очищення шуму бере участь текстова модель (текстовий енкодер CLIP або T5):

  • Вона «перекладає» ваші слова «неоновий дощ» у математичні вектори.
  • На кожному з 25 кроків алгоритм дивиться на ці вектори і запитує себе: «Якщо я приберу ось цей піксель шуму, чи стане картинка більше схожою на неонове світло?».
  • Якщо так — шум прибирається саме в цьому напрямку.

4. Практичний висновок

Розуміння дифузії допомагає краще налаштовувати генератори:

  • Якщо поставити замало кроків (наприклад, 5 замість 20) — картинка вийде розмитою і незавершеною.
  • Якщо поставити забагато кроків (наприклад, 100) — час генерації зросте в 4 рази, а якість майже не зміниться.
  • Золотий стандарт для більшості рушіїв — 20–30 кроків (Steps).
/ Часті запитанняSchema.org FAQPage

FAQ: Дифузійні моделі (Diffusion Models)

Це кількість ітерацій очищення шуму. Зазвичай виставляють 20–30 кроків: на 1-му кроці картинка — це суцільний телевізійний шум («сірий сніг»), на 10-му починають проступати загальні плями світла і контури, а на 25-му кроці з'являються чіткі вії, відблиски та деталі шкіри.
/ Внутрішня перелінковка
Всі терміни
Моделі & Інференс

Midjourney (Провідна платформа художнього дизайну)

Провідний закритий генератор зображень із найвищим рівнем художньої естетики. Стандарт індустрії для дизайнерів, кінематографістів, концепт-артистів та рекламних креативників.

Читати термін
Моделі & Інференс

FLUX.1 (Сучасний король фотореалістичних зображень)

Провідна модель генерації зображень від Black Forest Labs (творців Stable Diffusion). Відома бездоганним фотореалізмом, ідеальним малюванням пальців рук та здатністю рендерити чіткий друкований текст.

Читати термін
Моделі & Інференс

Прихований простір (Latent Space)

Багатовимірний математичний векторний простір, створений нейромережею для внутрішнього представлення концепцій, стилів та образів. Дозволяє виконувати дивовижні арифметичні операції над поняттями: наприклад, «Король» мінус «Чоловік» плюс «Жінка» дорівнює «Королева».

Читати термін