# Створюємо сториборд для Seedance: приклади workflow

> Повний посібник із побудови пайплайну GPT Image 2 + Seedance 2.0: фіксація персонажів, розробка сторибордів і мотивований безперервний рух камери.

Фундаментальна проблема прямої генерації відео з тексту полягає в тому, що відеомодель одночасно намагається придумати зовнішність персонажа, спроєктувати простір, збудувати композицію та розрахувати динаміку руху. Результат майже завжди непередбачуваний: змінюються риси обличчя, зникають предмети, а рух камери виглядає хаотичним.

Вирішення полягає в чіткому розподілі обов'язків: спочатку генератор зображень (GPT Image 2) бере на себе візуальне планування, а відеомодель (Seedance 2.0) — виключно динаміку та рух. GPT Image 2 надійно фіксує риси персонажа, одяг, стиль, освітлення та ключові фази сториборду ще до того, як відеомодель починає анімацію.

Такий workflow забезпечує:
- **Консистентність образу:** Сториборд задає обличчя, палітру, деталі гардероба та реквізит до першого кадру рендеру.
- **Керованість камери:** Seedance 2.0 фокусується на швидкості, траєкторії та безшовних переходах, а не на генерації сцени з нуля.
- **Передбачуваний таймінг:** Режисер відбирає та коригує фази дії до запуску ресурсомісткої відеогенерації.

---

## 1. Практичний кейс 1: Сториборд та генерація fashion-відео

Fashion- та lifestyle-ролики вимагають найвищої візуальної стабільності: точної передачі фактури тканин, чіткого образу моделі та вивіреного темпоритму для соціальних мереж.

### 1.1. Концепція сцени: сканування образу в Лондоні

Сюжет 15-секундного ролика «Scan My Outfit»: стильна жінка впевнено йде люксовою торговою вулицею Лондона повз вітрини бутиків. Лунає дзвінок, вона зупиняється та відповідає на прохання відсканувати образ. Камера виконує плавний скан з ніг до голови з графічними бірками брендів і завершується впевненою фінальною позою.

### 1.2. Крок 1: Генерація 7-панельного сториборду в GPT Image 2

У GPT Image 2 передається детальний системний промпт із фіксацією зовнішності персонажа, гардероба та структури з 7 панелей:

```text
Create a wide cinematic storyboard infographic (16:9) for a 15-second luxury fashion film titled "Scan My Outfit."

Style: ultra-realistic editorial photography with natural cinematic realism, inspired by Burberry, Dior, and Saint Laurent campaigns.

STYLE:
Photorealistic, luxury street fashion, soft natural sunlight, shallow depth of field, subtle handheld camera feel, authentic skin and fabric detail. No cartoon or over-processed look.

LAYOUT:
Clean white background, thin black borders, grid-based design.
- Static hero shot • Subtle wind movement • Window reflections • Elegant final frame
- Charlotte: "I guess so." • Friendly smile • Minimal lip movement • Relaxed confidence

INCLUDE:
- Top reference strip (character, outfit, hair, makeup, accessories, lighting, camera style)
- 7 numbered storyboard panels
- Bottom technical production bar

CHARACTER:
Charlotte Bennett — elegant British woman, late 20s. Fair skin, hazel eyes, chestnut low bun, gold earrings. Outfit: burgundy blazer + mini skirt, light blue silk blouse, red leather bag, metallic heels.

STORYBOARD (7 PANELS):
1. London Street Entrance — walking through luxury shopping street
2. Phone Alert — phone lights up while walking
3. Graceful Stop — pauses and answers call
4. "Scan your outfit" — close-up reaction shot
5. "I guess so" — soft reply with smile
6. Outfit Scan — head-to-toe scan with fashion labels
7. Final Pose — confident editorial hero shot

AUDIO:
Male voice: "Can you scan your outfit?"
Charlotte: "I guess so."

TECH STYLE:
iPhone cinematic look, 35mm lens, 24fps, HDR, soft stabilization, warm grading.
```

![SCAN MY OUTFIT 15-SECOND FASHION SHORT — ілюстрація 1](/api/guides-media/prompts/seedance-storyboard-workflow-guide/images/seedance-storyboard-workflow-guide-step-01.webp)

### 1.3. Крок 2: Генерація відео зі скануванням образу в Seedance 2.0

Отриманий сториборд завантажується як ключовий візуальний референс (Image Prompt), а рух скеровується текстовим описом динаміки:

```text
Photorealistic cinematic fashion video set on an elegant London shopping street inspired by Bond Street. A stylish British woman in her late 20s walks confidently past a luxury boutique. She wears gold earrings, a burgundy double-breasted blazer, matching mini skirt, a light blue ruffled silk blouse, a structured dark red leather shoulder bag, and metallic pointed heels. Her chestnut hair is styled in a sleek low bun.

Her phone rings. She glances at the screen, stops gracefully, and answers. A male voice asks, "Hello there, can you please scan your outfit?" She smiles and replies in a soft British accent, "I guess so." The camera performs a smooth head-to-toe scan, displaying elegant text labels for each outfit item, then ends on a confident editorial pose in front of the boutique window.

Bright natural sunlight, shallow depth of field, smooth gimbal movement, luxury editorial aesthetic, polished and sophisticated mood.
```

Завдяки зв'язці інструментів готове рекламне відео формується за 2 кроки без залучення знімальної групи, натурних зйомок та ручного трекінгу написів.

---

## 2. Практичний кейс 2: Кінематографічний ролик (історична сцена)

Другий кейс демонструє роботу зі складними динамічними сценами: середньовічний міський ринок на заході сонця, де камера безперервно маневрує крізь щільний натовп і заходить до напівтемної таверни.

### 2.1. Концепція 12-кадрової середньовічної сцени

Під час прямої спроби створити відео за одним зображенням автор отримав хаос: натовп рухався неприродно, візок із кіньми розчинявся в кадрі, а вхід до таверни з'являвся раптово без логічного переходу. Рішенням стало створення 12-кадрового скетч-сториборду з мотивованими точками зміщення уваги камери.

### 2.2. Крок 1: Генерація скетч-сториборду в GPT Image 2

```text
Create a storyboard for a cinematic medieval market sequence in a rough graphite storyboard sketch style. The storyboard should feel like a professional film pre-visualization sheet with 12 panels, each panel containing camera direction notes, lens information, motion arrows, and cinematic staging. Use monochrome pencil shading with gritty texture, realistic medieval architecture, wet cobblestone streets, crowds, horses, carts, banners, taverns, and atmospheric lighting.

The pacing should feel immersive and cinematic, beginning with slow observational shots before escalating into energetic tracking movement through the crowded marketplace. The camera should constantly redirect focus through foreground interruptions, moving objects, banners, and crowd motion to create natural cinematic transitions.

The sequence should follow this structure:
1. Street-level close-up, 50mm — slow drift. A young medieval woman exchanges apples with a market vendor. Busy crowd behind them.
2. Medium close-up, 50mm — slight push-in. Hands exchanging coins and fruit while background pedestrians pass.
3. Foreground interruption, 35mm — sudden lateral catch. A horse rapidly crosses frame, briefly obscuring the scene.
4. Medium tracking shot, 35mm — camera redirects and follows a wooden cart moving through the muddy market street.
5. Low tracking shot, 28mm — slight handheld drift beside the cart wheels splashing through puddles.
6. Forward tracking, 28mm — camera continues moving through hanging banners and dense crowd traffic.
7. Partial occlusion reveal, 35mm — a cloth banner sweeps across frame, revealing chickens scattering through the street.
8. Medium shot, 35mm — focus redirects onto a running street child weaving through chickens and pedestrians.
9. Tracking shot, 28mm — weaving camera movement following the child deeper into the marketplace.
10. Tavern approach, 35mm — slight push toward a dim medieval tavern entrance as the child runs inside.
11. Transition shot, 35mm — focus handoff. Tavern door swings open revealing a rugged armored warrior inside.
12. Interior reveal, 35mm — smooth inward glide. A tired medieval knight sits alone at a wooden tavern table beside a massive sword, lit by warm candlelight and atmospheric smoke.

The overall cinematic language should resemble high-end fantasy film storyboards used for production planning. Include handwritten technical annotations above every panel, motion arrows at the bottom of each frame, lens focal lengths, and camera operation terminology: tracking, push-in, redirect, focus handoff, foreground interruption.
```

![Сториборд середньовічної сцени — ілюстрація 2](/api/guides-media/prompts/seedance-storyboard-workflow-guide/images/seedance-storyboard-workflow-guide-extra-02.webp)

### 2.3. Крок 2: Відеогенерація з безперервним рухом у Seedance 2.0

Текстовий запит для Seedance 2.0 будується на таймлайні, де кожен рух об'єкта природно передає фокус наступній дії:

```text
FORMAT:
cinematic continuous shot / motivated camera movement / 15s

SCENE:
A crowded medieval market street inside a stone city at dusk. Narrow cobblestone road, wooden stalls, hanging banners, livestock moving through the crowd. Warm torchlight reflects on damp stones while light mist drifts between buildings.

CAMERA CONCEPT:
A continuous motivated camera move where each new moving subject entering the frame redirects the camera's attention. Every motion naturally hands the focus to the next subject.

SEQUENCE:
0:00–0:03 | Close street-level view of a market stall. CAMERA FOCUS: a woman bargaining with a merchant while selecting fruit from a wooden basket. She hands coins to the merchant.
0:03–0:05 | A horse pulling a heavy wooden cart suddenly crosses the foreground from the opposite direction, briefly blocking the frame. CAMERA SHIFT: the camera catches the cart and begins tracking it as it moves through the market.
0:05–0:07 | The cart squeezes past stalls and hits a hanging wooden sign. The sign swings violently across frame. CAMERA SHIFT: as the sign swings away, it reveals chickens scattering along the wet cobblestone street.
0:07–0:09 | A street urchin chases the fleeing chickens through the crowd. CAMERA SHIFT: camera tracks the boy weaving between villagers.
0:09–0:12 | The boy darts past the entrance of a tavern and disappears into the crowd. CAMERA SHIFT: the heavy wooden tavern door swings open as a patron exits.
0:12–0:15 | Camera glides smoothly through the open door into the dim tavern interior. Lantern light flickers on timber tables and curling pipe smoke. FINAL CAMERA FOCUS: a solitary battle-hardened knight in full plate armor sits quietly at a corner table, greatsword resting against the bench, slowly looking up.

STYLE & LIGHTING:
Layered medieval street life, natural crowd choreography, continuous camera movement. Warm torchlight on streets, dim lantern glow inside the tavern, atmospheric smoke catching light, photorealistic, 8k cinematic grading.
```

| Критерій оцінки | Одиночне зображення (Single Image) | Генерація зі сторибордом (Storyboard Workflow) |
| :--- | :--- | :--- |
| **Кількість спроб (Iterations)** | 5+ спроб до прийнятного результату | 1 успішна генерація з першого разу |
| **Переходи між планами** | Випадкові, різкі склейки та стрибки ракурсу | Кожен перехід мотивований дією в кадрі |
| **Цілісність сюжету** | Об'єкти зникають, простір викривляється | Усі 12 кадрів і сюжетна лінія збережені |
| **Керованість світла** | Світло мерехтить і змінює колірну температуру | Стабільне вечірнє світло факелів і таверни |

---

## 3. Операторський прийом «мотивований безперервний рух камери»

Чому сториборд кардинально змінює якість відеогенерації? Одне зображення не здатне повідомити моделі послідовність просторових зв'язків. Сториборд кодує операторську логіку в єдиній площині, яку нейромережа зчитує як цілісний просторово-часовий сценарій.

### 3.1. Філософія Спілберга: мотивація кожного зсуву ракурсу

Цей підхід спирається на класичну голлівудську операторську школу (зокрема стиль Стівена Спілберга): камера ніколи не рухається просто так. Її переміщення завжди зумовлене об'єктом у кадрі (**Motivated Camera Movement**).

Замість штучної панорами камера чіпляється за об'єкт, що рухається:
- Візок перетинає кадр → камера природно підхоплює його напрямок.
- Хитна вивіска перекриває огляд → її зсув відкриває курей, що розбігаються.
- Хлопчик біжить повз двері → камера за інерцією ковзає в отвір таверни.

### 3.2. Ланцюжок перемикання фокусу: від воза до лицаря в таверні

Коли кожен наступний рух починається в точці завершення попереднього, 15-секундний ролик сприймається як єдиний кінематографічний дубль, знятий на професійний стабілізатор.

![Схема безперервного руху камери — ілюстрація 3](/api/guides-media/prompts/seedance-storyboard-workflow-guide/images/seedance-storyboard-workflow-guide-extra-03.webp)

---

## 4. Стандартний пайплайн виробництва з 4 кроків

Усі комерційні проєкти на базі зв'язки GPT Image 2 + Seedance 2.0 дотримуються уніфікованого виробничого циклу.

### 4.1. Етапи робочого процесу: від задуму до фінального рендеру

| Крок | Дія | Інструмент | Завдання етапу |
| :--- | :--- | :--- | :--- |
| **Крок 1** | **Візуальна концепція** | Текстовий опис | Визначення героя, стилю, оптики, палітри та ключових дій |
| **Крок 2** | **Генерація сториборду** | GPT Image 2 | Формування 4–12 панелей із таймлайном і стрілками руху |
| **Крок 3** | **Image-to-Video рендер** | Seedance 2.0 | Анімація сториборду з мотивованим рухом камери |
| **Крок 4** | **Контроль та ітерація** | Seedance / редактор | Фінальна перевірка узгодженості та дрібні корекції |

### 4.2. Контроль якості та усунення асинхронності на ітераціях

Головне правило workflow: **спочатку доводимо до ідеалу статичний сториборд, і лише потім запускаємо рух**. Якщо на стадії сториборду персонаж втрачає деталі або незрозуміла геометрія приміщення, відеомодель посилить ці помилки у кожному кадрі.

---

## 5. Ключові принципи написання промптів для зображень та відео

Промпти для генераторів картинок і промпти для відеомоделей вимагають принципово різного інженерного підходу.

### 5.1. Промпти для GPT Image 2: максимальна візуальна деталізація

Для генератора зображень діє правило: **що детальніше, то краще**. Описуйте:
- Анатомію та риси персонажа (вік, форма обличчя, колір очей, зачіска, прикраси).
- Фактуру матеріалів (шовкова блуза, вовняний твід, потерта шкіра, мокра бруківка).
- Технічні параметри камери (35mm lens, f/1.8, soft stabilization, warm grading).
- Текстові підписи дій на кожній панелі сториборду.

### 5.2. Промпти для Seedance 2.0: фокус на динаміці камери та діях

У відеопромпті **не потрібно повторно описувати статичні деталі** — модель уже бачить їх у завантаженому сториборді. Фокусуйтеся виключно на кінетиці:
- Напрямок і швидкість переміщення камери (smooth tracking, slow push-in, focus handoff).
- Таймінги ключових подій (`0:00–0:03`, `0:03–0:05`).
- Причинно-наслідкові зв'язки руху (що саме змушує камеру змістити ракурс).

---

## 6. Сценарії комерційного застосування та просунуті поради

Запропонована зв'язка підходить для широкого спектра комерційних завдань, замінюючи цілу команду превізуалізації.

### 6.1. Галузеві кейси: від ігрових катсцен до реклами брендів

1. **Ігрові CG-катсцени:** Генерація концепт-артів персонажа з трьох ракурсів, створення сториборду битви та випуск повноцінної катсцени для інді-ігор без залучення студії анімації.
2. **Реклама спортивного одягу:** Створення сториборду з динамічними акцентами (підошва кросівок, дихаюча сітка) з подальшим рендером високоенергетичного проморолика.
3. **AI-дорами та серіали за вебтунами:** Швидке виробництво 30–60 секундних серій зі збереженням зовнішності героїв між епізодами.
4. **Спортивні навчальні відео:** Покроковий розбір складних рухів (подача в тенісі, техніка плавання) у повільному темпі (slow-mo).
5. **Реклама нерухомості та інтер'єрів:** Створення плавного відеотуру приміщенням від вхідної зони до тераси замість нудних статичних фотографій.

### 6.2. Професійні рекомендації режисера для стабільного результату

- **Створюйте мінімум 3–4 панелі:** Одиночний кадр не дає відеомоделі вектору розвитку сцени.
- **Прописуйте перешкоди переднього плану:** Перетин кадру конем, прапором або перехожим створює ідеальне природне маскування для зміни плану.
- **Плануйте ітерації:** Завжди закладайте 2–3 швидкі ітерації на уточнення швидкості руху в промпті.

---

## 7. Архітектура та переваги workflow: GPT Image 2 + Seedance 2.0

Зв'язка GPT Image 2 та Seedance 2.0 стала індустріальним стандартом створення AI-відео завдяки чіткій спеціалізації моделей.

```mermaid
flowchart LR
    A["Текстовий сценарій"] --> B["GPT Image 2\n(Візуальний дизайн і сториборд)"]
    B --> C["Мультипанельний сториборд\n(Фіксація обличчя, стилю і таймлайну)"]
    C --> D["Seedance 2.0\n(Динаміка і рух камери)"]
    D --> E["Готовий кінематографічний ролик"]
```

### 7.1. Розподіл ролей: статичний дизайн проти динамічного руху

- **GPT Image 2:** Відповідає за естетичну та композиційну частину (ключові кадри, анатомія, колір, освітлення, типографіка).
- **Seedance 2.0:** Відповідає за часовий вимір (фізика руху, траєкторія об'єктивів, зміна ракурсів, пластика анімації).

### 7.2. Економіка виробництва та швидкість перевірки гіпотез

Традиційний препродакшен подібного рівня займає дні роботи команди дизайнерів і моушн-аніматорів. Завдяки ШІ перевірка нової креативної концепції відбувається за лічені хвилини, що дозволяє тестувати десятки гіпотез до старту основного виробництва.

---

## 8. Часті запитання (FAQ)

### 8.1. Відповіді на типові питання щодо роботи зі сторибордами

> [!NOTE]
> **Що таке робочий процес «сториборд → відео»?**  
> Це двоетапний метод створення штучного відео, де спочатку в генераторі зображень створюється сітка з ключовими кадрами сцени (сториборд), яка потім подається у відеомодель як основа для мотивованого руху.

> [!TIP]
> **Чому не можна одразу генерувати відео без сториборду?**  
> Пряма генерація за текстом призводить до розмиття зовнішності персонажів, спотворення анатомії та випадкових стрибків камери. Сториборд повністю фіксує геометрію сцени до запуску прорахунку кадрів.

> [!IMPORTANT]
> **Який формат сториборду найкраще підходить для Seedance 2.0?**  
> Оптимальним є горизонтальне зображення 16:9 із 4–12 пронумерованими кадрами, стрілками руху та лаконічними підписами оптики (наприклад, 35mm tracking).

> [!TIP]
> **Як боротися з нестабільністю генерації у Seedance?**  
> Якщо рух виглядає смиканим, додайте в опис дієслова плавної дії (*glide, continuous tracking, slow push-in*) та обов'язково вкажіть подію переднього плану, що спрямовує зміщення фокусу.