Skip to main content

MoE (Mixture of Experts - Суміш експертів)(Архітектура розріджених моделей Mixture of Experts)

Архітектурний підхід у глибокому навчанні, де важкі повнозв'язні шари трансформера розбиваються на десятки спеціалізованих підмереж («експертів»), а динамічний маршрутизатор активує лише невелику частину з них для кожного окремого токена.

1. Огляд концепції та системна проблема

У класичних повнозв'язних моделях (Dense Transformers) кожен вхідний токен активує 100% параметрів нейромережі. Якщо модель масштабується до 500+ мільярдів параметрів заради накопичення енциклопедичних знань, вартість обчислення кожного слова стає астрономічною: подвоюються вимоги до кількості GPU, експоненційно зростає енергоспоживання центрів обробки даних, а затримка генерації падає до неприйнятних для продакшену значень.

Проте людська мова та інженерні задачі є фундаментально розрідженими: коли ви пишете функцію валідації типів у TypeScript, вам не потрібні нейронні ваги, що відповідають за візантійську історію або біологічну класифікацію рослин.

Mixture of Experts (MoE, суміш експертів) розв'язує цю проблему за допомогою розрідженої активації (Sparsity). Замість монолітного блоку Feed-Forward створюється пул із десятків або сотень незалежних «експертів». Швидкий навчений маршрутизатор оцінює кожен вхідний токен і активує лише кілька найбільш відповідних експертів, скорочуючи витрати обчислень у 5–10 разів без втрати інтелектуальної ємності системи.

2. Архітектурна таксономія та ментальна модель

Архітектурна структура MoE-шару в сучасному трансформері:

┌─────────────────────────────────────────────────────────────┐
│                 SPARSE MIXTURE OF EXPERTS LAYER             │
├─────────────────────────────────────────────────────────────┤
│ 1. Input Token Representation (from Self-Attention Layer)   │
├─────────────────────────────────────────────────────────────┤
│ 2. Gating / Routing Network:                                │
│    p = Softmax(TopK(W_g * x)) ➔ Вибір Top-K експертів       │
├─────────────────────────────────────────────────────────────┤
│ 3. Expert Layer Partitioning:                               │
│    • Shared Experts: Завжди активні базові лінгвістичні ваги│
│    • Routed Experts (e.g. 256 спеціалізованих FFN підмереж) │
│      [Expert 1] [Expert 2] ... [Expert 42] ... [Expert 256] │
├─────────────────────────────────────────────────────────────┤
│ 4. Weighted Aggregation: y = Sum(p_i * Expert_i(x)) + Res   │
└─────────────────────────────────────────────────────────────┘
  1. Мережа маршрутизації (Router / Gating Mechanism):
    • Легковаговий лінійний шар із функцією Softmax, який розраховує афінність (відповідність) токена до кожного з доступних експертів.
  2. Гранулярність експертів (Coarse vs. Fine-Grained MoE):
    • Крупнозернисті (Mixtral 8x7B): 8 важких експертів, активуються 2 на токен.
    • Дрібнозернисті (DeepSeek V3/R1): 256 невеликих експертів + 1 постійно активний спільний експерт (Shared Expert), активуються 8 на токен. Це забезпечує значно тоншу спеціалізацію знань.
  3. Спільні експерти (Shared Experts):
    • Архітектурне нововведення для захоплення загальновживаних знань і синтаксису, що усуває потребу дублювати базові правила мови у кожному спеціалізованому експерті.
  4. Балансувальник навантаження (Auxiliary-Loss-Free Balancing):
    • Алгоритми динамічного коригування зміщень маршрутизатора, що запобігають перевантаженню окремих ядер GPU під час паралельних обчислень.

3. Технічний пайплайн та внутрішня механіка

Життєвий цикл проходження одного токена крізь шар MoE:

  1. Нормалізація та вхід у блок маршрутизатора: Токен після проходження механізму Self-Attention потрапляє на шар Gating Network.
  2. Розрахунок коефіцієнтів активації: Маршрутизатор множить вектор токена на власну матрицю вагів $W_g$, отримуючи оцінки відповідності. Застосовується оператор TopK, відбираючи, наприклад, 8 експертів із найвищими балами, а решта обнуляються.
  3. Паралельне виконання у вибраних експертах: Вектор токена дублюється і направляється виключно на обчислювальні конвеєри обраних експертів. Експерти паралельно виконують операцію SwiGLU: $$\text{FFN}(x) = (xW_{\text{gate}} \otimes \text{SiLU}(xW_{\text{up}}))W_{\text{down}}$$
  4. Зважене об'єднання результатів: Вихідні вектори від кожного з обраних експертів множаться на відповідні нормалізовані ваги маршрутизатора і підсумовуються.
  5. Додавання залишкового зв'язку (Residual Connection): Сума виходів експертів складається з вихідним вектором токена і передається на наступний шар трансформера.

4. Практичні інженерні сценарії в продакшені

01. Зниження собівартості корпоративного API у 3 рази

Компанія обслуговує високонавантажений B2B-сервіс із мільйонами запитів на день:

  • Замість використання важкої Dense-моделі на 70B параметрів розгортається дрібнозерниста MoE-модель (наприклад, DeepSeek V3).
  • Сервіс отримує ерудицію моделі на 671B параметрів, але сплачує за інференс та споживає електроенергію на рівні легкої моделі на 37B параметрів.

02. Високошвидкісний локальний інференс на Apple Silicon

Розробник розгортає модель Mixtral 8x22B на комп'ютері Mac Studio (128 ГБ Unified Memory):

  • Усі 140 ГБ вагів розміщуються у спільній пам'яті.
  • Завдяки тому, що на кожному кроці процесорні ядра прораховують лише 39B активних параметрів, швидкість генерації коду досягає комфортних 30 токенів/с, що було б неможливо для еквівалентної Dense-моделі такого обсягу знань.

03. Пакетна багатомовна кодогенерація

Агентська система одночасно обробляє мікросервіси на 10 різних мовах програмування (Python, Rust, Java, Elixir):

  • Маршрутизатор MoE автоматично розподіляє специфічні конструкції мов по відповідних експертах, забезпечуючи максимальну ідіоматичність синтаксису без взаємного розмивання пам'яті правил.

5. Підводні камені, типові помилки та безпека

  • Гігантські вимоги до розміру пам'яті (RAM Wall): Поширена помилка — думати, що якщо активні лише 37B параметрів, то модель поміститься у 24 ГБ відеокарти. Усі 671B параметрів повинні постійно знаходитися в пам'яті, інакше підвантаження експертів із SSD зупинить генерацію.
  • Дисбаланс обчислень у розподілених кластерах (Routing Bottlenecks): Якщо токени масово спрямовуються до одного експерта, GPU, яка утримує цю частину вагів, перевантажується (Hotspotting), змушуючи інші дорогі відеокарти кластера простоювати в очікуванні.
  • Підвищена складність сервінгу: Для ефективного обслуговування великих MoE необхідні спеціалізовані рушії інференсу (vLLM, SGLang) із підтримкою Expert Parallelism (EP) та тензорного розпаралелювання (TP).
  • Схильність до перенавчання на вузьких доменах: При спробі донавчання (Fine-Tuning) MoE-моделі на маленькому датасеті без належної регуляризації легко порушити баланс маршрутизатора, зруйнувавши загальні навички моделі.
/ Часті запитанняSchema.org FAQPage

FAQ: MoE (Mixture of Experts - Суміш експертів)

Вона розриває жорстку залежність між ємністю знань моделі та вартістю обчислень: модель може мати сотні мільярдів параметрів, але обчислювальна вартість (FLOPs) та затримка генерації залишаються такими самими, як для моделі середнього розміру.
/ Внутрішня перелінковка
Всі терміни
Моделі & Інференс

DeepSeek-R1 (Модель міркування DeepSeek)

Проривна відкрита модель міркування (Open Weights Reasoning Model) на базі 671B MoE архітектури, що довела можливість формування надскладного логічного мислення через чисте навчання з підкріпленням (GRPO).

Читати термін
Моделі & Інференс

LLM (Large Language Model - Велика мовна модель)

Фундаментальний клас нейромережевих архітектур на базі авторегресійного трансформера, що передбачає ймовірнісний розподіл наступних токенів і демонструє емерджентні властивості абстрактного мислення, синтезу коду та логічного висновку.

Читати термін
Моделі & Інференс

Швидкість генерації (TPS / TTFT / Latency)

Ключові інженерні показники продуктивності мовних моделей: Time to First Token (час реакції на вхідний контекст) та Tokens Per Second (швидкість потокової генерації вихідного тексту).

Читати термін
Моделі & Інференс

Frontier Models (Фронтирні моделі ШІ)

Найпотужніший клас штучного інтелекту на передньому краї світових досліджень (Claude 3.7 Sonnet, OpenAI o3/GPT-4.5, Gemini 2.0 Pro), що визначає межу сучасних можливостей міркування, автономності та кодування.

Читати термін