GPU Slicing & Multi-Instance GPU (MIG)(Нарізка та віртуалізація відеокарт (GPU Slicing & MIG))
Технологія апаратного та програмного поділу однієї потужної відеокарти (NVIDIA H100 / A100 / RTX 6000) на кілька повністю ізольованих інстансів для оптимізації вартості хостингу інференсу.
1. Огляд концепції та системна проблема
Оренда сучасних серверних графічних карт (NVIDIA H100 або RTX 6000 Ada) коштує великих грошей:
- Багато спеціалізованих сервісів (наприклад, модель для генерації векторних ембеддінгів або мікро-модель класифікації) утилізують лише 5–10% обчислювальної потужності флагманського чіпа.
- Тримати цілу відеокарту вартістю $35 000 заради легкої моделі — це марнування бюджету компанії.
- Водночас простий запуск кількох моделей на одній карті через звичайний Docker створює ризик "шумного сусіда" (Noisy Neighbor): важкий запит однієї моделі може забрати всю VRAM і покласти всі сусідні сервіси.
GPU Slicing & MIG (Multi-Instance GPU) усуває це протиріччя, дозволяючи нарізати один графічний гігант на кілька безпечних, надійних і дешевих віртуальних відеокарт.
2. Архітектурна таксономія та ментальна модель
┌─────────────────────────────────────────────────────────────┐
│ NVIDIA HARDWARE MIG PARTITION │
├─────────────────────────────────────────────────────────────┤
│ PHYSICAL NVIDIA H100 (80 GB HBM3 / 114 SMs) │
├─────────────────────────────────────────────────────────────┤
│ ┌──────────────────────┐ ┌───────────────────┐ ┌──────────┐ │
│ │ INSTANCE 1: 3g.40gb │ │ INSTANCE 2: 2g.20gb│ │3: 1g.10gb│ │
│ │ • 40 GB VRAM │ │ • 20 GB VRAM │ │• 10 GB │ │
│ │ • 42 SM Cores │ │ • 28 SM Cores │ │• 14 SM │ │
│ │ • Runs 70B Coder LLM │ │ • Runs RAG Model │ │• Embeds │ │
│ └──────────────────────┘ └───────────────────┘ └──────────┘ │
│ • Ізольовані канали DMA, незалежна відмова (Fault Isolation)│
└─────────────────────────────────────────────────────────────┘
3. Практичні інженерні сценарії в продакшені
01. Налаштування профілів MIG на Ubuntu сервере
Активація та нарізка карти однією командою через утиліту NVIDIA:
sudo nvidia-smi -i 0 -mig 1
sudo nvidia-smi mig -cgi 9,19,19 -C
Сервер отримує три незалежні пристрої /dev/nvidia0, /dev/nvidia1, /dev/nvidia2, які можна прокинути в три різні Docker-контейнери або віртуальні машини.
02. Використання vGPU в Kubernetes кластерах
Хмарний провайдер нарізає пул відеокарт на дрібні фракції vGPU, дозволяючи розробникам замовляти под із лімітом nvidia.com/gpu: 0.25, сплачуючи лише чверть вартості години GPU.
4. Підводні камені, типові помилки та безпека
- Обмеження споживчих відеокарт: Технологія апаратного MIG присутня виключно на серверних картах корпоративного класу (A100, A30, H100, H200). На споживчих картах серії GeForce (RTX 4090 / 5090) доступний лише менш надійний софтверний Time-Slicing.
- Неможливість динамічної зміни розміру без зупинки: Зміна конфігурації профілів MIG вимагає перезапуску контейнерів, прив'язаних до цих інстансів.
5. Стратегічний висновок для інженера 2026 року
Нарізка відеокарт перетворює дорогу апаратну інфраструктуру на гнучкий, економічно вигідний ресурс. Вміння проєктувати мультитенантні інференс-контури на базі MIG дозволяє максимізувати віддачу від кожного орендованого графічного процесора.
FAQ: GPU Slicing & Multi-Instance GPU (MIG)
Пов'язані терміни
VPS Hosting (Віртуальний виділений сервер)
Модель надання ізольованих обчислювальних ресурсів за допомогою апаратного гіпервізора (KVM), що надає повний доступ рівня root до операційної системи Linux для розгортання автономних систем.
vLLM (Високопродуктивний рушій інференсу)
Провідний відкритий серверний рушій інференсу та обслуговування LLM, що здійснив революцію у пропускній здатності завдяки алгоритму віртуалізації пам'яті PagedAttention та неперервному батчингу.
Hetzner Bare-Metal vs Cloud Hyperscalers
Фінансовий та технічний аналіз собівартості інфраструктури: чому оренда виділеного заліза в європейських дата-центрах (Hetzner, OVH) обходиться у 5–10 разів дешевше за віртуальні машини AWS/GCP для ШІ-навантажень.
TensorRT-LLM & SGLang High-Speed Engines
Глибоко компільовані обчислювальні рушії для екстремальної оптимізації інференсу мовних моделей на серверах NVIDIA з оптимізацією графів, FlashAttention-3 та розширеним роутингом.