GPU Slicing & Multi-Instance GPU (MIG)
Технология аппаратного и программного разделения одной мощной видеокарты (NVIDIA H100 / A100 / RTX 6000) на несколько полностью изолированных инстансов для оптимизации стоимости хостинга инференса.
1. Обзор концепции и системная проблема
Аренда современных серверных графических карт (NVIDIA H100 или RTX 6000 Ada) стоит больших денег:
- Многие специализированные сервисы (например, модель для генерации векторных эмбеддингов или микро-модель классификации) используют лишь 5–10% вычислительной мощности флагманского чипа.
- Держать целую видеокарту стоимостью $35 000 ради легкой модели — это расточительство бюджета компании.
- В то же время простой запуск нескольких моделей на одной карте через обычный Docker создает риск "шумного соседа" (Noisy Neighbor): тяжелый запрос одной модели может забрать всю VRAM и положить все соседние сервисы.
GPU Slicing & MIG (Multi-Instance GPU) устраняет это противоречие, позволяя нарезать один графический гигант на несколько безопасных, надежных и дешевых виртуальных видеокарт.
2. Архитектурная таксономия и ментальная модель
┌─────────────────────────────────────────────────────────────┐
│ NVIDIA HARDWARE MIG PARTITION │
├─────────────────────────────────────────────────────────────┤
│ PHYSICAL NVIDIA H100 (80 GB HBM3 / 114 SMs) │
├─────────────────────────────────────────────────────────────┤
│ ┌──────────────────────┐ ┌───────────────────┐ ┌──────────┐ │
│ │ INSTANCE 1: 3g.40gb │ │ INSTANCE 2: 2g.20gb│ │3: 1g.10gb│ │
│ │ • 40 GB VRAM │ │ • 20 GB VRAM │ │• 10 GB │ │
│ │ • 42 SM Cores │ │ • 28 SM Cores │ │• 14 SM │ │
│ │ • Runs 70B Coder LLM │ │ • Runs RAG Model │ │• Embeds │ │
│ └──────────────────────┘ └───────────────────┘ └──────────┘ │
│ • Изолированные каналы DMA, независимая отказоустойчивость (Fault Isolation)│
└─────────────────────────────────────────────────────────────┘
3. Технический пайплайн и внутренняя механика
01. Настройка профилей MIG на сервере Ubuntu
Активация и нарезка карты одной командой через утилиту NVIDIA:
sudo nvidia-smi -i 0 -mig 1
sudo nvidia-smi mig -cgi 9,19,19 -C
Сервер получает три независимых устройства /dev/nvidia0, /dev/nvidia1, /dev/nvidia2, которые можно прокинуть в три разные Docker-контейнера или виртуальные машины.
02. Использование vGPU в кластерах Kubernetes
Облачный провайдер нарезает пул видеокарт на мелкие фракции vGPU, позволяя разработчикам заказывать под с лимитом nvidia.com/gpu: 0.25, оплачивая лишь четверть стоимости часа GPU.
4. Подводные камни, типовые ошибки и безопасность
- Ограничения потребительских видеокарт: Технология аппаратного MIG присутствует исключительно на серверных картах корпоративного класса (A100, A30, H100, H200). На потребительских картах серии GeForce (RTX 4090 / 5090) доступен лишь менее надежный софтверный Time-Slicing.
- Невозможность динамического изменения размера без остановки: Изменение конфигурации профилей MIG требует перезапуска контейнеров, привязанных к этим инстансам.
5. Стратегический вывод для инженера 2026 года
Нарезка видеокарт превращает дорогую аппаратную инфраструктуру в гибкий, экономически выгодный ресурс. Умение проектировать мультитенантные инференс-контуры на базе MIG позволяет максимизировать отдачу от каждого арендованного графического процессора.
FAQ: GPU Slicing & Multi-Instance GPU (MIG)
Связанные термины
VPS Hosting (Виртуальный выделенный сервер)
Модель предоставления изолированных вычислительных ресурсов с помощью аппаратного гипервизора (KVM), предоставляющая полный доступ уровня root к операционной системе Linux для развертывания автономных систем.
vLLM (Высокопроизводительный движок инференса)
Ведущий открытый серверный движок инференса и обслуживания LLM, который произвел революцию в пропускной способности благодаря алгоритму виртуализации памяти PagedAttention и непрерывному батчингу.
Экономика Hetzner Bare-Metal против облачных гиперскейлеров
Финансовый и технический анализ себестоимости инфраструктуры: почему аренда выделенного железа в европейских дата-центрах (Hetzner, OVH) обходится в 5–10 раз дешевле, чем виртуальные машины AWS/GCP для AI-нагрузок.
TensorRT-LLM & SGLang Высокоскоростные Двигатели
Глубоко компилируемые вычислительные движки для экстремальной оптимизации инференса языковых моделей на серверах NVIDIA с оптимизацией графов, FlashAttention-3 и расширенной маршрутизацией.