Skip to main content

GPU Slicing & Multi-Instance GPU (MIG)

Технология аппаратного и программного разделения одной мощной видеокарты (NVIDIA H100 / A100 / RTX 6000) на несколько полностью изолированных инстансов для оптимизации стоимости хостинга инференса.

1. Обзор концепции и системная проблема

Аренда современных серверных графических карт (NVIDIA H100 или RTX 6000 Ada) стоит больших денег:

  • Многие специализированные сервисы (например, модель для генерации векторных эмбеддингов или микро-модель классификации) используют лишь 5–10% вычислительной мощности флагманского чипа.
  • Держать целую видеокарту стоимостью $35 000 ради легкой модели — это расточительство бюджета компании.
  • В то же время простой запуск нескольких моделей на одной карте через обычный Docker создает риск "шумного соседа" (Noisy Neighbor): тяжелый запрос одной модели может забрать всю VRAM и положить все соседние сервисы.

GPU Slicing & MIG (Multi-Instance GPU) устраняет это противоречие, позволяя нарезать один графический гигант на несколько безопасных, надежных и дешевых виртуальных видеокарт.

2. Архитектурная таксономия и ментальная модель

┌─────────────────────────────────────────────────────────────┐
│                 NVIDIA HARDWARE MIG PARTITION               │
├─────────────────────────────────────────────────────────────┤
│ PHYSICAL NVIDIA H100 (80 GB HBM3 / 114 SMs)                 │
├─────────────────────────────────────────────────────────────┤
│ ┌──────────────────────┐ ┌───────────────────┐ ┌──────────┐ │
│ │ INSTANCE 1: 3g.40gb  │ │ INSTANCE 2: 2g.20gb│ │3: 1g.10gb│ │
│ │ • 40 GB VRAM         │ │ • 20 GB VRAM      │ │• 10 GB   │ │
│ │ • 42 SM Cores        │ │ • 28 SM Cores     │ │• 14 SM   │ │
│ │ • Runs 70B Coder LLM │ │ • Runs RAG Model  │ │• Embeds  │ │
│ └──────────────────────┘ └───────────────────┘ └──────────┘ │
│ • Изолированные каналы DMA, независимая отказоустойчивость (Fault Isolation)│
└─────────────────────────────────────────────────────────────┘

3. Технический пайплайн и внутренняя механика

01. Настройка профилей MIG на сервере Ubuntu

Активация и нарезка карты одной командой через утилиту NVIDIA:

sudo nvidia-smi -i 0 -mig 1
sudo nvidia-smi mig -cgi 9,19,19 -C

Сервер получает три независимых устройства /dev/nvidia0, /dev/nvidia1, /dev/nvidia2, которые можно прокинуть в три разные Docker-контейнера или виртуальные машины.

02. Использование vGPU в кластерах Kubernetes

Облачный провайдер нарезает пул видеокарт на мелкие фракции vGPU, позволяя разработчикам заказывать под с лимитом nvidia.com/gpu: 0.25, оплачивая лишь четверть стоимости часа GPU.

4. Подводные камни, типовые ошибки и безопасность

  • Ограничения потребительских видеокарт: Технология аппаратного MIG присутствует исключительно на серверных картах корпоративного класса (A100, A30, H100, H200). На потребительских картах серии GeForce (RTX 4090 / 5090) доступен лишь менее надежный софтверный Time-Slicing.
  • Невозможность динамического изменения размера без остановки: Изменение конфигурации профилей MIG требует перезапуска контейнеров, привязанных к этим инстансам.

5. Стратегический вывод для инженера 2026 года

Нарезка видеокарт превращает дорогую аппаратную инфраструктуру в гибкий, экономически выгодный ресурс. Умение проектировать мультитенантные инференс-контуры на базе MIG позволяет максимизировать отдачу от каждого арендованного графического процессора.

/ Частые вопросыSchema.org FAQPage

FAQ: GPU Slicing & Multi-Instance GPU (MIG)

MIG — это аппаратная технология в картах серий A100/H100/B200, которая позволяет разделить один физический чип на 7 полностью изолированных аппаратных инстансов (GPU Instances). Каждый инстанс имеет собственные гарантированные вычислительные ядра, выделенную память VRAM и отдельную шину шифрования, исключая взаимное влияние задач.
/ Внутренняя перелинковка
Все термины
VPS и DevOps

VPS Hosting (Виртуальный выделенный сервер)

Модель предоставления изолированных вычислительных ресурсов с помощью аппаратного гипервизора (KVM), предоставляющая полный доступ уровня root к операционной системе Linux для развертывания автономных систем.

Читать термин
Модели и Инференс

vLLM (Высокопроизводительный движок инференса)

Ведущий открытый серверный движок инференса и обслуживания LLM, который произвел революцию в пропускной способности благодаря алгоритму виртуализации памяти PagedAttention и непрерывному батчингу.

Читать термин
VPS и DevOps

Экономика Hetzner Bare-Metal против облачных гиперскейлеров

Финансовый и технический анализ себестоимости инфраструктуры: почему аренда выделенного железа в европейских дата-центрах (Hetzner, OVH) обходится в 5–10 раз дешевле, чем виртуальные машины AWS/GCP для AI-нагрузок.

Читать термин
Модели и Инференс

TensorRT-LLM & SGLang Высокоскоростные Двигатели

Глубоко компилируемые вычислительные движки для экстремальной оптимизации инференса языковых моделей на серверах NVIDIA с оптимизацией графов, FlashAttention-3 и расширенной маршрутизацией.

Читать термин