Skip to main content

GPU Slicing & Multi-Instance GPU (MIG)

Tecnología de partición hardware y software de una potente tarjeta gráfica (NVIDIA H100 / A100 / RTX 6000) en múltiples instancias completamente aisladas para optimizar el costo de alojamiento de inferencias.

1. Visión general del concepto y problema sistémico

Alquilar modernas tarjetas gráficas de servidor (NVIDIA H100 o RTX 6000 Ada) es costoso:

  • Muchos servicios especializados (por ejemplo, un modelo para generar vector embeddings o un micro-modelo de clasificación) utilizan solo el 5-10% de la potencia computacional del chip insignia.
  • Mantener una tarjeta gráfica que cuesta $35,000 solo para un modelo ligero es un desperdicio del presupuesto de la empresa.
  • Al mismo tiempo, ejecutar varios modelos en una sola tarjeta a través de Docker convencional crea el riesgo de "vecino ruidoso" (Noisy Neighbor): una solicitud pesada de un modelo puede consumir toda la VRAM y afectar a todos los servicios vecinos.

GPU Slicing & MIG (Multi-Instance GPU) elimina esta contradicción, permitiendo dividir un gigante gráfico en múltiples tarjetas virtuales seguras, confiables y económicas.

2. Taxonomía arquitectónica y modelo mental

┌─────────────────────────────────────────────────────────────┐
│                 NVIDIA HARDWARE MIG PARTITION               │
├─────────────────────────────────────────────────────────────┤
│ PHYSICAL NVIDIA H100 (80 GB HBM3 / 114 SMs)                 │
├─────────────────────────────────────────────────────────────┤
│ ┌──────────────────────┐ ┌───────────────────┐ ┌──────────┐ │
│ │ INSTANCE 1: 3g.40gb  │ │ INSTANCE 2: 2g.20gb│ │3: 1g.10gb│ │
│ │ • 40 GB VRAM         │ │ • 20 GB VRAM      │ │• 10 GB   │ │
│ │ • 42 SM Cores        │ │ • 28 SM Cores     │ │• 14 SM   │ │
│ │ • Runs 70B Coder LLM │ │ • Runs RAG Model  │ │• Embeds  │ │
│ └──────────────────────┘ └───────────────────┘ └──────────┘ │
│ • Canales DMA aislados, fallo independiente (Fault Isolation)│
└─────────────────────────────────────────────────────────────┘

3. Pipeline técnico y mecánica interna

01. Configuración de perfiles MIG en servidor Ubuntu

Activación y partición de la tarjeta con un solo comando a través de la utilidad NVIDIA:

sudo nvidia-smi -i 0 -mig 1
sudo nvidia-smi mig -cgi 9,19,19 -C

El servidor obtiene tres dispositivos independientes /dev/nvidia0, /dev/nvidia1, /dev/nvidia2, que pueden ser asignados a tres contenedores Docker diferentes o máquinas virtuales.

02. Uso de vGPU en clústeres Kubernetes

El proveedor de nube divide un pool de tarjetas gráficas en pequeñas fracciones de vGPU, permitiendo a los desarrolladores solicitar pods con un límite nvidia.com/gpu: 0.25, pagando solo una cuarta parte del costo por hora del GPU.

4. Errores comunes, trampas y seguridad

  • Limitaciones de las tarjetas gráficas de consumo: La tecnología hardware MIG está presente exclusivamente en tarjetas de servidor de clase empresarial (A100, A30, H100, H200). En las tarjetas de consumo de la serie GeForce (RTX 4090 / 5090) solo está disponible el menos confiable software Time-Slicing.
  • Imposibilidad de cambiar dinámicamente el tamaño sin detener: Cambiar la configuración de los perfiles MIG requiere reiniciar los contenedores vinculados a estas instancias.

5. Estrategia de conclusión para el ingeniero de 2026

El GPU Slicing transforma una infraestructura hardware costosa en un recurso flexible y rentable. La habilidad para diseñar contornos de inferencia multitenant basados en MIG permite maximizar el retorno de cada GPU alquilada.

/ Preguntas frecuentesSchema.org FAQPage

FAQ: GPU Slicing & Multi-Instance GPU (MIG)

MIG es una tecnología hardware en las tarjetas de las series A100/H100/B200 que permite dividir un chip físico en 7 instancias hardware completamente aisladas (GPU Instances). Cada instancia tiene sus propios núcleos de computación garantizados, memoria VRAM dedicada y un bus de cifrado separado, excluyendo la influencia mutua de las tareas.
/ Enlaces internos
Todos los términos