Skip to main content

Parámetros de Muestreo (Temperature, Top-p, Min-p)

Hiperparámetros matemáticos del decodificador estocástico (Temperature, Top-P, Min-P, Penalties) que controlan la distribución de probabilidades para seleccionar el siguiente token, determinando el nivel de determinismo, precisión y creatividad del modelo.

1. Visión general del concepto y problema sistémico

Un modelo de lenguaje no genera texto listo directamente. En cada paso autorregresivo, la capa de salida del transformador produce un array de números crudos no normalizados — logits para cada palabra de un vocabulario de más de 100,000 elementos. La transformación de estos números crudos en un token seleccionado se regula mediante un algoritmo de decodificación.

Si siempre se elige el token con la probabilidad más alta (búsqueda codiciosa, Greedy Search), el modelo se vuelve predecible, seco y a menudo cae en ciclos infinitos de repetición de las mismas frases. Por el contrario, si se eligen palabras completamente al azar, la generación se convierte en un delirio sin sentido y errores sintácticos.

Sampling Parameters (parámetros de muestreo) son un conjunto de reguladores matemáticos que alteran la forma de la distribución de probabilidades antes de la selección de un símbolo. Comprender su mecánica interna permite al ingeniero equilibrar finamente entre el determinismo estricto del compilador y la heurística creativa de búsqueda de soluciones.

2. Taxonomía arquitectónica y modelo mental

El pipeline de procesamiento de logits consiste en filtros matemáticos secuenciales:

┌─────────────────────────────────────────────────────────────┐
│                 TOKEN DECODING PIPELINE                     │
├─────────────────────────────────────────────────────────────┤
│ 1. Raw Output Logits z_i from Transformer Linear Head       │
├─────────────────────────────────────────────────────────────┤
│ 2. Penalties Modification:                                  │
│    • Frequency Penalty (Reducción de peso por repeticiones)│
│    • Presence Penalty (Multa única por palabras ya mencionadas)│
├─────────────────────────────────────────────────────────────┤
│ 3. Temperature Scaling: z'_i = z_i / T                      │
│    T ➔ 0: picos se agudizan (determinismo Argmax)          │
│    T > 1: distribución se suaviza (alta entropía)           │
├─────────────────────────────────────────────────────────────┤
│ 4. Softmax Normalization: P(w_i) = exp(z'_i) / Sum(exp(z'_j))│
├─────────────────────────────────────────────────────────────┤
│ 5. Truncation Filters (Top-K ➔ Top-P ➔ Min-P)                │
│    Corte de la larga "cola" de tokens basura de baja probabilidad│
├─────────────────────────────────────────────────────────────┤
│ 6. Stochastic Multinomial Draw (Selección final de token)   │
└─────────────────────────────────────────────────────────────┘
  1. Temperatura (Temperature, $T$):
    • Divisor de escala para el vector de logits antes de la función Softmax. Cuando $T \to 0$, la diferencia entre el token más probable y los demás tiende a la infinitud (determinismo). A temperaturas altas ($T = 1.0–1.5$), los tokens poco probables tienen una oportunidad real de ser seleccionados.
  2. Top-P (Nucleus Sampling):
    • Umbral dinámico de probabilidad acumulativa. El algoritmo ordena los tokens en orden descendente y deja solo el conjunto mínimo cuya suma de probabilidades alcanza $P$ (por ejemplo, 0.9 = 90% de la masa de la distribución).
  3. Min-P (Umbral Dinámico):
    • Filtro avanzado moderno. Corta todos los tokens cuya probabilidad individual es menor que $P_{\min} = \text{Min-P} \times P_{\max}$, donde $P_{\max}$ es la probabilidad del líder absoluto. Si el líder tiene un 80% y Min-P = 0.05, se cortan todas las opciones con una probabilidad inferior al 4%.
  4. Penalizaciones por repetición (Presence & Frequency Penalties):
    • Reducen el valor de los logits de los tokens que ya han aparecido en el texto generado, evitando ciclos de repetición.

3. Pipeline técnico y mecánica interna

El ciclo de vida de un paso de selección probabilística de un token:

  1. Obtención de logits: La última capa de la red emite un vector crudo de logits $z = [12.4, 8.1, 15.6, -3.2, \dots]$.
  2. Aplicación de penalizaciones por repetición: Si una palabra ya ha aparecido tres veces, su logit se reduce en $3 \times \text{frequency_penalty}$.
  3. Escalado de temperatura: Cada valor del vector se divide por la temperatura: $z'_i = z_i / T$.
  4. Cálculo de probabilidades a través de Softmax: Los logits se convierten en probabilidades normalizadas de 0 a 1, cuya suma es estrictamente igual a 1.0.
  5. Filtrado a través de Min-P: Se encuentra la puntuación más alta $P_{\max} = 0.70$. Con $\text{Min-P} = 0.1$, el umbral es $0.07$. Todos los tokens con una probabilidad inferior al 7% se eliminan del pool.
  6. Sorteo estocástico (Muestreo Multinomial): Un generador de números pseudoaleatorios (PRNG) realiza el muestreo del pool de probabilidades almacenadas. El token seleccionado se envía a la salida.

4. Escenarios prácticos de ingeniería en producción

01. Generación sin errores de consultas SQL y esquemas de validación

El servicio backend genera código de migraciones basado en el prompt del usuario:

  • Configuración: temperature: 0.0 (Greedy Search).
  • El modelo selecciona garantizadamente las construcciones sintácticas más estándar, excluyendo errores aleatorios de comas o palabras clave inexistentes.

02. Uso de Min-p para refactorización de alta calidad

Un agente refactoriza un módulo algorítmico complejo:

  • Configuración: temperature: 0.7, min_p: 0.05.
  • El modelo obtiene libertad creativa en la elección del patrón arquitectónico, pero el mecanismo Min-P protege de manera confiable contra la selección de funciones alucinadas aleatorias.

03. Tormenta de ideas de investigación arquitectónica (Búsqueda de Alta Entropía)

Generación de ideas de negocio no triviales y escenarios de prueba:

  • Configuración: temperature: 0.9, top_p: 0.95.
  • El modelo propone casos extremos inesperados, escenarios de carga no estándar y hipótesis alternativas de fallos del sistema.

5. Errores comunes, trampas y seguridad

  • Las penalizaciones por repetición rompen la sintaxis del código: Un alto frequency_penalty (por ejemplo, > 0.5) en tareas de programación lleva al desastre: el modelo intenta evitar repeticiones naturales de palabras clave (return, const, llaves de cierre }}), lo que rompe la compilación. Para el código, las penalizaciones deben ser 0.
  • Temperatura fija en nuevos modelos de razonamiento: En modelos de la clase OpenAI o1 o DeepSeek-R1, la cadena de pensamiento interna se entrenó bajo una temperatura estrictamente fija (generalmente $T=1.0$ o $0.6$). Intentar forzar $T=0$ a través de la API a menudo está prohibido o destruye el proceso de autocorrección del modelo.
  • Conflicto de filtros excesivamente agresivos: Establecer simultáneamente top_p: 0.1 y un alto min_p puede reducir la muestra a un único token o ninguno, causando un fallo en el motor de inferencia.
  • Ilusión de reproducibilidad a través de Seed: El parámetro seed fija el estado inicial del generador de números aleatorios, pero no garantiza el mismo texto al cambiar la versión del controlador CUDA o la cantidad de hilos paralelos en el batch.
/ Preguntas frecuentesSchema.org FAQPage

FAQ: Parámetros de Muestreo (Temperature, Top-p, Min-p)

Para código estricto y esquemas estructurados, se recomienda `Temperature = 0.0` (decodificación codiciosa, Greedy Search) o `Temperature = 0.2` en combinación con `Min-P = 0.05`. Esto minimiza las desviaciones sintácticas y evita errores de tipado aleatorios.
/ Enlaces internos
Todos los términos