Glosario IA y Vibecoding
Guía fundamental para la nueva era del desarrollo por Andriy Orlov: agentes autónomos, loop engineering, protocolo MCP, escalado de contexto, infraestructura VPS y prevención del agotamiento en la era de la IA.
A
ENAI Upscaling (Super Resolución)
Tecnología de aumento de resolución y restauración de detalles de imágenes (Real-ESRGAN, Magnific AI, Topaz Photo). A diferencia del simple aumento de píxeles (interpolación bicúbica), la red neuronal genera literalmente nuevas microtexturas realistas: poros de la piel, pestañas, cabellos y tejidos.
Ajuste Fino (Fine-Tuning)
El proceso de adaptar un modelo grande ya entrenado a una tarea o estilo especializado utilizando un pequeño conjunto de datos de calidad (Supervised Fine-Tuning, SFT). Permite enseñar a la IA terminología médica, tono corporativo o formato de código específico en pocas horas.
Algoritmos de Alineación Moderna GRPO y DPO
Los algoritmos de optimización de políticas más recientes (Direct Preference Optimization y Group Relative Policy Optimization) eliminan la necesidad de modelos críticos pesados durante el entrenamiento de razonamiento.
Alibaba Qwen (Líder en Código Abierto y Matemáticas)
Serie de modelos de alto rendimiento de la división en la nube de Alibaba (Qwen 2.5, Qwen Coder). Reconocido líder entre los modelos abiertos en programación, matemáticas y procesamiento de texto multilingüe.
Apple Silicon MLX Framework
Biblioteca nativa de aprendizaje automático de Apple, diseñada para maximizar el uso de memoria unificada y núcleos gráficos de los chips de la serie M (M2/M3/M4) al ejecutar grandes LLM.
Apple Silicon para IA (Serie M y Memoria Unificada)
La arquitectura de los procesadores Apple (M1/M2/M3/M4) con Memoria Unificada (Unified Memory Architecture). Permite que toda la memoria RAM (hasta 128-192 GB) sea accesible para el chip gráfico como VRAM, posibilitando la ejecución de enormes redes neuronales sin tarjetas gráficas de servidor.
Archivos LoRA para Estilos y Rostros (Low-Rank Adaptation)
Tecnología de adaptación ligera y rápida para el reentrenamiento de modelos de imágenes (Stable Diffusion, FLUX). Crea archivos compactos de entre 20 y 200 MB que se conectan al modelo base como un plugin variable, añadiendo un personaje específico, estilo de artista o estética visual.
Arquitectura Transformer
Arquitectura de redes neuronales presentada por investigadores de Google en 2017 en el artículo 'Attention Is All You Need'. Base de todos los modelos de lenguaje modernos (GPT, Claude, Gemini, Llama), que reemplazó las lentas redes recurrentes y aprendió a procesar todo el texto en paralelo simultáneamente.
AWQ & Activación-Consciente Cuantización de GPU
Métodos de compresión de 4 bits de los pesos de modelos de lenguaje, optimizados para la arquitectura de núcleos tensoriales de NVIDIA para máxima capacidad y preservación de canales críticos de activación.
B
ENC
ENCantidad de Parámetros del Modelo (7B, 14B, 70B)
La designación de la cantidad total de parámetros de entrenamiento (pesos) en un modelo de lenguaje grande, donde la letra 'B' representa miles de millones (Billion). Indicador clave de la capacidad intelectual del modelo, su velocidad de operación y los requisitos de memoria del ordenador.
Claude Haiku (Modelos Compactos Rápidos de Anthropic)
El modelo más compacto y rápido de la línea de Anthropic. Diseñado para respuestas instantáneas, clasificación masiva de textos, extracción de datos y enrutamiento agente a un costo mínimo.
Claude Opus (Modelo Flagship de Anthropic)
El modelo más potente de la familia Anthropic, diseñado para análisis filosóficos y científicos complejos, redacción de textos multilayer y comprensión profunda del contexto.
Claude Sonnet (Claude 3.7 / 3.5 Sonnet)
Modelo de ingeniería de referencia de Anthropic, optimizado para programación compleja, trabajo con grandes bases de código, razonamiento híbrido (Extended Thinking) y ciclos de agentes autónomos.
Clonación de Voz y Ética de Audio
La tecnología de generación de una réplica digital de la voz de una persona específica a partir de una breve muestra de grabación de audio (de 5 segundos a varios minutos). Permite duplicar videos con la propia voz en otros idiomas, pero crea serios riesgos de fraude telefónico y requiere una estricta verificación ética.
Contaminación de Benchmarks (Data Contamination)
El problema de la objetividad en la evaluación de inteligencia artificial, cuando preguntas y respuestas de conjuntos de pruebas estándar (MMLU, HumanEval, GSM8K) se filtran accidental o intencionadamente en los datos de entrenamiento del modelo, resultando en evaluaciones artificialmente infladas en presentaciones.
ControlNet: Control de Posiciones y Geometría
Extensión de red neuronal para modelos de difusión (Stable Diffusion) que permite controlar la composición espacial de la generación mediante mapas de profundidad, contornos de líneas (Canny edge) y 'esqueletos' de poses humanas (OpenPose). Transforma la generación caótica en una herramienta precisa para diseñadores.
Cuantización (Model Quantization)
Tecnología de compresión matemática de coeficientes de peso y activaciones de redes neuronales mediante la transición de alta precisión (FP16/BF16) a formatos de menor precisión (FP8, INT8, INT4, GGUF) para un ahorro radical de memoria.
Cuantización y Formato GGUF
Método matemático para reducir la precisión de los pesos numéricos del modelo (por ejemplo, de 16 bits FP16 a 4 bits INT4) y archivo binario unificado en formato GGUF para carga instantánea en procesadores y GPUs a través del motor llama.cpp.
D
ENDecodificación Especulativa y Modelos Borrador
Tecnología de aceleración de hardware para la inferencia de grandes modelos de lenguaje, aumentando la velocidad de 2 a 3 veces sin pérdida de calidad mediante la verificación paralela de predicciones de un modelo borrador rápido.
Deepfakes: Audio y Video
Tecnología para crear materiales de audio y video sintéticos de alta realismo mediante redes neuronales. Permite reemplazar rostros en videos, clonar voces a partir de una muestra de 3 segundos o generar discursos falsos de figuras públicas.
DeepSeek (Ruptura China en IA Abierta)
Serie de modelos abiertos innovadores de la laboratorio chino DeepSeek (V3, R1). Demuestra el más alto nivel en codificación y razonamiento a un costo de 10 a 20 veces inferior al de los análogos comerciales occidentales.
DeepSeek-R1 (Modelo de Razonamiento DeepSeek)
Modelo de razonamiento de pesos abiertos (Open Weights Reasoning Model) basado en una arquitectura de 671B MoE, que ha demostrado la capacidad de formar un pensamiento lógico extremadamente complejo a través del aprendizaje por refuerzo puro (GRPO).
E
ENEfecto 'Lost in the Middle'
Una conocida asimetría cognitiva de los grandes modelos de lenguaje, revelada en un estudio de la Universidad de Stanford. Muestra que la precisión en la extracción de información es más alta al principio y al final del contexto de entrada, pero cae drásticamente en el medio de un documento largo.
ElevenLabs (Líder Mundial en Audio Generativo y Voz)
Plataforma tecnológica líder en síntesis de voz (TTS) e inteligencia artificial vocal. Permite convertir texto en voz humana emocional en vivo, clonar voces y doblar automáticamente videos en más de 30 idiomas.
Entrenamiento por Refuerzo a partir de Retroalimentación Humana (RLHF)
Método de aprendizaje (Reinforcement Learning from Human Feedback) que utiliza evaluaciones comparativas de personas para entrenar un modelo de recompensa (Reward Model). Gracias a RLHF, los modelos de lenguaje han aprendido a ser útiles, honestos y seguros (Helpful, Honest, Harmless).
Escalado de Cómputo en Tiempo de Prueba
Nueva paradigma en el desarrollo de IA para finales de 2026: mejora de la calidad de las respuestas no a través de modelos gigantes durante el entrenamiento, sino dedicando segundos adicionales a la reflexión antes de la generación.
Escucha Directa de Voz (Speech-to-Speech / Native Audio)
La nueva generación de modelos multimodales nativos (GPT-4o Advanced Voice, Gemini Live) procesa ondas sonoras directamente sin un paso intermedio de conversión de audio a texto (STT) y viceversa (TTS). Esto permite que el modelo perciba sarcasmo, miedo, risa, susurros y pueda interrumpir una conversación al instante con mínima latencia.
Espacio Latente
Un espacio vectorial matemático multidimensional creado por redes neuronales para la representación interna de conceptos, estilos e imágenes. Permite realizar operaciones aritméticas sorprendentes sobre conceptos: por ejemplo, 'Rey' menos 'Hombre' más 'Mujer' es igual a 'Reina'.
Estructura de Prompts para Imágenes (Image Prompt Engineering)
Metodología profesional para la elaboración de solicitudes textuales para redes neuronales gráficas. La fórmula dorada de cinco elementos: sujeto principal, detalles del entorno, características de iluminación, parámetros de cámara virtual y estilo artístico de renderizado.
F
ENFamilia Llama (Meta Llama)
Serie de modelos de lenguaje fundamentales y abiertos de Meta (Llama 3, 3.1, 3.3) que se han convertido en el estándar industrial de la ecosistema Open Weights, IA local y fine-tuning corporativo.
FLUX.1 (El Rey Moderno de las Imágenes Fotorrealistas)
Modelo líder de generación de imágenes de Black Forest Labs (creadores de Stable Diffusion). Conocido por su fotorrealismo impecable, la representación perfecta de los dedos de las manos y la capacidad de renderizar texto impreso claro.
Fusión de Modelos y Frankensteining
Técnica de combinación de pesos de dos o más modelos de lenguaje diferentes sin reentrenamiento en GPU (SLERP, DARE, Ties-Merging), creando modelos híbridos con habilidades sinérgicas.
G
ENGemini Flash & Pro (Google Gemini)
Familia de modelos multimodales de Google DeepMind que combina una ventana de contexto récord (hasta 2 millones de tokens), velocidad de generación extrema (más de 150 tokens/s) y percepción nativa de video y audio.
Gemini Nano & Edge AI (IA Directamente en el Smartphone Sin Internet)
La versión más compacta de inteligencia artificial de Google, optimizada para ejecución local en chips de smartphones (NPU). Proporciona resúmenes de grabaciones de audio, respuestas inteligentes y procesamiento de fotos completamente offline.
Generación de Datos Sintéticos y Preentrenamiento
Tecnología de generación, filtrado automático y verificación formal de conjuntos de datos de entrenamiento mediante inteligencia artificial para superar la escasez de datos humanos de calidad.
GGUF y Estándares Modernos de Cuantización
Formato binario universal para el almacenamiento y carga instantánea de modelos de lenguaje cuantizados en CPUs y GPUs en llama.cpp, Ollama y LM Studio.
Google AI Studio (Estudio Gratuito para Probar IA)
Sandbox oficial de Google para probar rápidamente modelos Gemini. Permite experimentar gratuitamente con un contexto de 2 millones, ajustar prompts del sistema y obtener claves API sin tarjeta de crédito.
Google Gemini Pro (Modelo de Google con Contexto Infinito)
Modelo de trabajo principal de Google DeepMind con una ventana de contexto récord de más de 2 millones de tokens. Capaz de analizar libros completos, grabaciones de video y enormes bases de código en una sola consulta.
GPT Image / DALL-E (Generación de Imágenes en ChatGPT)
Herramienta integrada de generación de contenido visual directamente en el diálogo con ChatGPT. Permite crear ilustraciones, arte conceptual, textos para carteles y editar fragmentos de imágenes localmente.
GPT Mini (Modelos Compactos de la Serie GPT-4o Mini)
Versión económica y ultrarrápida de los modelos insignia de OpenAI. Optimizada para tareas diarias masivas, respuestas instantáneas, clasificación de textos y ahorro de límites.
GPU o CPU para IA: ¿cuál es la diferencia?
Comparación profunda entre unidades centrales (CPU) y unidades gráficas (GPU) para tareas de aprendizaje automático. Explicación de la diferencia fundamental entre latencia (Latency-oriented) y ancho de banda (Throughput-oriented), ancho de banda de memoria (DDR5 vs HBM3e) y benchmarking en CLI.
H
ENHerramientas de Video AI (Runway, Kling, Luma Dream Machine)
Plataformas líderes en generación de video mediante inteligencia artificial (Text-to-Video e Image-to-Video). Permiten dar vida a fotografías estáticas, controlar el movimiento de la cámara virtual y crear videos cinematográficos de alta definición sin necesidad de un equipo de filmación.
Hugging Face Hub
Plataforma líder mundial y repositorio abierto para la comunidad de inteligencia artificial ('GitHub para redes neuronales'). Contiene cientos de miles de modelos abiertos, conjuntos de datos y demostraciones web gratuitas (Spaces), soportando todos los principales marcos de IA.
I
ENIA Local Autónoma y Privacidad de Datos
La práctica de ejecutar modelos de aprendizaje automático completamente en hardware físico propio sin conexión a Internet (Air-Gapped AI). Garantiza un 100% de protección contra la filtración de secretos comerciales, datos personales (GDPR/HIPAA) y fallos de proveedores de la nube.
Inferencia Local de LLM
La práctica de ejecutar grandes modelos de lenguaje de manera autónoma directamente en el hardware del desarrollador (Apple Silicon, NVIDIA GPU) garantizando absoluta confidencialidad y cero dependencia de Internet.
Inpainting y Outpainting (Edición y Ampliación de Imágenes)
Técnicas de edición selectiva de imágenes mediante redes neuronales. Inpainting reemplaza o elimina un objeto dentro de un área seleccionada (máscara) manteniendo la luz y la textura. Outpainting (Generative Fill) añade nuevo espacio más allá de los límites originales de la fotografía.
Inteligencia Artificial Constitucional (Constitutional AI / RLAIF)
Método de alineación del comportamiento de modelos desarrollado por el laboratorio Anthropic (creadores de Claude). En lugar de utilizar millones de horas de trabajo manual, el modelo critica y corrige sus propias respuestas basándose en un conjunto claro de principios éticos ('Constitución').
Inteligencia Artificial General (AGI)
La Inteligencia Artificial General (Artificial General Intelligence) es un sistema autónomo hipotético capaz de entender, aprender y realizar cualquier tarea intelectual al nivel humano o superarlo en la mayoría de los campos laborales económicamente valiosos.
K
ENL
ENLeyes de Escalado de IA (Scaling Laws)
Ley empírica de OpenAI y Google (formulada por Jared Kaplan en 2020) que afirma que el rendimiento de un modelo de lenguaje aumenta predeciblemente como una ley de potencia al incrementar tres factores: la cantidad de parámetros del modelo, el volumen de datos de entrenamiento y la potencia computacional utilizada (Compute).
Límite de Tokens de Salida (Por Qué el Texto se Detiene a Medias)
Límite hardware o software en la longitud máxima de una respuesta (Max Output Tokens). Explica por qué un código largo o un artículo a veces se detienen a medias, y cómo la palabra mágica 'Continuar' devuelve a la modelo a la acción.
LLM (Large Language Model - Modelo de Lenguaje Grande)
Clase fundamental de arquitecturas de redes neuronales basadas en transformadores autorregresivos, que predice la distribución probabilística de los siguientes tokens y demuestra propiedades emergentes de pensamiento abstracto, síntesis de código y razonamiento lógico.
LM Studio
Aplicación de escritorio gratuita para Windows, macOS y Linux que permite encontrar, descargar y ejecutar LLM abiertos con un solo clic sin usar la terminal. Incluye un servidor local integrado compatible con OpenAI API.
LMSYS Chatbot Arena (Clasificación ELO)
Plataforma abierta de crowdsourcing para pruebas A/B ciegas de LLM que determina la fuerza relativa de los modelos de lenguaje basada en el modelo estadístico de Bradley-Terry y la clasificación de ajedrez Elo.
M
ENMantenimiento del Personaje y Consistencia de Estilo
Metodología y herramientas para preservar la consistencia visual del personaje (Character Consistency) y el estilo del autor en una serie de generaciones. Se utiliza para crear libros ilustrados, cómics, storyboards para películas y mascotas de marca mediante los parámetros --cref, FaceID y LoRA.
Mecanismo de Autoatención (Self-Attention)
Mecanismo matemático clave de la arquitectura Transformer que permite a cada palabra en una oración ponderar dinámicamente la importancia de todas las demás palabras a su alrededor. Esto permite que el modelo distinga entre homónimos y relacione pronombres (‘él’, ‘ella’, ‘esto’) con los objetos correctos.
Memoria de Video (VRAM) para IA
La memoria de video (Video RAM) de la GPU se utiliza para cargar los pesos de la red neuronal y la ventana de contexto. Es el principal cuello de botella de hardware: si el modelo no cabe en la VRAM, no se ejecutará o funcionará decenas de veces más lento en una CPU convencional.
Meta Llama (Estándar Abierto Principal de Inteligencia Artificial)
Serie insignia de modelos de lenguaje abiertos de Meta (Llama 3, 3.3). Disponible para descarga gratuita, modificación y ejecución local en servidores propios sin restricciones ni censura.
Midjourney (Plataforma Líder de Diseño Artístico)
Generador de imágenes cerrado líder con el más alto nivel de estética artística. Estándar de la industria para diseñadores, cineastas, artistas conceptuales y creativos publicitarios.
Mistral AI (Modelos Abiertos y Eficientes de Europa)
Serie de modelos abiertos y comerciales de alto rendimiento del startup francés Mistral AI (Mistral 7B, Mixtral 8x7B, Mistral Large). Conocidos por su compacidad, velocidad y respeto por la privacidad de los datos.
Model Distillation & Reasoning Transfer
Metodología para la transferencia de conocimientos y cadenas de razonamiento de un modelo maestro (Teacher Model) a un modelo compacto (Student Model) para inferencia rápida y económica.
Modelos de Difusión (Diffusion Models)
La arquitectura de modelos generativos (Stable Diffusion, Midjourney, FLUX) se basa en principios de termodinámica no equilibrada. Funciona en dos etapas: difusión directa (destrucción gradual de la imagen con ruido aleatorio) y difusión inversa (limpieza progresiva del ruido hasta obtener una imagen cristalina a partir de una descripción textual).
Modelos de Lenguaje Visual (Vision Language Models / VLM)
Modelos multimodales que combinan la capacidad de percibir imágenes visuales (a través de la segmentación en parches) con la inteligencia textual de LLM. Permiten reconocer objetos en fotos, analizar gráficos complejos, leer recibos y entender interfaces.
Modelos de Razonamiento
Clase de modelos de inteligencia artificial de nueva generación (OpenAI o1/o3-mini, DeepSeek-R1, Claude 3.7 Extended Thinking) que utilizan escalado de tiempo de cómputo (Test-Time Compute) y una cadena interna de pensamientos para verificar hipótesis.
Modelos Frontera
La clase más poderosa de inteligencia artificial en la vanguardia de la investigación mundial (Claude 3.7 Sonnet, OpenAI o3/GPT-4.5, Gemini 2.0 Pro), que define los límites de las capacidades modernas de razonamiento, autonomía y codificación.
Modo de Voz Avanzado
Tecnología de comunicación de voz bidireccional en tiempo real (ChatGPT Advanced Voice, Gemini Live). Permite conversar con el modelo con un retraso de hasta 300 ms, interrumpir a mitad de palabra y escuchar emociones en vivo.
MoE (Mixture of Experts - Mezcla de Expertos)
Enfoque arquitectónico en aprendizaje profundo donde las capas densas de un transformador se dividen en decenas de subredes especializadas ('expertos'), y un enrutador dinámico activa solo una pequeña parte de ellas para cada token individual.
Motores de Alta Velocidad TensorRT-LLM y SGLang
Motores computacionales profundamente compilados para la optimización extrema del inferencia de modelos de lenguaje en servidores NVIDIA, con optimización de gráficos, FlashAttention-3 y enrutamiento avanzado.
O
ENOCR Contra Vision LLM: Evolución del Reconocimiento de Texto
Comparación entre el reconocimiento óptico de caracteres tradicional (OCR — Tesseract, ABBYY FineReader) y los modernos modelos visuales multimodales (Vision LLM). Los antiguos algoritmos copian píxeles con errores, mientras que los nuevos modelos corrigen la caligrafía, comprenden tablas y calculan totales.
Ollama (Plataforma de Ejecución Local de Modelos)
Herramienta líder de código abierto para la carga, configuración y ejecución local de modelos de lenguaje (Llama, DeepSeek, Qwen) con una API REST integrada, compatible con OpenAI.
Olvido Catastrófico (Catastrophic Forgetting)
Problema fundamental de las redes neuronales artificiales, donde al aprender una nueva tarea o idioma, los pesos actualizados sobrescriben las conexiones anteriores, resultando en una pérdida repentina y total de habilidades previamente adquiridas.
Open Weights vs Verdaderamente Open Source AI
Análisis legal y técnico de la diferencia fundamental entre los pesos numéricos accesibles de los modelos (Llama, DeepSeek) y proyectos completamente abiertos con datos de origen, código y arquitectura (Estándar OSI).
OpenAI GPT (Modelos Flagship de la Serie GPT)
La principal línea universal de grandes modelos de lenguaje de OpenAI (GPT-4, GPT-4o). Optimizada para análisis de texto complejo, programación, creatividad y trabajo intelectual diario.
OpenAI o-Series / Reasoning (Modelos de Razonamiento Avanzado)
La nueva generación de inteligencia artificial de OpenAI (serie o1, o3), optimizada para el pensamiento oculto en múltiples etapas, matemáticas avanzadas, física cuántica y codificación algorítmica compleja.
OpenAI Whisper (Estándar de Oro para Reconocimiento de Voz)
Modelo de reconocimiento de voz (STT) de código abierto de OpenAI. Reconoce más de 100 idiomas, es resistente al ruido de fondo, dialectos y murmullos. Estándar para la transcripción automática de audio y codificación de voz.
OpenRouter (API Gateway Unificado de Modelos)
Gateway unificado de inteligencia artificial que proporciona acceso estandarizado a cientos de modelos de lenguaje cerrados y abiertos de decenas de proveedores de inferencia a través de un único balance, una única clave API y un mecanismo de conmutación por error automático (Fallback).
P
ENPagedAttention y Gestión de KV-Cache
Un algoritmo de gestión de memoria de GPU que divide el KV-Cache del modelo de lenguaje en páginas virtuales continuas (como en el núcleo de un SO), eliminando la fragmentación y aumentando la capacidad de procesamiento en 4 veces.
Parámetros de Muestreo (Temperature, Top-p, Min-p)
Hiperparámetros matemáticos del decodificador estocástico (Temperature, Top-P, Min-P, Penalties) que controlan la distribución de probabilidades para seleccionar el siguiente token, determinando el nivel de determinismo, precisión y creatividad del modelo.
Perplexity AI (Asistente de Búsqueda de Nueva Generación)
Motor de búsqueda de nueva generación (Answer Engine). En lugar de una lista de enlaces publicitarios, sintetiza una respuesta estructurada y exhaustiva con enlaces clicables a las fuentes en tiempo real.
Pesos Abiertos vs API Cerrados
Comparación de dos filosofías fundamentales en la distribución de IA: pesos abiertos (Open Weights — Llama, Mistral, DeepSeek), que se pueden descargar y ejecutar en su propio servidor, frente a API cerrados (Closed API — OpenAI, Anthropic, Google), donde el acceso se proporciona exclusivamente a través de suscripción.
Pesos y Sesgos de Redes Neuronales (Weights & Biases)
La naturaleza fundamental de una red neuronal entrenada. Los pesos (Weights) son coeficientes matriciales de la fuerza de conexión entre neuronas artificiales, mientras que los sesgos (Biases) son el umbral de sensibilidad de activación. Explicación de los formatos de almacenamiento (.safetensors, bfloat16, fp8) e inspección de pesos a través de Python y CLI.
Pinokio AI Browser
Un navegador de escritorio autónomo y gestor de aplicaciones ('App Store para IA abierta') que permite instalar, configurar y ejecutar entornos complejos de inteligencia artificial (ComfyUI, Stable Diffusion, Whisper, FaceFusion) sin necesidad de conocimientos de Git, Python o terminal.
Pre-entrenamiento (Pre-training)
Etapa inicial en la creación de un modelo de lenguaje fundamental (Foundation Model). Proceso de alimentar a la red neuronal con trillones de palabras de internet, libros y código en clústeres de miles de tarjetas gráficas durante meses, costando decenas y cientos de millones de dólares.
Predicción del Siguiente Token (Next-Token Prediction)
Mecanismo fundamental de los modelos de lenguaje grandes autorregresivos (LLM). Cálculo de logits, función Softmax, impacto de la temperatura y muestreo (Top-P/Top-K). Explicación de por qué la generación de texto es un proceso secuencial O(N) y cómo revisar probabilidades a través de la API.
Presupuesto de Reflexión (Thinking Budget en Nuevos Modelos)
Un nuevo parámetro en modelos modernos de razonamiento híbrido (Claude 3.7 Sonnet, OpenAI o1/o3). Permite al usuario definir el límite de tokens o segundos que la inteligencia artificial puede gastar en reflexión interna antes de la respuesta final.
Prompts Negativos en Generación de Imágenes
Mecanismo de control en modelos de difusión (Stable Diffusion, Midjourney --no) que dirige el vector matemático de limpieza de ruido en dirección opuesta a imágenes no deseadas. Se utiliza para filtrar artefactos: extremidades adicionales, desenfoque, marcas de agua y estilo caricaturesco.
Prueba Needle In A Haystack (NIAH)
Benchmark estándar para evaluar la longitud de la ventana de contexto de los modelos de lenguaje. Se oculta una corta frase aleatoria (la aguja) en un vasto conjunto de texto de fondo aleatorio (el pajar) en diferentes posiciones, evaluando la capacidad del modelo para encontrarla sin errores.
R
ENS
ENSeed y Determinismo (Repetibilidad de Resultados de Generación)
Identificador numérico del generador de números aleatorios (Seed). Permite fijar la aleatoriedad en modelos de lenguaje y generadores de imágenes para obtener resultados estables y reproducibles al repetir la misma consulta.
Síntesis de Voz Moderna (Text-to-Speech / TTS)
Tecnología de generación artificial de lenguaje humano a partir de texto escrito. Los modelos TTS modernos (ElevenLabs, OpenAI Audio, Chatterbox) reproducen entonaciones naturales, acentos lógicos, respiraciones, timbres y matices emocionales, indistinguibles de un locutor humano.
SLMs (Modelos de Lenguaje Pequeños 1B–3B)
Modelos ultra compactos de nueva generación con 1B–3B de parámetros (Llama 3.2, SmolLM, Qwen 2.5), diseñados para ejecución local en teléfonos, navegadores y servidores edge económicos.
Sobreajuste (Overfitting)
Problema fundamental del aprendizaje automático: el modelo se ajusta excesivamente al conjunto de datos de entrenamiento junto con su ruido específico, perdiendo la capacidad de generalización (Generalization) en nuevos datos. Análisis de la divergencia de funciones de pérdida, técnicas de regularización y Early Stopping en el código.
Sora y Generación de Video con IA
Una nueva clase de redes neuronales generativas capaces de crear videos dinámicos fotorrealistas a partir de texto o imágenes estáticas (OpenAI Sora, Runway Gen-3, Kling, Luma Dream Machine).
Sub-Cuadrática Atención y Modelos de Espacio de Estados
Arquitecturas de redes neuronales de última generación con complejidad computacional O(N), que permiten procesar millones de tokens de contexto con uso constante de memoria.
T
ENTemperatura de Generación (Control des Creatividad y Caos)
Parámetro numérico clave en la generación de texto (normalmente entre 0.0 y 1.0 o 2.0). Define el grado de imprevisibilidad en la elección del siguiente token: desde una matemática estrictamente determinista hasta un vuelo libre de la imaginación.
Teoría del «Loro Estocástico» (Stochastic Parrot)
Crítica científica prominente a los grandes modelos de lenguaje, presentada por las lingüistas Emily Bender y Timnit Gebru en 2021. Asegura que los LLM no poseen conciencia ni comprensión del contenido, sino que repiten de manera aleatoria (estocástica) combinaciones de palabras aprendidas en internet, similar a un loro.
Tipos de Cuantización: FP16, INT8, INT4
Formatos técnicos de representación de pesos en redes neuronales. Desde la precisión total de 16 bits en punto flotante (FP16 / BF16) hasta formatos enteros de compresión (INT8, INT4, AWQ, EXL2), que determinan el equilibrio entre el consumo de memoria y la calidad intelectual de las respuestas.
Tokens Explicados (Cuántas Palabras en un Token)
Unidad básica de medida de texto en modelos de lenguaje. Explicación de cómo las palabras se dividen en tokens, cómo esto afecta el costo de las consultas y por qué las palabras en ucraniano consumen más tokens que las palabras en inglés.
Top-P / Nucleus Sampling (Filtrado de Alucinaciones en Textos)
Método de filtrado probabilístico de palabras (Nucleus Sampling). Permite eliminar la 'larga cola' de palabras poco probables, extrañas y absurdas, dejando solo las opciones más adecuadas con una probabilidad acumulativa P (generalmente 0.9).
TTFT vs TPS (Métricas de Latencia de Inferencia)
Dos métricas clave de rendimiento de inferencia: Time To First Token (latencia de inicio de respuesta) y Tokens Per Second (capacidad de generación de código).
U
ENV
ENVelocidad de Generación (TPS / TTFT / Latencia)
Métricas clave de rendimiento de modelos de lenguaje: Time to First Token (tiempo de reacción al contexto de entrada) y Tokens Per Second (velocidad de generación de texto de salida en streaming).
vLLM (Motor de Inferencia de Alto Rendimiento)
Servidor de inferencia y servicio LLM de código abierto líder que ha revolucionado el rendimiento gracias al algoritmo de virtualización de memoria PagedAttention y el batching continuo.
X
ENConjunto integral de herramientas, clasificaciones y habilidades de IA
Además del glosario, GOTBURNOUT incluye benchmarks de redes neuronales, un catálogo de más de 100 000 AI Agent Skills, scripts para VPS verificados y una comunidad Pro privada de desarrolladores.