Skip to main content

Benchmarks para Agentes: GAIA y SWE-bench

Nueva generación de rigurosos benchmarks prácticos para evaluar la autonomía de la inteligencia artificial. GAIA prueba tareas multimodales en la web abierta con archivos y navegador, mientras que SWE-bench evalúa la capacidad de los agentes para encontrar y corregir errores reales en grandes repositorios de GitHub.

1. Visión general del concepto y problema sistémico

En el ámbito de la inteligencia artificial ha surgido una crisis de evaluación: los modelos de vanguardia comenzaron a obtener entre 90-95% en todas las pruebas antiguas de programas escolares o exámenes universitarios. Pero cuando se les asignaba tareas reales como asistentes en oficinas o programadores en empresas, a menudo resultaban completamente ineptos.

Para evaluar la verdadera capacidad de los sistemas autónomos, los investigadores crearon una nueva clase de pruebas: Benchmarks para Agentes (Agent Benchmarks):

  • GAIA (General AI Assistants): prueba de agilidad del asistente en el mundo real.
  • SWE-bench: prueba de programación profesional en proyectos reales.

Analogía práctica: la transición de un examen teórico sobre las reglas de tráfico a la conducción real en hora pico en una ciudad concurrida.

2. Taxonomía arquitectónica y modelo mental

┌─────────────────────────────────────────────────────────────┐
│                 TAREA TIPO EN EL BENCHMARK GAIA            │
├─────────────────────────────────────────────────────────────┤
│ 📋 TAREA:                                                  │
│    «Aquí hay un enlace a un video de YouTube. Encuentra de  │
│    qué color era la corbata del orador en el minuto 14,    │
│    visita el sitio web de la empresa del orador y encuentra  │
│    el número de teléfono de su oficina».                   │
├─────────────────────────────────────────────────────────────┤
│ 🤖 LO QUE DEBE HACER EL AGENTE:                             │
│    1. Abrir el video, descargar la transcripción o un fotograma│
│    2. Usar visión por computadora (VLM) en el minuto 14      │
│    3. Abrir un buscador a través de una herramienta del navegador│
│    4. Encontrar el sitio y extraer el número de teléfono del pie de página│
│    5. Proporcionar una respuesta corta y precisa             │
└─────────────────────────────────────────────────────────────┘

3. Por qué las tareas de GAIA son difíciles para la IA, pero simples para los humanos

Los humanos resuelven la mayoría de las tareas de GAIA en 10-15 minutos, porque tenemos sentido común, podemos alternar entre pestañas y no nos perdemos si un sitio se ve inusual.

Para la IA, cada cambio de formato es una potencial catástrofe:

  • Nivel 1 (Tareas simples sin herramientas): ~60% de éxito.
  • Nivel 2 (Se requiere búsqueda y archivos): ~35% de éxito.
  • Nivel 3 (Cadenas multimodales complejas): menos del 20% de éxito.

4. Escenarios prácticos de ingeniería en producción

Cuando elijas un entorno de desarrollo (Cursor, Devin, Windsurf) o un servicio para la automatización de negocios, observa los indicadores en SWE-bench y GAIA. Si el sistema tiene una alta puntuación en estos benchmarks, es garantía de que puede pensar y corregir errores en tareas reales.

01. Integración de GAIA en un flujo de trabajo de desarrollo

02. Evaluación de agentes en entornos de producción

03. Comparación de rendimiento entre modelos de IA en SWE-bench

/ Preguntas frecuentesSchema.org FAQPage

FAQ: Benchmarks para Agentes: GAIA y SWE-bench

Porque MMLU son pruebas de opción múltiple A, B, C, D (pura erudición). Pero un agente no debe elegir una letra, sino actuar: descargar un archivo de Excel, encontrar un error en la fórmula, abrir un navegador y enviar el archivo corregido por correo. Se requieren pruebas completamente diferentes para esto.
/ Enlaces internos
Todos los términos