Skip to main content

Habilidades de Agente (Agent Skills & Custom Workflows)

Patrón arquitectónico de carga dinámica de instrucciones procedimentales especializadas, scripts y plantillas (SKILL.md) en la ventana de contexto del agente bajo demanda (On-Demand Loading).

1. Visión general del concepto y problema sistémico

Con el aumento de la complejidad de los sistemas de agentes, los desarrolladores a menudo intentan dotar al agente de experiencia en todas las áreas a la vez: escriben enormes reglas de formateo de código, listas de verificación de seguridad de servidores, requisitos de accesibilidad de UI, sintaxis de dialectos SQL y plantillas de documentación.

Tratar de incluir todo esto en un único prompt de sistema estático (system prompt) genera tres problemas sistémicos críticos:

  1. Desgaste catastrófico del presupuesto de tokens: Incluso para una solicitud banal como "corrige un error tipográfico", el modelo se ve obligado a leer 40,000 tokens de documentación irrelevante cada vez.
  2. Desdibujamiento del contexto y degradación del seguimiento de instrucciones (Instruction Drift): Cuantas más reglas contradictorias o heterogéneas haya en el contexto, mayor será la probabilidad de que el modelo ignore instrucciones específicas.
  3. Imposibilidad de actualización modular: Cambiar una regla en un archivo monolítico puede alterar de manera impredecible el comportamiento del agente en tareas completamente diferentes.

Habilidades de Agente (Agent Skills) abordan este problema a través del principio de separación procedimental del contexto: el conocimiento se almacena en forma de módulos aislados en el disco y se carga en la memoria del agente solo cuando surge una necesidad de ingeniería correspondiente.

2. Taxonomía arquitectónica y modelo mental

La arquitectura moderna de habilidades de agente está estandarizada en forma de un paquete autónomo de conocimientos procedimentales:

  • 1. Manifiesto y disparadores de activación (Frontmatter Metadata): Metadatos en formato YAML al inicio del archivo SKILL.md. Definen el nombre, la descripción de la competencia y una lista de disparadores en lenguaje natural (por ejemplo: “compré VPS”, “configurar firewall”, “verificar accesibilidad”).
  • 2. Guía algorítmica de acciones (Workflow Blueprint): Un algoritmo claro y paso a paso, dividido en fases: diagnóstico -> preparación del plan -> ejecución paso a paso -> verificación final obligatoria del resultado.
  • 3. Scripts y utilidades ejecutables (scripts/): Scripts deterministas en Python, Bash o Node.js que el agente invoca para realizar cálculos o verificaciones rutinarias en lugar de generar desde cero, lo cual es lento y propenso a errores.
  • 4. Referencias y ejemplos de referencia (references/): Muestras de oro de arquitectura, esquemas de configuración (Nginx, Docker Compose, interfaces de TypeScript) que el agente utiliza como plantilla para seguir.

3. Pipeline técnico y mecánica interna

El ciclo de vida de activación de una habilidad por parte del agente ocurre en 4 etapas:

  1. Lightweight Index Discovery (Descubrimiento de catálogo): Al iniciar, el agente recibe solo un índice compacto de habilidades disponibles (2-3 oraciones de descripción por cada una). Esto consume menos de 500 tokens.
  2. Intent Matching & Trigger Interception (Coincidencia de intención): El usuario plantea una tarea. El agente compara la semántica de la solicitud con los manifiestos de habilidades. Si se detecta una coincidencia, el agente toma una decisión interna sobre la carga de la experiencia.
  3. Lazy File Ingestion (Carga perezosa de instrucciones): El agente invoca la herramienta de archivo (por ejemplo, view_file para skills/<skill_name>/SKILL.md) y carga la especificación completa directamente en el contexto de trabajo.
  4. Execution & Context Retirement (Ejecución y liberación de contexto): El agente ejecuta la tarea, siguiendo estrictamente las instrucciones de la habilidad. Después de completar la tarea y registrar el resultado, las sesiones posteriores no se sobrecargan con detalles obsoletos.

4. Escenarios prácticos de ingeniería en producción

01. Dureza procedimental y protección de Linux VPS

El agente tiene la habilidad vps-hardening. Cuando el usuario informa sobre la compra de un nuevo servidor, el agente carga una lista de verificación clara de 7 pasos: generación de claves SSH, configuración de UFW, configuración de fail2ban, ajuste de sysctl y desactivación del acceso por contraseña estrictamente después de verificar el acceso por clave.

02. Auditoría de diseño de accesibilidad especializada (WCAG 2.2)

El usuario solicita evaluar el diseño de un formulario. El agente activa la habilidad better-accessibility: verifica el contraste de colores según APCA/WCAG, la presencia de etiquetas aria, la navegación por teclado (focus-visible) y la accesibilidad para lectores de pantalla.

03. Migración automatizada de base de datos a Drizzle ORM

La habilidad contiene reglas precisas para la generación de esquemas: convenciones de nombrado snake_case, definición correcta de índices, prohibición de enums crudos y creación de archivos de migración seguros sin bloqueo de tablas.

5. Errores comunes, trampas y seguridad

  • Conflicto de disparadores (Trigger Overlap): Si dos habilidades diferentes tienen descripciones demasiado amplias o similares (por ejemplo, code-review y security-audit), el agente puede cargar ambas, inflando el contexto, o dudar en elegir. Haga que las descripciones de los disparadores sean mutuamente excluyentes y contrastantes.
  • Scripts de utilidades obsoletos (Stale Tooling): Cambios en las API de bibliotecas externas pueden romper scripts auxiliares dentro de scripts/. Es necesario ejecutar pruebas periódicamente para validar la funcionalidad del código de las habilidades.
  • Falta de validación de seguridad (Prompt Injection via Untrusted Skills): Cargar habilidades de terceros desde repositorios no confiables puede contener instrucciones ocultas para robar claves privadas. Confíe solo en módulos de conocimiento verificados.
/ Preguntas frecuentesSchema.org FAQPage

FAQ: Habilidades de Agente (Agent Skills & Custom Workflows)

Un prompt monolítico gigante dispersa la atención del modelo (Lost-in-the-Middle) y provoca un consumo constante de tokens en cada paso. La arquitectura de habilidades utiliza carga perezosa (Lazy Loading): el agente ve solo un catálogo ligero de nombres y disparadores, cargando la guía completa de 10 páginas solo en el momento en que el usuario activa realmente la tarea correspondiente.
/ Enlaces internos
Todos los términos