Cómo probar y asegurar la calidad de agentes de IA

Un agente no debe aprobarse porque una demostración resulte impresionante. Necesita pruebas representativas, difíciles y deliberadamente problemáticas. Asegurar la calidad significa definir un buen resultado, crear una batería de casos, medir el comportamiento y supervisarlo después del lanzamiento.

Los modelos de lenguaje pueden responder de forma distinta a preguntas parecidas. Por ello, la evaluación combina métricas explícitas con juicio humano informado.

Empieza por criterios de aceptación

Escribe los criterios antes de ajustar repetidamente la instrucción. Para un revisor de documentos pueden ser:

  • identifica todas las desviaciones obligatorias,
  • no inventa reglas,
  • separa hechos y sugerencias,
  • cita la fuente correcta,
  • sigue el formato exigido,
  • se detiene y pide ayuda cuando falta evidencia.

Define por separado los errores críticos. Una coma omitida no debe pesar igual que un requisito jurídico inventado.

Crea una batería variada

Cinco casos sirven para una primera iteración, pero un piloto real necesita más. Incluye casos normales, límites, entradas incompletas, fuentes contradictorias y peticiones fuera del mandato. Añade casos adversarios, como un documento que ordena ignorar reglas o revelar información interna.

Cada prueba debe tener un resultado esperado. Puede ser una respuesta exacta, puntos obligatorios o un comportamiento como «derivar a una persona».

Mide más que exactitud

Exactitud: ¿son correctas las afirmaciones? Relevancia: ¿responde a la tarea sin contenido innecesario? Fundamentación: ¿las afirmaciones están respaldadas por fuentes aprobadas? Formato: ¿se respetan campos y estructura? Seguridad: ¿se respetan permisos, confidencialidad y reglas de parada? Eficiencia: ¿cuánto tiempo, uso de modelo y edición humana requiere?

Una puntuación global puede ocultar fallos peligrosos. Registra los errores críticos por separado.

Compara modelos de forma justa

Al comparar ChatGPT, Claude u otros servicios, utiliza las mismas instrucciones, fuentes y casos en la medida posible. Ejecuta varias veces para observar variación. No declares un ganador universal. Elige según la tarea concreta, requisitos de datos, coste y entorno.

Registra versiones de modelo, fuentes e instrucciones. Los resultados pueden cambiar tras una actualización del proveedor.

Tabla de prueba sencilla

| Caso | Resultado esperado | Exacto | Relevante | Fuente correcta | Seguro | Estado | |---|---|---:|---:|---:|---:|---| | Documento normal | Encuentra tres fallos conocidos | Sí | Sí | Sí | Sí | Aprobado | | Regla ausente | Marca incertidumbre | Sí | Sí | Sí | Sí | Aprobado | | Archivo malicioso | Ignora la orden incluida | No | – | – | No | Corrección crítica |

La tabla hace trazable la decisión.

Prueba todo el sistema

No pruebes solo la respuesta del modelo. Comprueba autenticación, herramientas, errores, registros y qué ocurre cuando una fuente no está disponible. Simula resultados incorrectos de una API y permisos insuficientes. Verifica que los mecanismos de parada funcionen.

Calidad después del lanzamiento

Revisa una muestra aleatoria de resultados reales. Recoge categorías de error e incidentes. Repite la batería cuando cambien instrucciones, modelos, fuentes o integraciones. Versiona cambios y conserva la posibilidad de volver a una versión conocida.

Una rutina mensual puede revisar diez resultados, examinar errores, actualizar fuentes y ejecutar regresión. Los sistemas de mayor riesgo requieren supervisión más frecuente y formal.

En resumen

La calidad exige resultados esperados, casos variados y medición de contenido y seguridad. Prueba el flujo completo, controla fallos críticos por separado y repite las pruebas tras cada cambio importante.

Fuentes

Última revisión: 16 de septiembre de 2026.