Ir al contenido principal
© AgentePersonalizado.ai

AI Evals: cómo saber si tu agente IA está funcionando bien

Los AI Evals determinan si tu agente IA sigue funcionando bien semanas después del despliegue. Aprende qué medir, cómo detectar degradación antes de que afecte a usuarios y cómo implementar un framework de evaluación sin necesitar perfil técnico.
Los AI Evals determinan si tu agente IA sigue funcionando bien semanas después del despliegue. Aprende qué medir, cómo detectar degradación antes de que afecte a usuarios y cómo implementar un framework de evaluación sin necesitar perfil técnico.
Agente IA Personalizado a MEdida

Por qué un agente IA que funcionaba bien puede dejar de hacerlo sin que nadie lo detecte

Los agentes IA no fallan de forma dramática. No dan un mensaje de error visible ni se caen como una aplicación. Se degradan de forma gradual e invisible: responden un poco peor cada semana, se desvían levemente de su AI Persona, empiezan a cometer errores en casos que antes resolvían bien. Y si nadie está mirando las métricas correctas, esa degradación se detecta cuando ya ha afectado a cientos de usuarios.

Las tres causas más frecuentes de degradación silenciosa son:

  • Base de conocimiento desactualizada: el producto cambió, el proceso cambió o la política cambió, pero el agente sigue respondiendo con la información antigua. No falla técnicamente — falla informativamente.
  • Deriva de comportamiento: a medida que el agente procesa más conversaciones con instrucciones ambiguas o contradictorias, puede ir alejándose de los valores y límites definidos en su configuración original. Ese deslizamiento es casi imperceptible turno a turno.
  • Nuevos tipos de casos no previstos: los usuarios del agente evolucionan en cómo lo usan. Aparecen solicitudes que en el diseño inicial nadie anticipó. El agente las gestiona como puede — a veces bien, a veces no.

Los 3 niveles de evaluación de un agente IA

En 2026 la evaluación de agentes ha madurado hacia un modelo de tres niveles. El error más frecuente es quedarse solo en el primero. La base metodológica de la evaluación sistemática de LLMs fue establecida por el framework HELM (Holistic Evaluation of Language Models) de la Universidad de Stanford (Liang et al., 2022), que demostró que los modelos se comportan de forma radicalmente distinta según el escenario de evaluación — exactamente por eso los evals deben diseñarse específicamente para el caso de uso del agente, no como métricas genéricas.

Nivel 1 — Evaluación de respuesta individual

Mide si una respuesta concreta es correcta, relevante y coherente. Es el nivel más básico y el más fácil de implementar: se selecciona una muestra de conversaciones, se revisa cada respuesta y se evalúa si cumple los criterios definidos.

Es útil pero insuficiente. Según datos de Confident AI (2026), los fallos en agentes conversacionales son experienciales — se acumulan a lo largo de la conversación de formas que el usuario siente pero las métricas de respuesta individual no detectan.

Nivel 2 — Evaluación de trayectoria

Evalúa el camino completo que el agente recorrió para llegar a una respuesta, no solo la respuesta final. ¿Qué herramientas usó? ¿Hizo las preguntas correctas? ¿Tomó el número mínimo de pasos? ¿Recuperó bien cuando algo falló en el proceso?

Según el informe de evaluación de Maxim AI (2026), este es el principal cambio en las prácticas de evaluación de 2026: los equipos han pasado de medir si la respuesta final es correcta a medir si el camino para llegar a ella fue eficiente y coherente.

Nivel 3 — Evaluación de comportamiento ante casos extremos

Prueba sistemática del agente ante situaciones diseñadas para hacerlo fallar: usuarios agresivos, solicitudes fuera de ámbito, intentos de jailbreak, preguntas ambiguas, información contradictoria. Este nivel no busca el rendimiento promedio — busca los límites reales del agente.

Las 6 métricas clave para evaluar un agente IA

Métrica Qué mide Señal de alarma
Tasa de resolución autónoma % de conversaciones que el agente resuelve sin escalar al humano Cae más de 5 puntos respecto al mes anterior
Tasa de respuestas fuera de ámbito % de respuestas sobre temas que el agente debería declinar Cualquier instancia en zona roja es alarma inmediata
Coherencia con la AI Persona Si el agente mantiene el tono, los valores y los límites definidos Variaciones de registro o comportamiento entre tipos de conversación
Tasa de alucinaciones % de respuestas con información incorrecta o inventada Supera el 1-2% en procesos con datos verificables
Satisfacción post-interacción Valoración del usuario tras la conversación (CSAT o equivalente) Caída sostenida de más de 0,3 puntos en la escala usada
Tiempo medio de resolución Número de turnos o minutos hasta completar la tarea del usuario Aumenta sostenidamente sin que el tipo de caso haya cambiado

Cómo implementar un framework de AI Evals sin ser técnico

Los AI Evals no requieren ingenieros de ML ni herramientas complejas para empezar. Un framework básico funcional se puede implementar con tres elementos:

1. Dataset de casos de referencia (golden set)

Un conjunto de 50-100 conversaciones reales o simuladas que representan los casos más frecuentes e importantes del agente. Para cada conversación, se documenta la respuesta correcta esperada. Este dataset es la línea base contra la que se evalúa el agente cuando se actualiza o cuando se sospecha degradación.

El dataset debe incluir obligatoriamente casos de zona roja (solicitudes que el agente debe rechazar) y casos límite (situaciones ambiguas donde la respuesta correcta requiere aplicar los valores de la AI Persona).

2. Revisión periódica de muestra de conversaciones reales

Cada semana o quincena, revisar una muestra aleatoria de conversaciones reales del agente — entre 20 y 50, dependiendo del volumen. El objetivo no es detectar cada error individual sino identificar patrones: ¿hay un tipo de pregunta que el agente gestiona mal con frecuencia? ¿Hay una categoría de usuarios donde la satisfacción es sistemáticamente baja?

3. Test de regresión al actualizar

Cada vez que se actualiza la base de conocimiento del agente, se cambia un prompt o se añade un nuevo caso de uso, ejecutar el dataset de referencia completo y comparar los resultados con la versión anterior. Si la tasa de respuestas correctas cae, la actualización ha introducido una regresión que debe corregirse antes de desplegar.

Red flags: las señales de que tu agente necesita intervención inmediata

  • La tasa de escalada al humano sube sin que haya cambiado el tipo de consultas: el agente está encontrando más situaciones que no sabe gestionar. Causa probable: nuevos tipos de casos o degradación de la base de conocimiento.
  • Aparecen respuestas sobre temas de zona roja: el agente está respondiendo lo que no debería. Causa probable: deriva de comportamiento o jailbreak exitoso. Acción inmediata requerida.
  • El CSAT cae más de 0,3 puntos en dos semanas consecutivas: los usuarios están notando algo que las métricas técnicas no han capturado todavía. Revisar las conversaciones de los usuarios con baja valoración para identificar el patrón.
  • El agente responde con información que ya no es correcta: la base de conocimiento está desactualizada respecto a cambios en el producto, el proceso o la política. Actualización urgente del contenido.
  • El tiempo medio de conversación aumenta sin que el tipo de caso haya cambiado: el agente está tomando más turnos para resolver lo que antes resolvía en menos pasos. Causa probable: conflicto en las instrucciones o información contradictoria en la base de conocimiento.

Con qué frecuencia evaluar tu agente IA

Frecuencia Qué revisar Quién lo hace
Semanal Dashboard de métricas clave: tasa de resolución, CSAT, tasa de escalada. Muestra de 20-30 conversaciones. Responsable del proceso o del agente
Mensual Análisis de patrones de fallo, revisión de casos fuera de ámbito, comparativa con el mes anterior. Responsable + equipo de contenido o negocio
Trimestral Revisión completa de la AI Persona, actualización del dataset de referencia, test de regresión completo, revisión de casos extremos. Responsable + proveedor del agente
Ante cada actualización Test de regresión con el dataset completo antes de desplegar cualquier cambio. Equipo técnico

Preguntas frecuentes sobre AI Evals

  • ¿Necesito herramientas especializadas para hacer AI Evals?

    No para empezar. Un framework básico funcional se puede implementar con una hoja de cálculo para registrar la muestra de conversaciones revisadas, un criterio documentado de evaluación y un proceso de revisión periódica. Las herramientas especializadas — LangSmith, Maxim AI, Arize, DeepEval — aportan automatización y escala, pero son innecesarias hasta que el volumen de conversaciones hace inmanejable la revisión manual. La mayoría de las empresas medianas pueden cubrir sus necesidades de evaluación con revisión manual estructurada durante los primeros 6-12 meses.

  • ¿Cuántas conversaciones debo revisar manualmente cada semana?

    Para volúmenes de hasta 2.000 conversaciones semanales, una muestra aleatoria de 20-30 es estadísticamente suficiente para detectar patrones de fallo. Para volúmenes mayores, la muestra puede aumentarse proporcionalmente o estratificarse por tipo de caso para asegurar que los casos menos frecuentes pero más críticos también se revisan. Lo importante no es revisar todas las conversaciones sino revisar de forma consistente y documentar los resultados para detectar tendencias a lo largo del tiempo.

  • ¿Cómo sé si la degradación es del agente o de los usuarios?

    Comparando el tipo de conversación, no solo las métricas agregadas. Si la tasa de resolución cae pero el tipo de consultas que llegan ha cambiado (más consultas complejas, nuevos tipos de solicitudes), la causa puede ser externa al agente. Si el tipo de consultas no ha cambiado y la tasa cae, la degradación es del agente. El dataset de referencia ayuda aquí: si las conversaciones del dataset se resuelven igual que antes pero las reales se resuelven peor, el problema está en los nuevos tipos de casos, no en la calidad base del agente.

  • ¿Los AI Evals son lo mismo que el monitoreo de producción?

    Son complementarios pero distintos. El monitoreo de producción trackea métricas operacionales en tiempo real: disponibilidad, latencia, errores técnicos. Los AI Evals evalúan la calidad del comportamiento del agente: si responde bien, si se comporta de acuerdo con su configuración, si mejora o se degrada. Un agente puede tener monitoreo de producción perfecto — sin errores técnicos, con latencia baja — y al mismo tiempo estar dando respuestas incorrectas o fuera de su AI Persona. Los dos sistemas son necesarios.

  • ¿Qué hago cuando detecto que mi agente está fallando?

    El proceso de respuesta depende del tipo de fallo. Para fallos de información (respuestas incorrectas por base de conocimiento desactualizada): actualizar el contenido y ejecutar test de regresión. Para fallos de comportamiento (respuestas fuera de AI Persona o de zona roja): revisar y reforzar las instrucciones del agente, añadir ejemplos explícitos del comportamiento correcto. Para fallos de cobertura (casos no previstos que el agente no gestiona bien): añadir esos casos al diseño del agente y al dataset de referencia. En ningún caso el agente debe permanecer en producción con fallos de zona roja activos.