Módulo 07 · Lección 25

Cree un conjunto de evaluación antes del lanzamiento

Pruebe casos normales, extremos, adversarios y de fallo contra resultados, trayectorias y criterios de aprobación definidos.

Actualizado en agosto de 2026 · AI Agency Academy

Lo que aprenderá

Al terminar podrá crear el conjunto de evaluación

Podrá crear un conjunto de evaluaciones pequeño pero significativo antes de que los clientes encuentren el flujo de trabajo, incluidos los casos con mayor probabilidad de exponer comportamientos inseguros.

Por qué esto importa

El buen trabajo de un agente es útil antes de impresionar.

Unas pocas demostraciones satisfactorias no son prueba de confiabilidad. Un conjunto de evaluación define qué significa un comportamiento aceptable para el trabajo real y permite comparar versiones sin depender de la memoria.

Nota de campo 25

Compare casos representativos antes de publicar

Conjunto de evaluaciónCompare casos representativos antes de publicar
  1. 01Caso habitual
  2. 02Caso límite
  3. 03Ataque
  4. 04Fallo
Conceptos centrales

Conceptos clave: cree un conjunto de evaluación antes del lanzamiento

Caso de pruebaUna entrada realista, un contexto relevante y un comportamiento esperado para el flujo de trabajo.
Condición de paseUn estándar claro, como ruta correcta, resumen preciso, respuesta aprobada o traspaso seguro.
Caso de fracasoUna prueba en la que el resultado correcto es detenerse, negarse, preguntar o intensificar la situación.
Revisión de seguimientoInspeccionar el contexto relevante, las opciones de herramientas, los resultados y la transferencia para comprender por qué se produjo un resultado.
El método práctico

Cómo crear el conjunto de evaluación

  1. 01

    Recoger casos representativos

    Utilice casos consentidos, anónimos o sintéticos basados en el trabajo normal y excepciones conocidas.

  2. 02

    Escriba el comportamiento esperado

    Defina la ruta, respuesta, acción o condición de parada antes de ejecutar el sistema.

  3. 03

    Calidad de puntuación

    Utilice una rúbrica simple para determinar la corrección, la integridad, el tono, la alineación de las políticas y la calidad de la transferencia.

  4. 04

    Establecer una puerta de lanzamiento

    Decida qué fallas bloquean el lanzamiento, cuáles requieren un alcance más limitado y cuáles pueden monitorearse en un piloto.

Ejemplo resuelto

Caso práctico: cree un conjunto de evaluación antes del lanzamiento

Se pone a prueba a un agente de investigación de bienes raíces con una solicitud directa del comprador, una solicitud vaga en la que falta una ubicación, un cliente existente que pregunta sobre un contrato y un mensaje de estilo inyección rápida que le pide que ignore la política.

El resultado esperado para el caso normal es un registro completo y un agente asignado. La consulta del contrato se dirige a una persona; la instrucción maliciosa no cambia los límites del agente; la solicitud vaga recibe una pregunta aclaratoria y luego una transferencia si no queda clara.

El equipo registra los resultados reales, los motivos y las correcciones. No indica que la compilación está lista porque la demostración normal parecía pulida.

Llévelo a la práctica

Cree el conjunto de evaluación

ID del caso: [id]. Escenario: [entrada + contexto]. Comportamiento esperado: [resultado]. Rúbrica de calidad: [criterios]. Comportamiento observado: [resultado]. Decisión: [aprobar / arreglar / limitar el alcance].
Revisión de evaluación

Evalúe el recorrido, no solo la respuesta.

Un mensaje final pulido puede ocultar una recuperación equivocada, una llamada innecesaria, una infracción de política o una recuperación afortunada. Puntúe el éxito de la tarea e inspeccione el recorrido: evidencia, herramientas, argumentos, aprobaciones, transferencias, latencia y coste.

  • Incluya casos habituales, límite, adversarios y de varios turnos.
  • Calibre los evaluadores basados en modelos frente a una revisión humana a ciegas.
  • Mantenga un conjunto reservado y añada los fallos de producción a las pruebas de regresión.

Fuentes consultadas

Practica

Antes de seguir adelante

  • Escriba diez casos: seis normales, dos extremos, uno sensible y un caso contradictorio o de falla.
  • Califique cada caso antes de editar el agente.
  • Elija la falla que dañaría más la confianza y solucione esa falla primero.
  • Los casos reflejan el flujo de trabajo real.
  • El comportamiento esperado incluye detenerse de manera segura.
  • Un anotador puede explicar por qué se aprobó un resultado.
  • Los criterios de lanzamiento se acuerdan antes del lanzamiento.