Ir al contenido

Módulo 07 · Lección 25

Cree un conjunto de evaluación antes del lanzamiento

Pruebe casos representativos normales, extremos, contradictorios y de falla frente a los resultados esperados.

Actualizado en agosto de 2026 · AI Agency Academy

lo que aprenderás

Tome una decisión operativa clara y más segura.

Podrá crear un conjunto de evaluaciones pequeño pero significativo antes de que los clientes encuentren el flujo de trabajo, incluidos los casos con mayor probabilidad de exponer comportamientos inseguros.

Por qué esto importa

El buen trabajo de un agente es útil antes de impresionar.

Unas pocas demostraciones satisfactorias no son prueba de confiabilidad. Un conjunto de evaluación define qué significa un comportamiento aceptable para el trabajo real y permite comparar versiones sin depender de la memoria.

Nota de campo 25

Haz visible la relación.

Conceptos centrales

El lenguaje que mantiene el trabajo claro.

Caso de pruebaUna entrada realista, un contexto relevante y un comportamiento esperado para el flujo de trabajo.
Guardado en este dispositivo.
Condición de paseUn estándar claro, como ruta correcta, resumen preciso, respuesta aprobada o traspaso seguro.
Caso de fracasoUna prueba en la que el resultado correcto es detenerse, negarse, preguntar o intensificar la situación.
Revisión de seguimientoInspeccionar el contexto relevante, las opciones de herramientas, los resultados y la transferencia para comprender por qué se produjo un resultado.
El método práctico

Analice la decisión en orden.

  1. 01

    Recoger casos representativos

    Utilice casos consentidos, anónimos o sintéticos basados en el trabajo normal y excepciones conocidas.

  2. 02

    Escribe el comportamiento esperado

    Defina la ruta, respuesta, acción o condición de parada antes de ejecutar el sistema.

  3. 03

    Calidad de puntuación

    Utilice una rúbrica simple para determinar la corrección, la integridad, el tono, la alineación de las políticas y la calidad de la transferencia.

  4. 04

    Establecer una puerta de lanzamiento

    Decida qué fallas bloquean el lanzamiento, cuáles requieren un alcance más limitado y cuáles pueden monitorearse en un piloto.

Ejemplo resuelto

Una implementación realista y limitada.

Se pone a prueba a un agente de investigación de bienes raíces con una solicitud directa del comprador, una solicitud vaga en la que falta una ubicación, un cliente existente que pregunta sobre un contrato y un mensaje de estilo inyección rápida que le pide que ignore la política.

El resultado esperado para el caso normal es un registro completo y un agente asignado. La consulta del contrato se dirige a una persona; la instrucción maliciosa no cambia los límites del agente; la solicitud vaga recibe una pregunta aclaratoria y luego una transferencia si no queda clara.

El equipo registra los resultados reales, los motivos y las correcciones. No indica que la compilación está lista porque la demostración normal parecía pulida.

Constrúyelo en la práctica

Utilice esta plantilla de trabajo copiable.

Adáptelo a la evidencia, las políticas, las personas y las herramientas del cliente. No trate los marcadores de posición como instrucciones aprobadas.

ID del caso: [id]. Escenario: [entrada + contexto]. Comportamiento esperado: [resultado]. Rúbrica de calidad: [criterios]. Comportamiento observado: [resultado]. Decisión: [aprobar / arreglar / limitar el alcance].
Implementación del cerebro espacial

Coloque el sistema operativo alrededor del agente.

Utilice contactos de prueba controlados, tareas, conversaciones, historial de flujo de trabajo e informes para ejecutar evaluaciones sin mezclarlas con registros de clientes en vivo.

Practica

Antes de seguir adelante

  • Escriba diez casos: seis normales, dos extremos, uno sensible y un caso contradictorio o de falla.
  • Califique cada caso antes de editar el agente.
  • Elija la falla que dañaría más la confianza y solucione esa falla primero.
  • Los casos reflejan el flujo de trabajo real.
  • El comportamiento esperado incluye detenerse de manera segura.
  • Un anotador puede explicar por qué se aprobó un resultado.
  • Los criterios de lanzamiento se acuerdan antes del lanzamiento.

Pon el aprendizaje a trabajar

Cree un servicio de IA en el que la gente pueda confiar.

Cree una cuenta gratuita de Spacebrain y utilice la capa operativa en torno a su servicio de IA.

Probar gratis