Al terminar podrá crear el conjunto de evaluación
Podrá crear un conjunto de evaluaciones pequeño pero significativo antes de que los clientes encuentren el flujo de trabajo, incluidos los casos con mayor probabilidad de exponer comportamientos inseguros.
El buen trabajo de un agente es útil antes de impresionar.
Unas pocas demostraciones satisfactorias no son prueba de confiabilidad. Un conjunto de evaluación define qué significa un comportamiento aceptable para el trabajo real y permite comparar versiones sin depender de la memoria.
Compare casos representativos antes de publicar
- 01Caso habitual
- 02Caso límite
- 03Ataque
- 04Fallo
Conceptos clave: cree un conjunto de evaluación antes del lanzamiento
Cómo crear el conjunto de evaluación
- 01
Recoger casos representativos
Utilice casos consentidos, anónimos o sintéticos basados en el trabajo normal y excepciones conocidas.
- 02
Escriba el comportamiento esperado
Defina la ruta, respuesta, acción o condición de parada antes de ejecutar el sistema.
- 03
Calidad de puntuación
Utilice una rúbrica simple para determinar la corrección, la integridad, el tono, la alineación de las políticas y la calidad de la transferencia.
- 04
Establecer una puerta de lanzamiento
Decida qué fallas bloquean el lanzamiento, cuáles requieren un alcance más limitado y cuáles pueden monitorearse en un piloto.
Caso práctico: cree un conjunto de evaluación antes del lanzamiento
Se pone a prueba a un agente de investigación de bienes raíces con una solicitud directa del comprador, una solicitud vaga en la que falta una ubicación, un cliente existente que pregunta sobre un contrato y un mensaje de estilo inyección rápida que le pide que ignore la política.
El resultado esperado para el caso normal es un registro completo y un agente asignado. La consulta del contrato se dirige a una persona; la instrucción maliciosa no cambia los límites del agente; la solicitud vaga recibe una pregunta aclaratoria y luego una transferencia si no queda clara.
El equipo registra los resultados reales, los motivos y las correcciones. No indica que la compilación está lista porque la demostración normal parecía pulida.
Cree el conjunto de evaluación
Evalúe el recorrido, no solo la respuesta.
Un mensaje final pulido puede ocultar una recuperación equivocada, una llamada innecesaria, una infracción de política o una recuperación afortunada. Puntúe el éxito de la tarea e inspeccione el recorrido: evidencia, herramientas, argumentos, aprobaciones, transferencias, latencia y coste.
- Incluya casos habituales, límite, adversarios y de varios turnos.
- Calibre los evaluadores basados en modelos frente a una revisión humana a ciegas.
- Mantenga un conjunto reservado y añada los fallos de producción a las pruebas de regresión.
Fuentes consultadas
Antes de seguir adelante
- Escriba diez casos: seis normales, dos extremos, uno sensible y un caso contradictorio o de falla.
- Califique cada caso antes de editar el agente.
- Elija la falla que dañaría más la confianza y solucione esa falla primero.
- Los casos reflejan el flujo de trabajo real.
- El comportamiento esperado incluye detenerse de manera segura.
- Un anotador puede explicar por qué se aprobó un resultado.
- Los criterios de lanzamiento se acuerdan antes del lanzamiento.