Al terminar podrá mapear las capas de protección
Podrá diseñar múltiples salvaguardas independientes en torno a un flujo de trabajo para que el resultado de un modelo confuso no pueda convertirse en una acción comercial incontrolada.
El buen trabajo de un agente es útil antes de impresionar.
Una sola instrucción como “esté seguro” no es una salvaguardia. La operación segura proviene de limitar quién puede iniciar el flujo de trabajo, qué información ve, qué herramientas puede usar, qué debe aprobarse y cómo una persona puede revisarlo.
Combine controles antes, durante y después de cada acción
- 01Identidad
- 02Entrada
- 03Herramientas
- 04Aprobación
- 05Registros
- 06Persona
Conceptos clave: trabaje con varias capas de protección
Cómo mapear las capas de protección
- 01
Proteger la entrada
Valide el usuario, evento o permiso cuando sea práctico antes de proporcionar un contexto sensible o iniciar una acción.
- 02
Limitar el contenido que no es de confianza
Trate las instrucciones externas, los archivos adjuntos y los textos del cliente como datos para interpretar, no como una nueva autoridad a seguir.
- 03
Restringir acciones
Dé a cada herramienta un alcance limitado y exija aprobaciones para los cambios consiguientes.
- 04
Mantenga registros revisables
Almacene el activador, el contexto relevante, las llamadas a herramientas, los resultados, la aprobación y la transferencia para que se puedan comprender los problemas.
Caso práctico: trabaje con varias capas de protección
Un agente de administración de cuentas puede resumir la solicitud de un cliente y redactar una orden de cambio. No puede aplicar el cambio ni alterar la facturación.
El texto del cliente puede influir en el resumen, pero no puede indicarle al agente que revele otras cuentas, cambie sus reglas o llame a una herramienta no relacionada. El agente recibe solo el contexto del espacio de trabajo del cliente y envía el borrador al responsable de la cuenta para su aprobación.
El responsable de la cuenta ve la solicitud, los detalles obtenidos, el borrador y el registro de auditoría antes de comunicarse con el cliente. Existen salvaguardas en los niveles de acceso, entrada, herramientas y aprobación.
Mapee las capas de protección
Analice las amenazas del agente, no solo las del prompt.
La inyección de prompts es una vía de daño, no todo el modelo de amenazas. Incluya secuestro de objetivos, uso indebido de herramientas, abuso de identidad y privilegios, riesgo de cadena de suministro, ejecución inesperada de código, contaminación de memoria, fallos en cascada, agentes descontrolados y agotamiento de recursos.
- Mapee los datos que no sean de confianza antes de introducirlos en el contexto.
- Dé a las herramientas credenciales y ámbitos de recurso limitados.
- Rodee las acciones importantes con aprobación, supervisión, límites de uso y una parada de emergencia.
Fuentes consultadas
Antes de seguir adelante
- Elija una acción de agente y enumere todas las salvaguardas que la rodean.
- Agregue un control que aún proteja al cliente si falla la capa de instrucciones.
- Pregunte si el revisor tiene suficiente autoridad para detener una mala acción.
- La seguridad no depende de un solo aviso.
- El contenido que no es de confianza no puede otorgar nueva autoridad.
- Las herramientas están adaptadas al trabajo.
- Los registros y la revisión humana se pueden utilizar en la práctica.