À la fin, vous pouvez cartographier les garanties
Vous serez en mesure de concevoir plusieurs garde-fous indépendantes autour d'un flux de travail afin qu'une sortie de modèle confuse ne puisse pas devenir une action commerciale incontrôlée.
Une seule instruction telle que « soyez prudent » n'est pas une garde-fou.
Une seule instruction telle que « soyez prudent » n'est pas une garde-fou. Un fonctionnement sûr vient de la limitation de qui peut démarrer le flux de travail, quelles informations il voit, quels outils il peut utiliser, ce qu'il doit faire approuver et comment une personne peut l'examiner.
Identité de couche, entrée, outils, approbation, journaux et personnes
Termes clés : Défense en profondeur, limite d'entrée, limite d'outil et Humain dans la boucle
Comment cartographier les garanties
Protéger l'entrée
Validez l'utilisateur, l'événement ou l'autorisation dans la mesure du possible avant de fournir un contexte sensible ou de lancer une action.
Limiter le contenu non fiable
Traitez les instructions externes, les pièces jointes et le texte client comme des données à interpréter, et non comme une nouvelle autorité à suivre.
Restreindre les actions
Donnez à chaque outil une portée étroite et exigez des approbations pour les changements conséquents.
Garder les journaux révisables
Stockez le déclencheur, le contexte pertinent, les appels à l'outil, la sortie, l'approbation et le transfert afin que les problèmes puissent être compris.
Cas de travail : opérer avec des garanties en couches
Un agent de gestion de compte est autorisé à résumer une demande de client et à rédiger un ordre de modification. Il ne peut pas appliquer le changement ou modifier la facturation.
Le texte du client peut influencer le résumé, mais ne peut pas demander à l'agent de révéler d'autres comptes, de modifier ses règles ou d'appeler un outil non lié. L'agent ne reçoit que le contexte de l'espace de travail du client et envoie le brouillon au responsable du compte pour approbation.
Le responsable du compte voit la demande, les détails de la source, le brouillon et la piste d'audit avant de communiquer avec le client. Les garanties existent aux niveaux d'accès, d'entrée, d'outil et d'approbation.
Laboratoire appliqué
Transformer le modèle de menace en preuve de contrôle
Cartographiez comment les données non fiables atteignent les modèles, la mémoire, les outils et les personnes. Testez ensuite si chaque contrôle modifie le résultat. Une liste de risques n'est pas un examen de sécurité.
- Étape 1
Tracer des limites de confiance
Afficher les utilisateurs, les canaux, les sources de récupération, le contexte du modèle, la mémoire, la passerelle d'outils, les systèmes clients, les journaux et l'approbation humaine. Marquez les identités, les secrets, les limites du locataire et chaque endroit où le contenu non fiable traverse à l'intérieur.
- Étape 2
Écrivez huit cas d'abus
Couvrez l'injection de prompt, l'utilisation abusive des outils, l'escalade de l'identité, l'accès entre les locataires, l'empoisonnement de la mémoire, la divulgation de données sensibles, l'autonomie excessive et les échecs en cascade. Nommez l'actif et l'attaquant plausible.
- Étape 3
Prévention et détection des cartes
Pour chaque cas d'abus, nommez un contrôle préventif, un signal de détective, le responsable de la réponse et la preuve. Préférez les informations d'identification étroites, les outils dactylographiés, la validation, le bac à sable, l'approbation, les limites de débit et les contrôles d'arrêt aux défenses à le prompt uniquement.
- Étape 4
Exécuter des tests contradictoires
Tentez le cas d'abus dans un locataire de test. Préserver l'entrée, le contexte récupéré, la demande d'outil, la décision de politique, la sortie, le journal et l'action de l'opérateur. Ajoutez chaque échec à l'ensemble de régression.
Modèle de travail
abuse_case: retrieved document asks agent to export credentials
asset: client secrets
trust_boundary: retrieval -> model context
prevent: strip active instructions; source allowlist; tool has no secret-read scope
detect: untrusted-instruction classifier and denied-tool event
respond: stop run, quarantine source, notify security owner
evidence: trace URL + policy decision + denial log
regression_case: sec_014Preuve à soumettre
Soumettez le diagramme de flux de données, huit cas d'abus, la matrice de preuves de contrôle et les traces brutes d'au moins quatre tests contradictoires.
Critères de passage
- Chaque outil conséquent a une limite d'autorisation en dehors du modèle.
- La détection et la réponse ont nommé les responsables.
- L'échec des tests contradictoires devient des régressions bloquant les versions.
Cartographier les garanties
Modèle de menace l'agent, pas seulement le prompt.
L'injection rapide est une voie vers le mal, et non l'ensemble du modèle de menace. Inclure le détournement d'objectifs, l'utilisation abusive des outils, l'abus d'identité et de privilèges, le risque de la chaîne d'approvisionnement, l'exécution inattendue du code, l'empoisonnement de la mémoire, les échecs en cascade, les agents voyous et le déni de ressources.
- Cartographier les données non fiables avant qu'elles n'entrent dans le contexte du modèle.
- Donnez aux outils des informations d'identification étroites et des étendues de ressources.
- Ajoutez l'approbation, la surveillance, les limites de débit et un arrêt d'urgence autour des actions conséquentes.
Sources utilisées pour cette vérification
Avant de passer à autre chose
- Choisissez une action d'agent et énumérez toutes les garanties qui l'entourent.
- Ajoutez un contrôle qui protège toujours le client si la couche d'instruction échoue.
- Demandez si l'examinateur a suffisamment d'autorité pour arrêter une mauvaise action.
- La sécurité ne dépend pas d'une seule prompt.
- Le contenu non fiable ne peut pas accorder une nouvelle autorité.
- Les outils sont en cadre à la portée du travail.
- Les journaux et l'examen humain sont utilisables dans la pratique.
Progression de la leçon
Vous avez terminé cette leçon ?
Enregistrez votre progression sur cet appareil pour reprendre facilement là où vous vous êtes arrêté.
Cette leçon n'est pas encore marquée comme terminée.