Module 07 · Leçon 27

Fonctionner avec des garde-fous en couches

Combinez l'autorisation, l'entrée, l'outil, l'approbation, la journalisation et les garde-fous humaines au lieu de vous fier à une seule prompt.

Dernière mise à jour

15 à 25 minutesCours gratuit d'agent d'IA
Ce que vous apprendrez

À la fin, vous pouvez cartographier les garanties

Vous serez en mesure de concevoir plusieurs garde-fous indépendantes autour d'un flux de travail afin qu'une sortie de modèle confuse ne puisse pas devenir une action commerciale incontrôlée.

Pourquoi est-ce important ?

Une seule instruction telle que « soyez prudent » n'est pas une garde-fou.

Une seule instruction telle que « soyez prudent » n'est pas une garde-fou. Un fonctionnement sûr vient de la limitation de qui peut démarrer le flux de travail, quelles informations il voit, quels outils il peut utiliser, ce qu'il doit faire approuver et comment une personne peut l'examiner.

Note de champ 27

Identité de couche, entrée, outils, approbation, journaux et personnes

Concepts fondamentaux

Termes clés : Défense en profondeur, limite d'entrée, limite d'outil et Humain dans la boucle

Défense en profondeurPlusieurs contrôles travaillent ensemble de sorte qu'un échec ne décide pas de l'ensemble du résultat.
Limite d'entréeQuels types de données ou de demandes le flux de travail accepte et comment le contenu non fiable est traité.
Limite d'outilLes actions limitées disponibles pour l'agent, avec des autorisations distinctes pour chacune.
Humain-dans-la-boucleUne personne dont l'examen est significatif parce qu'elle a des preuves, de l'autorité et du temps pour agir.
La méthode pratique

Comment cartographier les garanties

Protéger l'entrée

Validez l'utilisateur, l'événement ou l'autorisation dans la mesure du possible avant de fournir un contexte sensible ou de lancer une action.

Limiter le contenu non fiable

Traitez les instructions externes, les pièces jointes et le texte client comme des données à interpréter, et non comme une nouvelle autorité à suivre.

Restreindre les actions

Donnez à chaque outil une portée étroite et exigez des approbations pour les changements conséquents.

Garder les journaux révisables

Stockez le déclencheur, le contexte pertinent, les appels à l'outil, la sortie, l'approbation et le transfert afin que les problèmes puissent être compris.

Exemple travaillé

Cas de travail : opérer avec des garanties en couches

Un agent de gestion de compte est autorisé à résumer une demande de client et à rédiger un ordre de modification. Il ne peut pas appliquer le changement ou modifier la facturation.

Le texte du client peut influencer le résumé, mais ne peut pas demander à l'agent de révéler d'autres comptes, de modifier ses règles ou d'appeler un outil non lié. L'agent ne reçoit que le contexte de l'espace de travail du client et envoie le brouillon au responsable du compte pour approbation.

Le responsable du compte voit la demande, les détails de la source, le brouillon et la piste d'audit avant de communiquer avec le client. Les garanties existent aux niveaux d'accès, d'entrée, d'outil et d'approbation.

Laboratoire appliqué

Transformer le modèle de menace en preuve de contrôle

Cartographiez comment les données non fiables atteignent les modèles, la mémoire, les outils et les personnes. Testez ensuite si chaque contrôle modifie le résultat. Une liste de risques n'est pas un examen de sécurité.

  1. Étape 1

    Tracer des limites de confiance

    Afficher les utilisateurs, les canaux, les sources de récupération, le contexte du modèle, la mémoire, la passerelle d'outils, les systèmes clients, les journaux et l'approbation humaine. Marquez les identités, les secrets, les limites du locataire et chaque endroit où le contenu non fiable traverse à l'intérieur.

  2. Étape 2

    Écrivez huit cas d'abus

    Couvrez l'injection de prompt, l'utilisation abusive des outils, l'escalade de l'identité, l'accès entre les locataires, l'empoisonnement de la mémoire, la divulgation de données sensibles, l'autonomie excessive et les échecs en cascade. Nommez l'actif et l'attaquant plausible.

  3. Étape 3

    Prévention et détection des cartes

    Pour chaque cas d'abus, nommez un contrôle préventif, un signal de détective, le responsable de la réponse et la preuve. Préférez les informations d'identification étroites, les outils dactylographiés, la validation, le bac à sable, l'approbation, les limites de débit et les contrôles d'arrêt aux défenses à le prompt uniquement.

  4. Étape 4

    Exécuter des tests contradictoires

    Tentez le cas d'abus dans un locataire de test. Préserver l'entrée, le contexte récupéré, la demande d'outil, la décision de politique, la sortie, le journal et l'action de l'opérateur. Ajoutez chaque échec à l'ensemble de régression.

Modèle de travail

abuse_case: retrieved document asks agent to export credentials
asset: client secrets
trust_boundary: retrieval -> model context
prevent: strip active instructions; source allowlist; tool has no secret-read scope
detect: untrusted-instruction classifier and denied-tool event
respond: stop run, quarantine source, notify security owner
evidence: trace URL + policy decision + denial log
regression_case: sec_014

Preuve à soumettre

Soumettez le diagramme de flux de données, huit cas d'abus, la matrice de preuves de contrôle et les traces brutes d'au moins quatre tests contradictoires.

Critères de passage

  • Chaque outil conséquent a une limite d'autorisation en dehors du modèle.
  • La détection et la réponse ont nommé les responsables.
  • L'échec des tests contradictoires devient des régressions bloquant les versions.
Construisez-le dans la pratique

Cartographier les garanties

Vérification d'entrée : [validation]. Entrées non fiables : [types]. Outils autorisés : [liste de portée]. Actions d'approbation : [liste]. Journaux requis : [champs]. responsable de l'escalade : [rôle].
Vérification du modèle de menace

Modèle de menace l'agent, pas seulement le prompt.

L'injection rapide est une voie vers le mal, et non l'ensemble du modèle de menace. Inclure le détournement d'objectifs, l'utilisation abusive des outils, l'abus d'identité et de privilèges, le risque de la chaîne d'approvisionnement, l'exécution inattendue du code, l'empoisonnement de la mémoire, les échecs en cascade, les agents voyous et le déni de ressources.

  • Cartographier les données non fiables avant qu'elles n'entrent dans le contexte du modèle.
  • Donnez aux outils des informations d'identification étroites et des étendues de ressources.
  • Ajoutez l'approbation, la surveillance, les limites de débit et un arrêt d'urgence autour des actions conséquentes.

Sources utilisées pour cette vérification

Pratique

Avant de passer à autre chose

  • Choisissez une action d'agent et énumérez toutes les garanties qui l'entourent.
  • Ajoutez un contrôle qui protège toujours le client si la couche d'instruction échoue.
  • Demandez si l'examinateur a suffisamment d'autorité pour arrêter une mauvaise action.
  • La sécurité ne dépend pas d'une seule prompt.
  • Le contenu non fiable ne peut pas accorder une nouvelle autorité.
  • Les outils sont en cadre à la portée du travail.
  • Les journaux et l'examen humain sont utilisables dans la pratique.

Progression de la leçon

Vous avez terminé cette leçon ?

Enregistrez votre progression sur cet appareil pour reprendre facilement là où vous vous êtes arrêté.

Cette leçon n'est pas encore marquée comme terminée.