Modul 07 · Lektion 25

Erstellen Sie vor dem Start einen Bewertungssatz

Testen Sie repräsentative normale, Rand-, kontradiktorische und Ausfallfälle gegen erwartete Ergebnisse.

Zuletzt aktualisiert

15–25 MinutenKostenloser KI-Agenten-Kurs
Was du lernen wirst

Am Ende können Sie den Bewertungssatz erstellen

Sie können einen kleinen, aber aussagekräftigen Bewertungssatz erstellen, bevor Kunden auf den Workflow stoßen, einschließlich der Fälle, die am ehesten unsicheres Verhalten aufdecken.

Warum das wichtig ist

Ein paar zufriedenstellende Demos sind kein Beweis für Zuverlässigkeit.

Ein paar zufriedenstellende Demos sind kein Beweis für Zuverlässigkeit. Ein Auswertungssatz definiert, was akzeptables Verhalten für den eigentlichen Job bedeutet, und ermöglicht es, Versionen zu vergleichen, ohne auf den Speicher angewiesen zu sein.

Feldnotiz 25

Vergleichen Sie repräsentative Fälle, erwartetes Verhalten, Spuren und Freigabeentscheidungen

Kernkonzepte

Schlüsselbegriffe: Testfall, Bestehenszustand, Fehlerfall und Trace-Überprüfung

MusterprozessEin realistischer Input, relevanter Kontext und erwartetes Verhalten für den Workflow.
PassbedingungEin klarer Standard wie korrekte Route, genaue Zusammenfassung, genehmigte Antwort oder sichere Übergabe.
FehlerfallEin Test, bei dem das richtige Ergebnis ist, zu stoppen, abzulehnen, zu fragen oder zu eskalieren.
Überprüfung verfolgenÜberprüfen Sie den relevanten Kontext, die Werkzeugauswahl, die Ausgabe und die Übergabe, um zu verstehen, warum ein Ergebnis aufgetreten ist.
Die praktische Methode

Wie man das Bewertungsset erstellt

Vertretungsfälle sammeln

Verwenden Sie einvernehmliche, anonymisierte oder synthetische Fälle, die auf normaler Arbeit und bekannten Ausnahmen basieren.

Erwartetes Verhalten aufschreiben

Definieren Sie die Routing-, Antwort-, Aktions- oder Stoppbedingung, bevor Sie das System ausführen.

Ergebnisqualität

Verwenden Sie eine einfache Rubrik für Korrektheit, Vollständigkeit, Ton, Richtlinienausrichtung und Übergabequalität.

Stellen Sie ein Startgate ein

Entscheiden Sie, welche Fehler den Start blockieren, welche einen engeren Umfang erfordern und welche in einem Pilotprojekt überwacht werden können.

Gearbeitetes Beispiel

Arbeitsfall: Erstellen Sie vor dem Start ein Bewertungsset

Ein Makler für Immobilienanfragen wird mit einer einfachen Käuferanfrage, einer vagen Anfrage mit fehlendem Standort, einem bestehenden Kunden, der nach einem Vertrag fragt, und einer Nachricht im Stil einer Promptsinjektion getestet, die ihn auffordert, die Richtlinie zu ignorieren.

Das erwartete Ergebnis für den normalen Fall ist eine vollständige Aufzeichnung und ein zugewiesener Agent. Die Vertragsabfrage leitet zu einer Person weiter; die böswillige Anweisung ändert nicht die Grenze des Agenten; die vage Anfrage erhält eine klärende Frage und dann eine Übergabe, wenn sie unklar bleibt.

Das Team zeichnet tatsächliche Ergebnisse, Gründe und Korrekturen auf. Es ruft den Build nicht als fertig an, weil die normale Demo ausgefeilt aussah.

Angewandtes Labor

Erstellen Sie einen Bewertungssatz, der eine Veröffentlichung blockieren kann

Verwandeln Sie repräsentative Arbeit in einen versionierten Testsatz. Bewerten Sie das Ergebnis und den Pfad, wiederholen Sie nicht-deterministische Fälle und entscheiden Sie im Voraus, welches Ergebnis die Freisetzung verhindert.

  1. Schritt 1

    Fälle und Scheiben definieren

    Dazu gehören normale, Rand-, feindliche, Werkzeugausfälle und menschliche Übergabefälle. Beschriften Sie wichtige Abschnitte wie Sprache, Kanal, Kundenebene, Mehrdeutigkeit und Risiko, anstatt einem Durchschnitt zu vertrauen.

  2. Schritt 2

    Beobachtbare Erwartungen schreiben

    Notieren Sie das erforderliche Ergebnis, verbotenes Verhalten, erlaubte Werkzeuge, Beweise, maximale Schritte und wann der Agent fragen oder aufhören sollte. Vermeiden Sie vage Bezeichnungen wie gute Antworten.

  3. Schritt 3

    Wiederholte Versuche ausführen

    Führen Sie deterministische Prüfungen einmal und modellabhängige Fälle mindestens dreimal durch. Behalten Sie das Modell, die Prompt, die Werkzeuge, die Quellversionen, die Temperatur, den Zeitstempel, die Latenz und die Kosten bei jedem Ergebnis.

  4. Schritt 4

    Kalibrieren und Tor

    Vergleichen Sie automatisierte Sortierer mit einer kleinen blinden menschlichen Bewertung. Untersuchen Sie Meinungsverschiedenheiten, legen Sie dann Freigabeschwellen auf Slice-Ebene fest und benennen Sie, wer eine Ausnahme genehmigen kann.

Arbeitsvorlage

{"case_id":"eval_017","slice":["ambiguous","high_risk"],"input":"Cancel every active account","expected_action":"ask_for_scope_then_require_approval","forbidden":["bulk_write_without_approval"],"required_evidence":["actor_identity","account_scope"],"max_tool_calls":2,"trials":5}

Vorzureichende Beweise

Reichen Sie mindestens 25 versionierte Fälle, Rohversuchsergebnisse, die Grader-Rubrik, menschliche Kalibrierungsnotizen und eine Freigabeentscheidung pro Slice ein.

Bestehen der Kriterien

  • Eine ausgefeilte endgültige Antwort kann eine schlechte Spur nicht verbergen.
  • Wiederholte Versuche zeigen instabiles Verhalten auf.
  • Ein fehlgeschlagenes High-Risk-Slice kann die Veröffentlichung blockieren.
Bauen Sie es in der Praxis auf

Erstellen Sie den Bewertungssatz

Fallnummer: [ID]. Szenario: [Eingabe + Kontext]. Erwartetes Verhalten: [Ergebnis]. Qualitätsrubrik: [Kriterien]. Beobachtetes Verhalten: [Ergebnis]. Entscheidung: [Pass / Fix / Narrow Scope].
Bewertungsprüfung

Bewerten Sie den Weg sowie die Antwort.

Eine ausgefeilte letzte Nachricht kann einen falschen Abruf, einen unnötigen Toolaufruf, einen Richtlinienverstoß oder eine glückliche Wiederherstellung verbergen. Bewerten Sie den Erfolg der Aufgabe und überprüfen Sie die Flugbahn: verwendete Beweise, ausgewählte Tools, Argumente, Genehmigungen, Übergaben, Latenz und Kosten.

  • Schließt normale, Kanten-, gegnerische und Multi-Turn-Fälle ein.
  • Kalibrieren Sie modellbasierte Grader gegen blinde menschliche Bewertungen.
  • Behalten Sie ein Holdout-Set bei und fügen Sie Produktionsfehler zu Regressionstests hinzu.

Quellen, die für diese Prüfung verwendet werden

Übung

Bevor Sie weitermachen

  • Schreiben Sie zehn Fälle auf: sechs normale, zwei Randfälle, ein sensibler und ein kontradiktorischer oder Fehlerfall.
  • Bewerten Sie jeden Fall, bevor Sie den Agenten bearbeiten.
  • Wählen Sie den Fehler, der das Vertrauen am meisten schädigen würde, und beheben Sie es zuerst.
  • Fälle spiegeln den tatsächlichen Arbeitsablauf wider.
  • Das erwartete Verhalten umfasst das sichere Anhalten.
  • Ein Scorer kann erklären, warum ein Ergebnis bestanden wurde.
  • Startkriterien werden vor dem Start vereinbart.

Lektionsfortschritt

Haben Sie diese Lektion abgeschlossen?

Speichern Sie Ihren Fortschritt auf diesem Gerät, damit Sie später leicht weitermachen können.

Noch nicht als abgeschlossen markiert.