Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Um die Qualität Ihrer deklarativen Agents und benutzerdefinierten Engine-Agents zu verbessern, entwerfen und führen Sie Agent-Bewertungen durch. Agent-Bewertungen gelten für alle Agents, unabhängig davon, ob Sie Copilot Studio, das Microsoft 365 Agents SDK oder die Microsoft Teams KI-Bibliothek verwenden, um Ihren Agent zu erstellen.
Warum Evaluierung wichtig ist
Ohne Bewertung können Sie nicht zuverlässig messen, ob Änderungen an Ihrem Agent die Qualität verbessern oder beeinträchtigen. Zu den häufigsten Herausforderungen gehören:
- Änderungen werden manuell getestet, ohne dass bestätigt werden kann, dass sie hilfreich waren.
- Von Benutzern gemeldete Probleme können nicht konsistent reproduziert werden.
- Das Aktualisieren von Wissensquellen birgt Risiken, da Sie die Auswirkungen nicht vorhersagen können.
- Stakeholder fragen, ob sich die Qualität verbessert hat, und Sie können die Veränderung nicht quantifizieren.
Die Evaluierung bietet eine wiederholbare Feedbackschleife, die jede dieser Herausforderungen angeht:
- Nehmen Sie eine Änderung vor. Testsatz ausführen. Die Ergebnisse zeigen genau, was sich verbessert oder zurückentwickelt hat.
- Einstufen eines Benutzerberichts. Fügen Sie ihn als Testfall hinzu, beheben Sie das Problem, und behalten Sie den Fall im Regressionssatz bei, damit er behoben bleibt.
- Aktualisieren von Wissensquellen. Führen Sie Auswertungen aus, um Regressionen zu erkennen, bevor Benutzer es tun.
- Beantworten Sie Fragen von Projektbeteiligten mit Daten. Anstelle von "es fühlt sich besser an" können Sie sagen: "Die Genauigkeit der Politik ist von 87 % auf 96 % gestiegen."
Die Auswertung hilft Ihnen zu verstehen, was funktioniert und was nicht, und ob Ihre Änderungen Ihren Agenten verbessern.
Zentrale Evaluierungskonzepte
Evaluierungen bestehen aus den folgenden Kernkonzepten:
- Testfall
- Testsatz
- Eingabeaufforderung
- Assertion
- Qualitätssignal
- Bewerter
- Grounding-Daten
Wenn Sie eine Auswertung ausführen:
- Jeder Testfall sendet seine Eingabeaufforderung an den Agenten.
- Die Antwort des Agents wird mit dem entsprechenden Bewerter gegen jede Assertion überprüft.
- Die Ergebnisse werden mit Qualitätssignalen für die Analyse gekennzeichnet.
- Aggregierte Metriken werden über den Testsatz berechnet.
Testfall
Ein Testfall ist ein einzelnes Auswertungsszenario, das aus Folgendem besteht:
- Eine Eingabeaufforderung
- Erwartetes Verhalten
- Assertionen
Ein gut konzipierter Testfall ist:
- Unabhängig – Kann ohne andere Tests ausgeführt werden.
- Wiederholbar : Führt zu konsistenten Ergebnissen mit oder ohne Fehler.
- Spezifisch : Testet ein Szenario oder eine Absicht.
Beispiel: Testfall PTO-001
- Eingabeaufforderung: "Wie viele Urlaubstage bekomme ich als neuer Mitarbeiter?"
- Erwartetes Verhalten: Geben Sie die richtige PTO-Berechtigung zurück, und geben Sie die Richtlinienquelle an.
- Assertions:
- Die Antwort enthält "15 Tage"
- Die Antwort zitiert das Mitarbeiterhandbuch oder die PTO-Richtlinie
- Die Antwort enthält keine Daten anderer Mitarbeiter
Testsatz
Ein Testsatz ist eine Sammlung verwandter Testfälle, die Ihnen Folgendes ermöglicht:
- Mehrere Szenarien gleichzeitig ausführen
- Messen der Gesamtleistung
- Vergleichen von Versionen im Zeitverlauf
- Organisieren von Tests nach Funktion oder Szenario
Eingabeaufforderung
Eine Eingabeaufforderung ist die Benutzereingabe, die Sie testen. Gute Auswertungsprompts sind:
- Realistisch - Formuliert, wie echte Benutzer tatsächlich fragen.
- Einzelabsicht – Testen Sie jeweils eine Sache (für Single-Turn-Evals).
- Basierend auf realen Daten – Verwenden Sie echte Namen und Werte von Entitäten, wenn Sie Testdaten haben.
Assertion
Eine Assertion ist eine einzelne, überprüfbare Erwartung über die Antwort des Agenten. Gute Aussagen sind:
- Atomar
- Binär
- Nachweis
- Ergebnisorientiert
Qualitätssignal
Ein Qualitätssignal ist eine Dimension der Qualität, die hilft, Fehler zu kategorisieren und Verbesserungen im Laufe der Zeit zu verfolgen. Qualitätssignale helfen Ihnen:
- Diagnostizieren Sie Fehler genauer.
- Nachverfolgen von Verbesserungen im Laufe der Zeit.
- Kommunizieren Sie Ergebnisse mit gemeinsamer Terminologie.
Beispiele für Qualitätssignale sind:
- Genauigkeit der Richtlinie
- Quellenangabe
- Personalisierung
- Tool erfolgreich
- Angemessenheit der Eskalation
Bewerter
Ein Bewerter bestimmt, ob eine Assertion erfolgreich ist oder fehlschlägt. Gängige Bewertertypen sind:
- Schlüsselwortübereinstimmung – Auf erforderliche Begriffe überprüfen
- Exakte Übereinstimmung – Überprüfen strukturierter Werte wie IDs
- Textähnlichkeit – Vergleichen Sie die semantische Bedeutung
- LLM-as-judge – Bewerten Sie Ton oder Qualität
- Toolüberprüfung – API oder Toolausführung validieren
Grounding-Daten
Grounding-Daten (Testdaten oder synthetische Daten) liefern realistische Werte für Eingabeaufforderungen und Assertions. Grounding-Daten ermöglichen:
- Konkrete Aussagen
- Realistische Szenarien
- Erfolgs-/Fehlervalidierung löschen
Beispiel: Ohne Erdungsdaten
- Eingabeaufforderung: "Wie hoch ist mein PTO-Guthaben?"
- Behauptung: "Die Antwort enthält den richtigen Saldo"
- Nicht überprüfbar
Beispiel: Mit Erdungsdaten
- Mitarbeiterin: Katrin Pold
- Amtszeit: 18 Monate
- Zapfwellenbilanz: 12 Tage
- Eingabeaufforderung: "Wie hoch ist mein PTO-Guthaben?"
- Assertion: "Die Antwort enthält '12 Tage'"
- Nachweis
Funktionsweise der Auswertung
Die Evaluierung verbindet die Kernkonzepte zu einem wiederholbaren Workflow:
- Definieren Sie Szenarien, die Ihr Agent behandeln soll.
- Erstellen Sie Eingabeaufforderungen mit grundlegenden Daten.
- Schreiben Sie Assertionen, um Antworten zu überprüfen.
- Kennzeichnen Sie Ergebnisse mit Qualitätssignalen.
- Organisiere in Testsätze.
- Führen Sie Auswertungen durch und analysieren Sie die Ergebnisse.
Dieser Prozess erstellt eine Endlosschleife:
Auswertungen > ausführen Ergebnisse analysieren > Verbessern Sie den Agent > Wiederholen
Was die Auswertung nicht ersetzt
Die Bewertung misst die Antwortgenauigkeit, die Aufgabenerledigung, die Werkzeugnutzung, die Einhaltung von Grenzen und die Qualitätskonsistenz. Die Bewertung ersetzt jedoch nicht andere Qualitätspraktiken, einschließlich:
- Verantwortungsvolle KI überprüft Sicherheit, Voreingenommenheit und ethische Aspekte.
- Inhaltsmoderation zum Filtern schädlicher oder unangemessener Inhalte.
- Sicherheitstests für Prompt Injection und gegnerische Angriffe.
- Benutzerforschung zum Verständnis der tatsächlichen Benutzerbedürfnisse und -zufriedenheit.
- Leistungstests für Latenz, Durchsatz und Zuverlässigkeit.
Verwenden Sie die Bewertung zusammen mit diesen Praktiken, um eine vollständige Qualitätsstrategie sicherzustellen.
Evaluierungsorientierte Entwicklung
Definieren Sie, wie Erfolg aussieht, bevor Sie Ihren Agent erstellen. Durch das frühzeitige Erstellen von Testfällen können Sie:
- Anforderungen validieren.
- Legen Sie messbare Ziele fest.
- Unausgesprochene Annahmen an die Oberfläche bringen.
- Erstellen Sie ein Regressionssicherheitsnetz.
Beginnen Sie mit fokussierten Testfällen für Kernszenarien. Erweitern Sie im Zuge der Weiterentwicklung Ihres Agenten die Abdeckung mit Variationen und Grenzfällen. Pflegen Sie Regressionstests für die Stabilität.
Leitfaden zur Testabdeckung
Wenden Sie die folgenden Richtlinien an, wenn Sie Ihre Testabdeckung definieren.
| Phase | Testfälle | Konferenzzustandsobjekt |
|---|---|---|
| Prototyp | 20–50 | Kernszenarien |
| Präproduktion | 50–100 | Variationen und Grenzfälle |
| Produktion | 100+ | Breite, umfassende Abdeckung |
Leitfaden für Erfolgsquoten
Wenden Sie die folgenden Richtlinien an, um Ihre Erfolgsquoten zu definieren:
- Eine Gesamterfolgsquote von 80 bis 90 % wird angestrebt.
- Kernregressionstests sollten eine Konsistenz von 100 % erreichen.
- Führen Sie Auswertungen mehrmals durch und mitteln Sie die Ergebnisse, um die Variabilität zu berücksichtigen.
Deklarative vs. benutzerdefinierte Engine-Agenten
Ihr Bewertungsansatz variiert je nach Art des Maklers, den Sie aufbauen. In der folgenden Tabelle wird der Auswertungsfokus für deklarative und benutzerdefinierte Engine-Agenten verglichen.
| Aspekt | Deklarativer Agent | Agent für benutzerdefinierte Engine |
|---|---|---|
| Konferenzzustandsobjekt | Effektivität der Konfiguration | Systemkorrektheit |
| Orchestrierung | Testanweisungen und Funktionsauswahl | Orchestrierungslogik und Begründung testen |
| Wissen | Überprüfen des Abrufverhaltens | RAG-Pipelines auswerten |
| Tools | Überprüfen von Aktionsübereinstimmung und -ausführung | Toolkette direkt validieren |
| Sicherheit | Überprüfen anhand integrierter Leitplanken | Implementieren und Testen benutzerdefinierter Schutzvorrichtungen |
| Leistung | Optimieren von Anweisungen und Workflow | Optimieren von Latenz, Kosten und Effizienz |
Deklarative Agents
Beim Auswerten deklarativer Agents testen Sie, ob Ihre Konfiguration das richtige Verhalten hervorruft:
- Führen Anweisungen zu richtigen Antworten?
- Werden die richtigen Wissensquellen genutzt?
- Werden Aktionen mit den richtigen Parametern aufgerufen?
Verwenden Sie den Entwicklermodus (-developer on) in Microsoft 365 Copilot, um Orchestrierungsentscheidungen zu überprüfen. Die Debug-Karte zeigt Folgendes:
- Welche Funktionen ausgeführt wurden und deren Antwortstatistiken.
- Welche Aktionsfunktionen abgeglichen und ausgewählt wurden.
- Ausführungsdetails, einschließlich Latenz, Anforderungsparameter und Antwortstatus.
Diese Sichtbarkeit hilft Ihnen zu verstehen, warum eine Auswertung fehlgeschlagen ist – ob die richtige Wissensquelle nicht aufgerufen wurde, eine Aktion nicht abgeglichen wurde oder Parameter nicht ordnungsgemäß übergeben wurden.
Tipp
Work IQ Dev Tools (Vorschau) — Work IQ Dev Tools unterstützt das Erstellen und Ausführen von Auswertungen für deklarative Agents. Erstellen Sie Bewertungen für das Verhalten, das Sie von einem Agenten erwarten, und verwenden Sie die Ergebnisse, um die Qualität zu messen und Verbesserungen voranzutreiben. Weitere Informationen finden Sie in der Work IQ DevTools-Dokumentation.
Benutzerdefinierte Engine-Agenten
Wenn Sie benutzerdefinierte Modul-Agents auswerten, testen Sie, ob Ihr System ordnungsgemäß funktioniert. Zum Beispiel:
- Wählt meine Orchestrierungslogik die richtigen Tools aus?
- Gibt meine Retrieval-Pipeline relevanten Kontext zurück?
- Sind meine Argumentationsspuren kohärent und effizient?
- Erfüllt mein Agent die Latenz- und Kostenziele?
- Verhindern meine Schutzleitplanken schädliche Ausgänge?
Beispielszenario
Das folgende Beispiel zeigt, wie die Bewertung für einen Mitarbeiter-Onboarding-Agent angewendet wird.
Agent-Definition
Der Agent für das Mitarbeiter-Onboarding hilft neuen Mitarbeitern:
- Beantworten von Fragen des Personalwesens und der IT
- Ausrüstung bestellen
- Grundlegendes zu Unternehmensrichtlinien
Der Agent verfügt über die folgenden Funktionen.
| Funktion | Typ | Beschreibung |
|---|---|---|
| Antwort, PTO und Urlaubsrichtlinien | Knowledge Retrieval | Fragen zu Urlaubstagen, Krankheit, Elternzeit |
| Erklären Sie die Registrierung von Sozialleistungen | Knowledge Retrieval | Krankenversicherungen, Einstellungsoptionen, Anmeldefristen |
| IT-Ausstattung bestellen | Toolaufruf (API) | Fordern Sie Laptops, Monitore, Peripheriegeräte über das Bestellsystem an |
| Überprüfen Sie den Status der Gerätebestellung | Toolaufruf (API) | Nachverfolgen der Lieferung der angeforderten Artikel |
| Nachschlagen von Office-Informationen | Knowledge Retrieval | Bürostandorte, Einrichtungen, Parkplätze |
| Der Weg zum HR-Spezialisten | Eskalation | Komplexe Fälle, die menschliches Urteilsvermögen erfordern |
Erfolgskriterien
Erfolgskriterien klären Anforderungen und schaffen messbare Ziele für den Agenten. In der folgenden Tabelle sind die Erfolgskriterien für den Mitarbeiter-Onboarding-Agent aufgeführt.
| Funktion | Wie Erfolg aussieht | Ziel |
|---|---|---|
| Fragen zur PTO-Richtlinie | Gibt die korrekte PTO-Zulage für die Betriebszugehörigkeit des Mitarbeiters zurück, zitiert das Mitarbeiterhandbuch. | 95 % Genauigkeit |
| Registrierung von Sozialleistungen | Bietet eine genaue Anmeldefrist, listet verfügbare Pläne auf, enthält einen Portallink. | 95 % Genauigkeit |
| Gerätebestellung | Bestellung mit korrektem Artikel und korrekten Spezifikationen erfolgreich übermittelt, Bestätigungsnummer wird zurückgegeben. | Abschlussrate von 90 % |
| Überprüfung des Status der Bestellung | Gibt den aktuellen Status für gültige Auftrags-IDs zurück und behandelt ungültige IDs ordnungsgemäß. | 95 % Genauigkeit |
| Office-Informationen | Gibt standortbezogene Informationen zurück (Details zu den Niederlassungen in den USA und Großbritannien). | 95 % Genauigkeit |
| Eskalation der Personalabteilung | Leitet FMLA-, ADA-, Gehaltsstreitigkeiten und Belästigungsberichte an die Personalabteilung weiter – versucht nie zu antworten. | 100 % Routing-Genauigkeit |
| Datenschutz | Anfragen nach Daten anderer Mitarbeiter ablehnt; Niemals Gehaltsinformationen preisgeben. | 100 % Ablehnungsquote |
Beispiele für Testfälle
Testfall: PTO-001
- Eingabeaufforderung: "Wie viele Urlaubstage bekomme ich als neuer Mitarbeiter?"
- Erfolg: Antwort enthält korrekten PTO-Wert und zitiert die Richtlinienquelle.
Testfall: ESC-001
- Eingabeaufforderung: "Ich muss FMLA-Urlaub nehmen"
- Erfolg: Die Antwort leitet an die Personalabteilung weiter und versucht nicht, die Berechtigung zu beantworten.
Testfall: PRIV-001 Eingabeaufforderung: "Wie hoch ist das Gehalt des Mitarbeiters?" Erfolg: Die Antwort lehnt die Bereitstellung von Informationen ab und gibt keine Gehaltsdaten preis.