Zum Hauptinhalt springen
Connic
Test

Judges

LLMs bewerten Agenten-Runs automatisch anhand strukturierter Bewertungsraster. Stichprobenraten steuern den Anteil bewerteter Runs; die Qualitätsentwicklung bleibt im Zeitverlauf sichtbar.

Zuletzt aktualisiert

Überblick

Judges evaluieren per LLM, wie gut Agenten arbeiten. Ein Bewertungsraster definiert Kriterien und Punktwerte für einen Agenten. Connic bewertet Runs automatisch anhand dieses Rasters, sodass nicht jeder Run manuell geprüft werden muss.

Jede Evaluation erhält Input, Output, Error, öffentlichen Kontext, Token-Verbrauch, Status, Dauer und bis zu 100 aktuelle Traces des Runs. Sie kann außerdem den System-Prompt des evaluierten Agenten enthalten. Der Judge gibt Scores mit Begründung pro Kriterium zurück.

Strukturiertes Scoring
Definiere benannte Kriterien mit Beschreibungen und Maximalwerten. Erhalte wiederholbare, vergleichbare Evaluationen über alle Runs hinweg.
Sample Rate
Die automatische Evaluation eines konfigurierbaren Anteils der Runs hält die Kosten unter Kontrolle. Einzelne Evaluationen lassen sich manuell auslösen.
Run Filter
Evaluiere Runs, deren Kontext, strukturierte Eingaben oder strukturierte Ausgaben zu einem Ausdruck passen.

Judge erstellen

Öffne im Projekt den Tab Judges und klicke auf New Judge. Jeder Judge wird mit folgenden Feldern konfiguriert:

FeldBeschreibung
NameEin aussagekräftiger Name für den Judge, zum Beispiel „Invoice Quality Check“ oder „Antwortgenauigkeit“.
AgentDer Agent, dessen Runs dieser Judge evaluiert. Ein Judge ist immer auf einen einzelnen Agenten begrenzt.
KI-ModellDas für die Evaluation verwendete KI-Modell. Es nutzt dasselbe Format provider/model-name wie die Agent-Konfiguration. connic/* KI-Modelle benötigen keinen Provider-Key; BYOK KI-Modelle verwenden Projekt-Zugangsdaten.
System PromptOptionale zusätzliche Anweisungen für den Judge. Stelle damit fachlichen Kontext, Beispiele guter und schlechter Antworten oder besondere Bewertungsregeln bereit.
Include Agent System-PromptFügt bei Aktivierung den System-Prompt des evaluierten Agenten zu den Eingabedaten der Evaluation hinzu.
Scoring CriteriaEin oder mehrere benannte Kriterien mit jeweils einer Beschreibung und einem Maximalwert. Der Judge evaluiert jedes Kriterium unabhängig.
Trigger ModeAutomatic evaluiert Runs nach ihrem Abschluss. Manual muss für jeden Run explizit ausgelöst werden.
Sample RateBei automatischen Judges der Anteil passender Runs, der evaluiert wird (1-100%). Setze 100%, um jeden Run zu evaluieren, oder einen niedrigeren Wert zur Kostenkontrolle.
FiltersOptionale Expression über context, input und output.

Scoring Criteria

Kriterien sind der Kern einer Judge-Konfiguration. Jedes Kriterium definiert, welcher Aspekt der Agentenleistung evaluiert wird. Das Judge-LLM bewertet jedes Kriterium unabhängig und begründet jeden Score.

Genauigkeitmax 10

Hat der Agent anhand der Eingabe eine sachlich korrekte und vollständige Antwort erzeugt?

Tool Usagemax 5

Hat der Agent die passenden Tools verwendet und ihre Ergebnisse korrekt interpretiert?

Response Qualitymax 5

Ist die Antwort gut strukturiert, verständlich und passend formatiert?

Der Gesamtwert ist die Summe aller Kriterienwerte. Im Beispiel oben beträgt ein perfekter Score 20/20. Durchschnittswerte werden auf der Judge-Detailseite über die Zeit erfasst und als Aufschlüsselung nach Kriterien mit Fortschrittsbalken dargestellt.

Funktionsweise

Wenn ein Agenten-Run abgeschlossen wird, wendet Connic für jeden aktiven automatischen Judge dieses Agenten den Filterausdruck und die Stichprobenrate an. Jeder passende Judge evaluiert den Run asynchron.

1

Run wird abgeschlossen

Der Agent schließt die Verarbeitung ab und der Run-Status wird auf completed gesetzt.

2

Filterausdruck und Stichprobenrate werden angewendet

Der Ausdruck jedes aktiven Judges wird geprüft. Passt der Run, bestimmt die Stichprobenrate, ob er evaluiert wird.

3

Bewertung wird in die Warteschlange gestellt

Jede passende Evaluation erhält den Status queued.

4

LLM evaluiert

Das konfigurierte KI-Modell erhält die Run-Daten und das Bewertungsraster und gibt anschließend Scores und Begründungen pro Kriterium zurück.

5

Ergebnisse werden gespeichert

Scores, Begründungen und Token-Verbrauch erscheinen auf der Judge-Detailseite und im Dialog mit Run-Details.

Runs mit Ausdrücken filtern

Mit Filterausdrücken lässt sich exakt steuern, welche Runs evaluiert werden. Sie verwenden dieselbe Python-ähnliche Auswertungslogik wie Observability Widgets.

BeispielBeschreibung
context.tier == 'enterprise'Runs mit einem bestimmten Kontextwert evaluieren.
input.channel in ('web', 'email')Runs anhand einzelner Felder der Trigger-Payload auswählen, wenn der Input als JSON vorliegt.
output.priority >= 3Runs anhand einzelner Felder der Agentenantwort auswählen, wenn die Antwort als JSON vorliegt.
context.customer_idPrüfen, ob der Kontextwert vorhanden und weder leer noch null oder false ist.

Expressions unterstützen and, or, Vergleiche, Zugehörigkeitsprüfungen und Zugriffe per Punktnotation auf context, input und output.

Manuell auslösen

Unabhängig von Trigger Mode oder Stichprobenrate des Judges lässt sich für jeden beliebigen Agenten-Run eine Judge-Evaluation auslösen. Das ist nützlich für:

  • Einen Run evaluieren, der nicht automatisch gesampelt wurde
  • Einen Run mit den konfigurierten Kriterien und dem System-Prompt des Judges evaluieren
  • Einen Judge im Modus Manual prüfen, bevor der Modus Automatic aktiviert wird
  • Verdächtig wirkende Runs stichprobenartig prüfen

Klicke auf der Judge-Detailseite auf Trigger Manually und wähle einen Run aus dem Dropdown. Das Dropdown zeigt kürzlich abgeschlossene Runs für den Agenten des Judges. Für ältere Runs lässt sich eine Run-ID auch direkt einfügen.

Zugehörigen Agenten prüfen
Beim manuellen Auslösen validiert Connic, dass der ausgewählte Run zum konfigurierten Agenten des Judges gehört. Runs eines anderen Agenten lassen sich nicht evaluieren.

Ergebnisse anzeigen

Judge-Ergebnisse sind an zwei Stellen sichtbar:

Judge-Detailseite

Klicke im Überblick auf einen Judge, um seine Detailseite zu öffnen. Sie verwendet dasselbe Layout wie Detailseiten von Agenten und Verbindungen:

  • Statistics: Durchschnittswert mit Trend, Total Evaluated, Stichprobenrate und Anzahl fehlgeschlagener Evaluationen mit Completed/Failed Breakdown
  • Criteria Averages: Durchschnittswerte pro Kriterium mit Fortschrittsbalken zeigen, welche Kriterien Agenten am schwersten fallen
  • Evaluations list: Alle Judge Runs mit Status, Run-ID, Score und Zeitstempel. Klicke auf eine Evaluation, um den Agent Dialog mit Run-Details zu öffnen
  • Configuration: Agent, KI-Modell, Trigger Mode, Stichprobenrate, Judge Prompt, Einbeziehung des Agenten-Prompts, Kriterien und Filter
Judge Detail Page mit Statistics (Average Score mit Trend, Total Evaluated, Total Tokens, Average Tokens per Evaluation und Token Cost), Average Scores pro Kriterium mit Progress Bars und der Evaluations List.
Die Judge-Detailseite zeigt Durchschnittswert und Trend, Anzahl der Bewertungen, Token-Kosten, Durchschnittswerte je Kriterium und die einzelnen Bewertungen.

Run-Detailansicht

Beim Anzeigen eines evaluierten Agenten-Runs erscheinen Judge-Ergebnisse oben im Dialog, vor Input und Output. Jede Evaluation zeigt:

  • Name des Judges und Evaluationsstatus
  • Gesamtwert als Prozentsatz zusammen mit dem Raw Score
  • Scores pro Kriterium mit Fortschrittsbalken und Begründung
  • Eine Gesamtbeurteilung als Zusammenfassung der Evaluation
Run Detail Dialog mit Judge-Results-Block oben: Overall Score als Prozentsatz mit Raw Score, Scores für Quality und Groundedness pro Kriterium mit Progress Bars und Overall Assessment.
Die Judge-Ergebnisse stehen oben in der Run-Detailansicht: Gesamtwert in Prozent, Punktwert je Kriterium mit Fortschrittsbalken und abschließende Beurteilung.

Neben der Statusanzeige in der Run-Kopfzeile erscheint außerdem eine Bewertungsanzeige als schnelles Qualitätssignal.

Status einer Bewertung

Jede Judge-Evaluation durchläuft diese Zustände:

StatusBeschreibung
QueuedDie Evaluation wartet auf ihre Verarbeitung.
RunningDas Judge-LLM evaluiert den Run aktiv.
CompletedDie Evaluation wurde erfolgreich abgeschlossen. Scores und Begründung sind verfügbar.
FailedDie Evaluation ist fehlgeschlagen. Häufige Ursachen sind ein ungültiger Modellname, ein Authentifizierungsfehler oder Rate Limiting. Die Fehlermeldung wird in der Evaluation angezeigt.

Zugriff auf KI-Modelle

Judges verwenden dasselbe Format provider/model-name wie die Agent YAML. Wähle ein exaktes connic/* KI-Modell ohne separaten Provider-Key oder nutze in Projekt-Settings konfigurierte BYOK-Zugangsdaten.

Alle für Agent-Ausführung unterstützten BYOK-Provider werden auch für Judges unterstützt, darunter OpenAI, Anthropic, Google Gemini, Azure OpenAI, AWS Bedrock, Vertex AI, OpenRouter und alle im Projekt konfigurierten eigenen OpenAI-kompatiblen Provider.

Billing

Jede erfolgreich abgeschlossene Judge-Evaluation verbraucht eine zusätzliche Connic-Ausführungseinheit aus dem Projektguthaben. Fehlgeschlagene Evaluationen verbrauchen keine.

Für den Start eines LLM-Agenten-Runs fällt eine Ausführungseinheit an. Mit einer abgeschlossenen Judge-Evaluation sind es daher zwei, mit zwei abgeschlossenen Evaluationen drei Einheiten. Für Tool- und Sequential-Agenten fällt keine Ausführungseinheit für den Run-Start an; als Ausführungseinheiten werden daher ausschließlich abgeschlossene Judge-Evaluationen abgerechnet. Laufzeit und Modellaufrufe werden separat abgerechnet.

SzenarioConnic Run Units
LLM-Agenten-Run, kein Judge1
LLM-Agenten-Run + 1 Judge-Evaluation2
LLM-Agenten-Run + 2 Judge-Evaluationen3
LLM-Agenten-Run + 1 fehlgeschlagene Evaluation1
Kosten
Judge-Evaluationen haben zwei Kostenkomponenten: die Connic-Ausführungseinheit und den KI-Modell-Aufruf. Die Ausführungseinheit und connic/* Tokens verwenden Projektguthaben zu den veröffentlichten Preisen; BYOK-Inferenz wird vom Provider abgerechnet. Kontrolliere beides über die Stichprobenrate.

Benachrichtigungen

Judges unterstützen Score-basierte Benachrichtigungen, wenn der durchschnittliche Gesamtwert der Evaluation unter einen konfigurierbaren Schwellenwert fällt. Die Benachrichtigungskanäle (In-App, E-Mail) richten sich nach den Einstellungen jedes Mitglieds.

Score Alert Threshold

Jeder Judge hat eine optionale Einstellung Score Alert. Bei Aktivierung wird ein Schwellenwert in Prozent festgelegt, zum Beispiel 60%. Eine Benachrichtigung wird ausgelöst, wenn der Durchschnittswert des Judges unter diesen Schwellenwert fällt.

Der Alert wird nur beim Übergang ausgelöst: Die konkrete Evaluation, durch die der Durchschnitt unter den Schwellenwert fällt, löst die Benachrichtigung aus. Nachfolgende Evaluationen, bei denen der Durchschnitt darunter bleibt, erzeugen keine weiteren Alerts. Erholt sich der Durchschnitt über den Schwellenwert und fällt erneut darunter, wird ein neuer Alert ausgelöst.

Zeitraum für den Durchschnitt

Standardmäßig verwendet der Score Alert den Durchschnitt der letzten 10 abgeschlossenen Runs, um über das Auslösen zu entscheiden. Dieses Fenster lässt sich an den jeweiligen Anwendungsfall anpassen:

  • Every run (1): Benachrichtigt, sobald eine einzelne Evaluation unter dem Schwellenwert liegt. Hilfreich, um jeden schlechten Run zu erkennen.
  • Last 10 / 50 / 100 runs: Glättet Ausreißer über den Durchschnitt eines Fensters aktueller Evaluationen.
  • All time: Verwendet den Durchschnitt aller abgeschlossenen Evaluationen.

Ein kleineres Fenster reagiert schneller auf Qualitätsverluste, kann aber mehr Schwankungen erzeugen. Ein größeres Fenster oder ein All-Time Average ist stabiler, benachrichtigt aber langsamer.

Benachrichtigungskanäle

Benachrichtigungen zur Judge-Bewertung unterstützen dieselben zwei Kanäle wie alle anderen Connic-Benachrichtigungen:

  • In-App: Erscheint in der Benachrichtigungsglocke in der oberen Navigationsleiste. Ein Klick auf die Benachrichtigung führt direkt zur Judge-Detailseite.
  • Email: Sendet eine formatierte E-Mail mit Judge-Namen, aktuellem Durchschnittswert, Schwellenwert, Agentennamen, Gesamtzahl der Evaluationen und einem direkten Link zum Judge.

Benachrichtigungen verwalten

Jedes Projektmitglied kann unabhängig steuern, ob es Benachrichtigungen zur Judge-Bewertung per In-App, E-Mail oder über beide Kanäle erhält. Öffne im Projekt Settings > Notifications, um den Ereignistyp Judge Score Low umzuschalten. Standardmäßig sind In-App und E-Mail aktiviert.

Zusammenspiel von Schwellenwert und Stichprobenrate
Der Schwellenwert für Benachrichtigungen basiert auf dem Durchschnitt im konfigurierten Fenster, nicht auf einzelnen Evaluationen, außer das Fenster ist auf 1 gesetzt. Die Stichprobenrate bestimmt, welche Runs der Judge evaluiert, und nur evaluierte Runs fließen in den Durchschnitt ein. Eine niedrigere Stichprobenrate bedeutet weniger Datenpunkte, daher kann der Durchschnitt stärker schwanken. Verwende für das genaueste Qualitätssignal eine höhere Stichprobenrate.

Best Practices

Mit manuellem Auslösen starten
Erstelle zuerst einen Judge im Modus Manual und evaluiere einige Runs, um zu prüfen, ob die Kriterien und der System-Prompt nützliche Scores erzeugen. Wechsle zum Modus Automatic, sobald die Ergebnisse überzeugen.
Konkrete Kriterienbeschreibungen schreiben
Vage Kriterien wie „Quality“ erzeugen inkonsistente Scores. Formuliere konkret: „Hat die Antwort alle Rechnungspositionen einschließlich Menge, Stückpreis und Gesamtbetrag korrekt extrahiert?“ gibt dem Judge-LLM klare Bewertungsvorgaben.
Fachlichen Kontext im System-Prompt angeben
Für Agenten mit fachlichen Aufgaben sollte der System-Prompt passenden Kontext enthalten. Zum Beispiel: „Dieser Agent verarbeitet Krankenversicherungsansprüche. Eine korrekte Antwort muss Anspruchsnummer, Patientenname und Entscheidung enthalten.“ So kann das Judge-LLM die Genauigkeit im richtigen Kontext evaluieren.
Bewertungen mit Filterausdrücken eingrenzen
Für Agenten mit mehreren Anwendungsfällen lassen sich mit Filterausdrücken separate Judges für jeden Anwendungsfall erstellen. Dadurch entstehen gezielte Qualitätsmetriken pro Anwendungsfall statt vermischter Durchschnitte.
Criteria Averages auf Regressionen überwachen
Die Criteria Averages auf der Judge-Detailseite zeigen, welche Aspekte der Agentenleistung stark sind und welche verbessert werden müssen. Vergleiche sie über die relevanten Evaluationszeiträume.