Judges
LLMs bewerten Agenten-Runs automatisch anhand strukturierter Bewertungsraster. Stichprobenraten steuern den Anteil bewerteter Runs; die Qualitätsentwicklung bleibt im Zeitverlauf sichtbar.
Auf dieser Seite
Überblick
Judges evaluieren per LLM, wie gut Agenten arbeiten. Ein Bewertungsraster definiert Kriterien und Punktwerte für einen Agenten. Connic bewertet Runs automatisch anhand dieses Rasters, sodass nicht jeder Run manuell geprüft werden muss.
Jede Evaluation erhält Input, Output, Error, öffentlichen Kontext, Token-Verbrauch, Status, Dauer und bis zu 100 aktuelle Traces des Runs. Sie kann außerdem den System-Prompt des evaluierten Agenten enthalten. Der Judge gibt Scores mit Begründung pro Kriterium zurück.
Judge erstellen
Öffne im Projekt den Tab Judges und klicke auf New Judge. Jeder Judge wird mit folgenden Feldern konfiguriert:
| Feld | Beschreibung |
|---|---|
| Name | Ein aussagekräftiger Name für den Judge, zum Beispiel „Invoice Quality Check“ oder „Antwortgenauigkeit“. |
| Agent | Der Agent, dessen Runs dieser Judge evaluiert. Ein Judge ist immer auf einen einzelnen Agenten begrenzt. |
| KI-Modell | Das für die Evaluation verwendete KI-Modell. Es nutzt dasselbe Format provider/model-name wie die Agent-Konfiguration. connic/* KI-Modelle benötigen keinen Provider-Key; BYOK KI-Modelle verwenden Projekt-Zugangsdaten. |
| System Prompt | Optionale zusätzliche Anweisungen für den Judge. Stelle damit fachlichen Kontext, Beispiele guter und schlechter Antworten oder besondere Bewertungsregeln bereit. |
| Include Agent System-Prompt | Fügt bei Aktivierung den System-Prompt des evaluierten Agenten zu den Eingabedaten der Evaluation hinzu. |
| Scoring Criteria | Ein oder mehrere benannte Kriterien mit jeweils einer Beschreibung und einem Maximalwert. Der Judge evaluiert jedes Kriterium unabhängig. |
| Trigger Mode | Automatic evaluiert Runs nach ihrem Abschluss. Manual muss für jeden Run explizit ausgelöst werden. |
| Sample Rate | Bei automatischen Judges der Anteil passender Runs, der evaluiert wird (1-100%). Setze 100%, um jeden Run zu evaluieren, oder einen niedrigeren Wert zur Kostenkontrolle. |
| Filters | Optionale Expression über context, input und output. |
Scoring Criteria
Kriterien sind der Kern einer Judge-Konfiguration. Jedes Kriterium definiert, welcher Aspekt der Agentenleistung evaluiert wird. Das Judge-LLM bewertet jedes Kriterium unabhängig und begründet jeden Score.
Hat der Agent anhand der Eingabe eine sachlich korrekte und vollständige Antwort erzeugt?
Hat der Agent die passenden Tools verwendet und ihre Ergebnisse korrekt interpretiert?
Ist die Antwort gut strukturiert, verständlich und passend formatiert?
Der Gesamtwert ist die Summe aller Kriterienwerte. Im Beispiel oben beträgt ein perfekter Score 20/20. Durchschnittswerte werden auf der Judge-Detailseite über die Zeit erfasst und als Aufschlüsselung nach Kriterien mit Fortschrittsbalken dargestellt.
Funktionsweise
Wenn ein Agenten-Run abgeschlossen wird, wendet Connic für jeden aktiven automatischen Judge dieses Agenten den Filterausdruck und die Stichprobenrate an. Jeder passende Judge evaluiert den Run asynchron.
Run wird abgeschlossen
Der Agent schließt die Verarbeitung ab und der Run-Status wird auf completed gesetzt.
Filterausdruck und Stichprobenrate werden angewendet
Der Ausdruck jedes aktiven Judges wird geprüft. Passt der Run, bestimmt die Stichprobenrate, ob er evaluiert wird.
Bewertung wird in die Warteschlange gestellt
Jede passende Evaluation erhält den Status queued.
LLM evaluiert
Das konfigurierte KI-Modell erhält die Run-Daten und das Bewertungsraster und gibt anschließend Scores und Begründungen pro Kriterium zurück.
Ergebnisse werden gespeichert
Scores, Begründungen und Token-Verbrauch erscheinen auf der Judge-Detailseite und im Dialog mit Run-Details.
Runs mit Ausdrücken filtern
Mit Filterausdrücken lässt sich exakt steuern, welche Runs evaluiert werden. Sie verwenden dieselbe Python-ähnliche Auswertungslogik wie Observability Widgets.
| Beispiel | Beschreibung |
|---|---|
| context.tier == 'enterprise' | Runs mit einem bestimmten Kontextwert evaluieren. |
| input.channel in ('web', 'email') | Runs anhand einzelner Felder der Trigger-Payload auswählen, wenn der Input als JSON vorliegt. |
| output.priority >= 3 | Runs anhand einzelner Felder der Agentenantwort auswählen, wenn die Antwort als JSON vorliegt. |
| context.customer_id | Prüfen, ob der Kontextwert vorhanden und weder leer noch null oder false ist. |
Expressions unterstützen and, or, Vergleiche, Zugehörigkeitsprüfungen und Zugriffe per Punktnotation auf context, input und output.
Manuell auslösen
Unabhängig von Trigger Mode oder Stichprobenrate des Judges lässt sich für jeden beliebigen Agenten-Run eine Judge-Evaluation auslösen. Das ist nützlich für:
- Einen Run evaluieren, der nicht automatisch gesampelt wurde
- Einen Run mit den konfigurierten Kriterien und dem System-Prompt des Judges evaluieren
- Einen Judge im Modus Manual prüfen, bevor der Modus Automatic aktiviert wird
- Verdächtig wirkende Runs stichprobenartig prüfen
Klicke auf der Judge-Detailseite auf Trigger Manually und wähle einen Run aus dem Dropdown. Das Dropdown zeigt kürzlich abgeschlossene Runs für den Agenten des Judges. Für ältere Runs lässt sich eine Run-ID auch direkt einfügen.
Ergebnisse anzeigen
Judge-Ergebnisse sind an zwei Stellen sichtbar:
Judge-Detailseite
Klicke im Überblick auf einen Judge, um seine Detailseite zu öffnen. Sie verwendet dasselbe Layout wie Detailseiten von Agenten und Verbindungen:
- Statistics: Durchschnittswert mit Trend, Total Evaluated, Stichprobenrate und Anzahl fehlgeschlagener Evaluationen mit Completed/Failed Breakdown
- Criteria Averages: Durchschnittswerte pro Kriterium mit Fortschrittsbalken zeigen, welche Kriterien Agenten am schwersten fallen
- Evaluations list: Alle Judge Runs mit Status, Run-ID, Score und Zeitstempel. Klicke auf eine Evaluation, um den Agent Dialog mit Run-Details zu öffnen
- Configuration: Agent, KI-Modell, Trigger Mode, Stichprobenrate, Judge Prompt, Einbeziehung des Agenten-Prompts, Kriterien und Filter

Run-Detailansicht
Beim Anzeigen eines evaluierten Agenten-Runs erscheinen Judge-Ergebnisse oben im Dialog, vor Input und Output. Jede Evaluation zeigt:
- Name des Judges und Evaluationsstatus
- Gesamtwert als Prozentsatz zusammen mit dem Raw Score
- Scores pro Kriterium mit Fortschrittsbalken und Begründung
- Eine Gesamtbeurteilung als Zusammenfassung der Evaluation

Neben der Statusanzeige in der Run-Kopfzeile erscheint außerdem eine Bewertungsanzeige als schnelles Qualitätssignal.
Status einer Bewertung
Jede Judge-Evaluation durchläuft diese Zustände:
| Status | Beschreibung |
|---|---|
| Queued | Die Evaluation wartet auf ihre Verarbeitung. |
| Running | Das Judge-LLM evaluiert den Run aktiv. |
| Completed | Die Evaluation wurde erfolgreich abgeschlossen. Scores und Begründung sind verfügbar. |
| Failed | Die Evaluation ist fehlgeschlagen. Häufige Ursachen sind ein ungültiger Modellname, ein Authentifizierungsfehler oder Rate Limiting. Die Fehlermeldung wird in der Evaluation angezeigt. |
Zugriff auf KI-Modelle
Judges verwenden dasselbe Format provider/model-name wie die Agent YAML. Wähle ein exaktes connic/* KI-Modell ohne separaten Provider-Key oder nutze in Projekt-Settings konfigurierte BYOK-Zugangsdaten.
Alle für Agent-Ausführung unterstützten BYOK-Provider werden auch für Judges unterstützt, darunter OpenAI, Anthropic, Google Gemini, Azure OpenAI, AWS Bedrock, Vertex AI, OpenRouter und alle im Projekt konfigurierten eigenen OpenAI-kompatiblen Provider.
Billing
Jede erfolgreich abgeschlossene Judge-Evaluation verbraucht eine zusätzliche Connic-Ausführungseinheit aus dem Projektguthaben. Fehlgeschlagene Evaluationen verbrauchen keine.
Für den Start eines LLM-Agenten-Runs fällt eine Ausführungseinheit an. Mit einer abgeschlossenen Judge-Evaluation sind es daher zwei, mit zwei abgeschlossenen Evaluationen drei Einheiten. Für Tool- und Sequential-Agenten fällt keine Ausführungseinheit für den Run-Start an; als Ausführungseinheiten werden daher ausschließlich abgeschlossene Judge-Evaluationen abgerechnet. Laufzeit und Modellaufrufe werden separat abgerechnet.
| Szenario | Connic Run Units |
|---|---|
| LLM-Agenten-Run, kein Judge | 1 |
| LLM-Agenten-Run + 1 Judge-Evaluation | 2 |
| LLM-Agenten-Run + 2 Judge-Evaluationen | 3 |
| LLM-Agenten-Run + 1 fehlgeschlagene Evaluation | 1 |
Benachrichtigungen
Judges unterstützen Score-basierte Benachrichtigungen, wenn der durchschnittliche Gesamtwert der Evaluation unter einen konfigurierbaren Schwellenwert fällt. Die Benachrichtigungskanäle (In-App, E-Mail) richten sich nach den Einstellungen jedes Mitglieds.
Score Alert Threshold
Jeder Judge hat eine optionale Einstellung Score Alert. Bei Aktivierung wird ein Schwellenwert in Prozent festgelegt, zum Beispiel 60%. Eine Benachrichtigung wird ausgelöst, wenn der Durchschnittswert des Judges unter diesen Schwellenwert fällt.
Der Alert wird nur beim Übergang ausgelöst: Die konkrete Evaluation, durch die der Durchschnitt unter den Schwellenwert fällt, löst die Benachrichtigung aus. Nachfolgende Evaluationen, bei denen der Durchschnitt darunter bleibt, erzeugen keine weiteren Alerts. Erholt sich der Durchschnitt über den Schwellenwert und fällt erneut darunter, wird ein neuer Alert ausgelöst.
Zeitraum für den Durchschnitt
Standardmäßig verwendet der Score Alert den Durchschnitt der letzten 10 abgeschlossenen Runs, um über das Auslösen zu entscheiden. Dieses Fenster lässt sich an den jeweiligen Anwendungsfall anpassen:
- Every run (1): Benachrichtigt, sobald eine einzelne Evaluation unter dem Schwellenwert liegt. Hilfreich, um jeden schlechten Run zu erkennen.
- Last 10 / 50 / 100 runs: Glättet Ausreißer über den Durchschnitt eines Fensters aktueller Evaluationen.
- All time: Verwendet den Durchschnitt aller abgeschlossenen Evaluationen.
Ein kleineres Fenster reagiert schneller auf Qualitätsverluste, kann aber mehr Schwankungen erzeugen. Ein größeres Fenster oder ein All-Time Average ist stabiler, benachrichtigt aber langsamer.
Benachrichtigungskanäle
Benachrichtigungen zur Judge-Bewertung unterstützen dieselben zwei Kanäle wie alle anderen Connic-Benachrichtigungen:
- In-App: Erscheint in der Benachrichtigungsglocke in der oberen Navigationsleiste. Ein Klick auf die Benachrichtigung führt direkt zur Judge-Detailseite.
- Email: Sendet eine formatierte E-Mail mit Judge-Namen, aktuellem Durchschnittswert, Schwellenwert, Agentennamen, Gesamtzahl der Evaluationen und einem direkten Link zum Judge.
Benachrichtigungen verwalten
Jedes Projektmitglied kann unabhängig steuern, ob es Benachrichtigungen zur Judge-Bewertung per In-App, E-Mail oder über beide Kanäle erhält. Öffne im Projekt Settings > Notifications, um den Ereignistyp Judge Score Low umzuschalten. Standardmäßig sind In-App und E-Mail aktiviert.