Die Qualität von Agenten im Blick.
Mit Connic Judges.
Ein KI-Modell bewertet Agenten-Ausführungen nach individuell festgelegten Kriterien. Connic zeigt Bewertungen und Begründungen je Ausführung sowie die Entwicklung der Ergebnisse über die Zeit. Die Konfiguration erfolgt je Agent im Dashboard.
Judges-Dokumentation lesenJudges
letzte 24 Std.- Aktivanswer_accuracyauf support_agent86%412 Runs
- Aktivtool_usageauf support_agent91%412 Runs
- Aktivtone_matchauf invoice-processor64%218 Runs
- Aktivcompletenessauf support_agent89%412 Runs
- Aktivresponse_qualityauf invoice-processor97%218 Runs
Eigene Qualitätskriterien für jeden Agenten
Konfiguriere im Dashboard, was ein Judge bewerten soll und wie viele Punkte je Kriterium möglich sind. Das gewählte KI-Modell vergibt für jedes Kriterium eine Punktzahl mit Begründung.
Hat der Agent anhand des Inputs eine sachlich richtige und vollständige Antwort erzeugt?
Hat der Agent die passenden Tools verwendet und ihre Ergebnisse richtig interpretiert?
Ist die Antwort gut strukturiert, verständlich und angemessen formatiert?
Steuere, was bewertet wird und wann
Kriterien, Filter und Stichprobenanteil bestimmen den Umfang der Bewertung. Judges können automatisch oder auf Anforderung laufen. Durchschnittswerte zeigen die Entwicklung der Ergebnisse, Benachrichtigungen machen auf sinkende Bewertungen aufmerksam.
Jedes Kriterium erhält einen Namen, eine Beschreibung und eine maximale Punktzahl. Das bewertende KI-Modell prüft die Kriterien einzeln und begründet jede Punktzahl.
Die Sample Rate legt den Anteil passender Runs fest, die bewertet werden sollen (1–100 %). Ein Wert von 100 % bewertet jeden Run; ein niedrigerer Wert steuert die Kosten bei Agenten mit hohem Volumen.
Begrenze die zu bewertenden Runs mit einem Python-ähnlichen Ausdruck über Felder aus context, input und output.
Automatische Judges bewerten Runs nach ihrem Abschluss. Manuelle Judges bewerten nur auf Anforderung. Das eignet sich für Stichproben oder erneute Bewertungen nach einer Änderung des Bewertungsrasters.
Du erhältst eine Benachrichtigung in der App oder per E-Mail, wenn die durchschnittliche Bewertung der letzten 1, 10, 50, 100 oder aller bisherigen Runs einen Grenzwert unterschreitet.
Jedes Kriterium wird auf der Detailseite des Judges im Zeitverlauf verfolgt und zeigt, welche Aspekte des Agenten nachlassen.
Nutze Bewertungen direkt im laufenden Betrieb
Connic bewertet ausgewählte Ausführungen nach ihrem Abschluss im Hintergrund. Bewertungen und Begründungen sind in den Ausführungsdetails verfügbar. Die Ergebnisse unterstützen den Vergleich von Agentenvarianten und Benachrichtigungen bei sinkender Qualität.
Durchschnittliche Judge Scores erscheinen im direkten Vergleich von Kontrollgruppe und Variante.
DetailsDu erhältst eine Benachrichtigung in der App oder per E-Mail, wenn der gleitende Durchschnitt eines Judges den konfigurierten Grenzwert unterschreitet.
DetailsScores und Begründungen je Kriterium erscheinen oben im Run-Detaildialog; der Header zeigt zusätzlich den Score als Badge.
DetailsBewertungskriterien an echten Ausführungen erproben
Connic ermöglicht manuelle Bewertungen bereits abgeschlossener Ausführungen. So können die Anweisungen und Kriterien eines Judges geprüft, angepasst und erneut getestet werden, bevor die automatische Bewertung aktiviert wird.
Dieser Agent verarbeitet Anträge an Krankenversicherungen. Eine richtige Antwort muss die Antragsnummer, den Namen des Patienten und die Entscheidung enthalten (genehmigt, abgelehnt oder ausstehende Prüfung). Fehlende Felder sind streng zu bewerten, Formulierungen dagegen großzügig, da die Antwort an ein nachgelagertes System und nicht direkt an den Patienten geht.
Optional. Beschreibe die fachlichen Anforderungen, die das KI-Modell bei der Bewertung berücksichtigen soll.
Jeder Run lässt sich bei Bedarf unabhängig von Trigger Mode oder Sample Rate bewerten. Das eignet sich für Stichproben, erneute Bewertungen nach Änderungen an Kriterien oder zum Testen eines neuen Bewertungsrasters an früheren Runs vor dem Wechsel zu Automatic.
- Einen der letzten abgeschlossenen Runs im Dropdown auswählen
- Oder für ältere Runs direkt eine Run ID einfügen
- Der Agent des Runs muss dem Agenten des Judges entsprechen