Zum Hauptinhalt springen
Connic

Die Qualität von Agenten im Blick.
Mit Connic Judges.

Ein KI-Modell bewertet Agenten-Ausführungen nach individuell festgelegten Kriterien. Connic zeigt Bewertungen und Begründungen je Ausführung sowie die Entwicklung der Ergebnisse über die Zeit. Die Konfiguration erfolgt je Agent im Dashboard.

Judges-Dokumentation lesen

Judges

letzte 24 Std.
StatusJudgeØ ScoreBewertet
  • Aktiv
    answer_accuracy
    auf support_agent
    86%
    412 Runs
  • Aktiv
    tool_usage
    auf support_agent
    91%
    412 Runs
  • Aktiv
    tone_match
    auf invoice-processor
    64%
    218 Runs
  • Aktiv
    completeness
    auf support_agent
    89%
    412 Runs
  • Aktiv
    response_quality
    auf invoice-processor
    97%
    218 Runs

Eigene Qualitätskriterien für jeden Agenten

Konfiguriere im Dashboard, was ein Judge bewerten soll und wie viele Punkte je Kriterium möglich sind. Das gewählte KI-Modell vergibt für jedes Kriterium eine Punktzahl mit Begründung.

Neuer Judge
Name
Qualitätsprüfung für Rechnungen
Agent
invoice-processor
KI-Modell
anthropic/claude-sonnet-4-20250514
Trigger
Automatisch
Sample Rate
20%
Filter
Status ist abgeschlossen
Bewertungskriterien
17 / 20
Genauigkeit9 / 10

Hat der Agent anhand des Inputs eine sachlich richtige und vollständige Antwort erzeugt?

Tool-Nutzung4 / 5

Hat der Agent die passenden Tools verwendet und ihre Ergebnisse richtig interpretiert?

Qualität der Antwort4 / 5

Ist die Antwort gut strukturiert, verständlich und angemessen formatiert?

Steuere, was bewertet wird und wann

Kriterien, Filter und Stichprobenanteil bestimmen den Umfang der Bewertung. Judges können automatisch oder auf Anforderung laufen. Durchschnittswerte zeigen die Entwicklung der Ergebnisse, Benachrichtigungen machen auf sinkende Bewertungen aufmerksam.

Eigene Kriterien

Jedes Kriterium erhält einen Namen, eine Beschreibung und eine maximale Punktzahl. Das bewertende KI-Modell prüft die Kriterien einzeln und begründet jede Punktzahl.

Sample Rate

Die Sample Rate legt den Anteil passender Runs fest, die bewertet werden sollen (1–100 %). Ein Wert von 100 % bewertet jeden Run; ein niedrigerer Wert steuert die Kosten bei Agenten mit hohem Volumen.

Run Filter Expression

Begrenze die zu bewertenden Runs mit einem Python-ähnlichen Ausdruck über Felder aus context, input und output.

Automatisch oder manuell

Automatische Judges bewerten Runs nach ihrem Abschluss. Manuelle Judges bewerten nur auf Anforderung. Das eignet sich für Stichproben oder erneute Bewertungen nach einer Änderung des Bewertungsrasters.

Score Alerts

Du erhältst eine Benachrichtigung in der App oder per E-Mail, wenn die durchschnittliche Bewertung der letzten 1, 10, 50, 100 oder aller bisherigen Runs einen Grenzwert unterschreitet.

Durchschnitt je Kriterium

Jedes Kriterium wird auf der Detailseite des Judges im Zeitverlauf verfolgt und zeigt, welche Aspekte des Agenten nachlassen.

Vollständige Referenz in der Dokumentation ansehen.

Nutze Bewertungen direkt im laufenden Betrieb

Connic bewertet ausgewählte Ausführungen nach ihrem Abschluss im Hintergrund. Bewertungen und Begründungen sind in den Ausführungsdetails verfügbar. Die Ergebnisse unterstützen den Vergleich von Agentenvarianten und Benachrichtigungen bei sinkender Qualität.

Filter und Sample Rate werden für jeden aktiven Judge angewendet. Passende Judges bewerten den Run asynchron.
Das bewertende KI-Modell prüft jedes Kriterium. Punktzahlen, Begründungen und Token-Verbrauch werden an der Ausführung gespeichert.

Durchschnittliche Judge Scores erscheinen im direkten Vergleich von Kontrollgruppe und Variante.

Details

Du erhältst eine Benachrichtigung in der App oder per E-Mail, wenn der gleitende Durchschnitt eines Judges den konfigurierten Grenzwert unterschreitet.

Details

Scores und Begründungen je Kriterium erscheinen oben im Run-Detaildialog; der Header zeigt zusätzlich den Score als Badge.

Details

Bewertungskriterien an echten Ausführungen erproben

Connic ermöglicht manuelle Bewertungen bereits abgeschlossener Ausführungen. So können die Anweisungen und Kriterien eines Judges geprüft, angepasst und erneut getestet werden, bevor die automatische Bewertung aktiviert wird.

System Prompt
Fachlicher Kontext für das bewertende KI-Modell
Dieser Agent verarbeitet Anträge an Krankenversicherungen.
Eine richtige Antwort muss die Antragsnummer,
den Namen des Patienten und die Entscheidung enthalten
(genehmigt, abgelehnt oder ausstehende Prüfung).

Fehlende Felder sind streng zu bewerten,
Formulierungen dagegen großzügig, da die Antwort an ein
nachgelagertes System und nicht direkt an den Patienten geht.

Optional. Beschreibe die fachlichen Anforderungen, die das KI-Modell bei der Bewertung berücksichtigen soll.

Manuell auslösen
eingereiht
Run
run_a1b2c3 - invoice-processor - abgeschlossen

Jeder Run lässt sich bei Bedarf unabhängig von Trigger Mode oder Sample Rate bewerten. Das eignet sich für Stichproben, erneute Bewertungen nach Änderungen an Kriterien oder zum Testen eines neuen Bewertungsrasters an früheren Runs vor dem Wechsel zu Automatic.

  • Einen der letzten abgeschlossenen Runs im Dropdown auswählen
  • Oder für ältere Runs direkt eine Run ID einfügen
  • Der Agent des Runs muss dem Agenten des Judges entsprechen

Häufig gestellte Fragen

Bei der automatisierten Agent-Bewertung benotet ein LLM jeden Agent Run anhand eines strukturierten Bewertungsrasters, statt auf manuelle Prüfungen angewiesen zu sein. Ein Judge in Connic hat benannte Kriterien, Beschreibungen und Maximalwerte. Für jeden bewerteten Run liefert er einen Score und eine Begründung je Kriterium. Durchschnittswerte und Aufschlüsselungen nach Kriterien werden auf der Detailseite des Judges im Zeitverlauf dargestellt.

Jede abgeschlossene Bewertung verbraucht eine Connic Run Unit plus den Modellaufruf. Run Unit und connic/* Tokens werden zu den veröffentlichten Preisen aus dem Projektguthaben bezahlt; BYOK Inference rechnet der gewählte Provider ab. Die Sample Rate je Judge von 1–100 % steuert beides.

Im Tab Judges des Projekts öffnet New Judge das Formular. Dort lassen sich Agent und KI-Modell auswählen, ein System Prompt und mindestens ein benanntes Kriterium mit Beschreibung und Maximalwert definieren sowie Trigger Mode (Automatic oder Manual), Sample Rate und optional eine Filter Expression festlegen.

Im Modus Manual lassen sich einige aktuelle Runs bewerten. Punktzahlen und Begründungen je Kriterium helfen, den System-Prompt und die Kriterienbeschreibungen zu verfeinern. Anschließend kann der Judge auf Automatic umgestellt werden.

Ja. Jeder Judge kann einen Python-ähnlichen Filterausdruck mit context, input und output verwenden. Zum Beispiel wählt context.tier == 'enterprise' nur Runs aus, deren Kontextfeld tier den Wert enterprise enthält.

Jeder Judge kann optional einen Score Alert mit einem prozentualen Grenzwert und einem Durchschnittsfenster von 1, 10, 50, 100 oder allen bisherigen Runs verwenden. Der Alert wird einmal ausgelöst, wenn der Durchschnitt den Grenzwert unterschreitet. Die Zustellung erfolgt in der App und per E-Mail entsprechend den Notification Preferences jedes Mitglieds.

Judges unterstützen dieselben KI-Modelle wie Agenten: ein exaktes connic/* KI-Modell ohne separaten Provider Key oder einen konfigurierten BYOK Provider wie OpenAI, Anthropic, Google Gemini, Azure OpenAI, AWS Bedrock, Vertex AI, OpenRouter oder einen eigenen OpenAI-kompatiblen Endpoint.