Zum Hauptinhalt springen
Connic

A/B-Tests für Agenten.
In Connic integriert.

Vergleiche Agentenvarianten mit einem festgelegten Anteil produktiver Anfragen. Connic zeigt Kosten, Laufzeiten, Erfolgsrate und Judge-Bewertungen im direkten Vergleich. Optionale Schutzregeln pausieren Tests bei zu vielen Fehlern oder zu niedrigen Bewertungen.

A/B-Testing-Dokumentation lesen

order-handler

A/B Test · 4.128 Runs

aktiv
Kontrollgruppe50%
49%
Erfolgsrate
test-friendly-tone50%
68%
+19 PP vs. Kontrollgruppe

Eine Agentenvariante für den A/B-Test anlegen

Testvarianten sind eigenständige Agenten mit Namen nach dem Muster {base-agent}-test-{name}. Sie werden zusammen mit dem ursprünglichen Agenten bereitgestellt. Der Test wird anschließend im Dashboard konfiguriert und gestartet.

agents/order-handler-test-friendly-tone.yaml
name: order-handler-test-friendly-tone
model: connic/gpt-5.6-terra
description: "Verarbeitet eingehende Kundenbestellungen"
system_prompt: |
  Du verarbeitest eingehende Bestellungen in einem warmen,
  freundlichen Ton...
tools:
  - orders.process
  - inventory.check
order-handler · A/B Tests verwalten
aktiv · 4.128 Runs
order-handler (Basis)50%
test-friendly-tone50%
vor 2 Tagen gestartet

Kosten, Geschwindigkeit und Qualität im Vergleich

Die Übersicht zeigt Erfolgsrate, Laufzeiten und durchschnittliche Token-Kosten für den bestehenden Agenten und die Testvariante. Bewertungen der konfigurierten Judges ergänzen den Vergleich um festgelegte Qualitätskriterien.

Erfolgsrate
68%vs. 49%
+19pp
Durchschnittliche Dauer (P95)
2.3svs. 2.1s
+0.2s
Durchschnittliche Token-Kosten je Run
$0.021vs. $0.018
+$0.003
Judge Score
18/20vs. 16/20
+2

A/B-Tests gezielt starten und begrenzen

Lege einen Test als Entwurf an und starte die Verteilung der Anfragen, sobald die Konfiguration steht. Der Test kann im Dashboard pausiert oder abgeschlossen werden. Ein optionaler Grenzwert für die Fehlerquote löst eine automatische Pause aus.

Letzte A/B Tests
  • test-friendly-tone
    auf order-handler · 4,128 Runs · Gewinner festgelegt · Erfolgsrate 68 % vs. 49 %
    abgeschlossen
  • test-haiku
    auf support-triage · 8,901 Runs · 10 % Traffic · Judge Scores höchstens 1 Punkt von der Basis entfernt
    aktiv
  • test-shorter-prompt
    auf invoice-processor · 0 Runs · startbereit · 20 % Traffic konfiguriert
    Entwurf
  • test-aggressive-retries
    auf fraud-detector · 612 Runs · Auto-Rollback · Fehlerquote hat Grenzwert überschritten
    pausiert

Eine minimale Stichprobengröße verhindert, dass Ergebnisse zu früh als aussagekräftig gelten. Auto-Rollback sorgt dafür, dass sich eine fehlerhafte Variante selbst pausiert. Sobald genügend Daten vorliegen, lässt sich der Test abschließen und optional ein Gewinner festlegen.

Laufende A/B-Tests unter Kontrolle

Connic kann Tests bei überschrittenen Fehlergrenzen automatisch pausieren und Anfragen einer Session derselben Variante zuordnen. Im explorativen Modus können mehrere Varianten parallel getestet werden.

Auto-Rollback

Ein Grenzwert legt die maximal zulässige Fehlerquote fest. Überschreitet ihn die Variante innerhalb eines gleitenden Run-Fensters, pausiert sich der Test selbst, bevor weitere Nutzer auf eine fehlerhafte Variante treffen.

Mehrere Tests, ein Agent

Mehrere Tests können gleichzeitig Varianten desselben ursprünglichen Agenten vergleichen. Die Traffic-Anteile dürfen zusammen höchstens 100 % ergeben. Der Rest wird immer an die Kontrollgruppe geleitet.

Sticky Sessions

Bei konfigurierten Sessions wird jede Anfrage derselben Session an dieselbe Variante geleitet. Wird ein Test pausiert oder abgeschlossen, übernimmt wieder der ursprüngliche Agent.

Häufig gestellte Fragen

Für den Test wird eine minimale Stichprobengröße festgelegt. Connic bewertet Ergebnisse erst als aussagekräftig, wenn jede Gruppe entsprechend viele abgeschlossene Runs erreicht hat. Als Ausgangspunkt für verlässliche Vergleiche empfiehlt die Dokumentation 50–100 Runs je Gruppe.

Ja. Jeder Test erhält einen eigenen Traffic-Anteil. Die Anteile aller aktiven Tests eines Agenten dürfen zusammen höchstens 100 % ergeben. Der Rest wird an den ursprünglichen Agenten geleitet.

Ja, wenn Sessions konfiguriert sind. Jede Anfrage derselben Session wird an dieselbe Variante geleitet. Wird ein Test während einer Session pausiert oder abgeschlossen, übernimmt wieder der ursprüngliche Agent.

Mit Auto-Rollback und einem Grenzwert für die Fehlerquote pausiert sich der Test selbst, sobald die Variante den Grenzwert innerhalb eines gleitenden Fensters überschreitet. Alternativ lässt sich der Test jederzeit manuell im Dashboard pausieren oder beenden.

Feature Flags verteilen Traffic. A/B Testing verteilt Traffic und vergleicht Token-Kosten, Dauer, Erfolgsrate und Judge Scores von Kontrollgruppe und Variante direkt. Durch Auto-Rollback bei hoher Fehlerquote pausiert sich eine schlechte Variante selbst.

Judge-Bewertungen erscheinen neben Token-Kosten, Dauer und Erfolgsrate im direkten Vergleich. Die am ursprünglichen Agenten konfigurierten Judges bewerten die Runs beider Gruppen. So werden beide Varianten anhand derselben Kriterien verglichen.