Im März ging es um Sicherheit und Kontrolle. Mit A/B Testing lassen sich Agentenvarianten direkt vergleichen, Guardrails setzen bei jedem Run Sicherheitsregeln durch und API Spec Tools machen jede OpenAPI-Definition für Agenten aufrufbar. Außerdem kamen Dashboard-Templates mit Perzentil-Metriken, eine Migrations-CLI und weitere Verbesserungen hinzu.
A/B Testing
Mit A/B-Tests lassen sich Agentenvarianten jetzt direkt in einem Live-Environment vergleichen. Neben dem Basisagenten wird eine Variante bereitgestellt; der Traffic wird auf beide verteilt und die Ergebnisse erscheinen im Dashboard.
Varianten folgen einer einfachen Namenskonvention. Erstelle eine Agent-Datei mit dem Namen {base}-test-{name} und das SDK verknüpft sie mit dem Basisagenten:
order-processor.yaml # base agent
order-processor-test-faster-model.yaml # variant: "faster-model"
order-processor-test-new-prompt.yaml # variant: "new-prompt"Öffne im Dashboard den Basisagenten und klicke auf Manage A/B Tests, um einen Test zu konfigurieren:
- ✓Traffic Split: Einen Anteil der Requests an die Variante leiten, der Rest bleibt bei der Control
- ✓Minimum Sample Size: Einen Grenzwert festlegen, ab dem Ergebnisse als aussagekräftig gelten
- ✓Auto-rollback: Den Test automatisch pausieren, wenn die Fehlerrate der Variante innerhalb eines gleitenden Fensters einen Grenzwert überschreitet
- ✓Sticky Sessions: Derselbe Nutzer oder Chat-Thread sieht immer dieselbe Variante
Die Vergleichsansicht zeigt Runs, durchschnittliche Token-Kosten, P50- und P95-Dauer, durchschnittlichen Judge Score und Erfolgsquote für Control und Variante nebeneinander. Unser Leitfaden zu A/B-Tests für KI-Agenten beschreibt den vollständigen Ablauf.
Agent Guardrails
Guardrails schützen die Ein- und Ausgaben von Agenten. Die Guardrails-Dokumentation beschreibt die Konfiguration. Input Rules laufen vor der Ausführung des Agenten, Output Rules prüfen die Antwort, bevor sie den Nutzer erreicht.
guardrails:
input:
- type: prompt_injection
mode: block
- type: pii
mode: redact
config:
entities: [email, phone, ssn, credit_card]
- type: topic_restriction
mode: block
config:
allowed_topics: [product support, billing, account help]
off_topic_message: "I can only help with support and billing."
output:
- type: system_prompt_leakage
mode: block
- type: pii_leakage
mode: block
config:
entities: [ssn, api_key]Jede Regel hat einen Modus, der das Verhalten bei einem Verstoß festlegt:
- •block: Verarbeitung stoppen und eine Ablehnung zurückgeben
- •warn: Verstoß im Trace protokollieren, aber normal fortfahren
- •redact: Erkannten Inhalt durch Platzhalter wie
[EMAIL_REDACTED]ersetzen
Integrierte Typen sind prompt_injection, pii, moderation, topic_restriction, regex und custom. Custom Guardrails verweisen auf projektspezifische Python-Funktionen. Jede Evaluation wird im Run Trace aufgezeichnet, sodass nachvollziehbar bleibt, was geprüft wurde und warum. Mehr dazu steht in unseren Leitfäden zu Guardrails in Echtzeit und zur Absicherung von KI-Agenten im Produktivbetrieb.
API Spec Tools
Agenten können jetzt jede API aufrufen, die in einer OpenAPI-v3.x-Spezifikation definiert ist. Lade eine Spec in das Projekt hoch und referenziere ihre Operationen als API Spec Tools mit dem Präfix api:. Mit Wildcards lassen sich ganze Specs oder Teilmengen in einer einzigen Zeile bereitstellen.
tools:
- api:stripe.* # all operations from the Stripe spec
- api:hubspot.get_contact # single operation
- api:internal_api.list* # wildcard: list_users, list_orders, etc.
- billing.lookup_invoice # file-based tool (unchanged)Tool-Namen, Beschreibungen und Parameter werden direkt aus dem OpenAPI-Schema abgeleitet. Dateibasierte Tools unterstützen jetzt ebenfalls Wildcards: Mit support_tools.search_* werden alle Funktionen eines Moduls erfasst, die mit search_ beginnen.
Dashboard Templates & Metrics
Beim Einrichten von Observability-Dashboards müssen Widgets nicht mehr einzeln konfiguriert werden. Wähle beim Erstellen eines Dashboards ein vorgefertigtes Template und erhalte sofort ein vollständiges Layout.
- ✓Overview: Runs insgesamt, Erfolgsquote, Kosten, Token-Nutzung, Top-Agenten und KI-Modell-Verteilung
- ✓Agent: Auf einen Agenten begrenzt, mit Runs, Fehlern, Judge Scores und Aufschlüsselung nach KI-Modell
- ✓Cost: Gesamt-, Input-, Output-, Thinking- und Cached-Input-Kosten mit Aufschlüsselung pro KI-Modell
- ✓Token / LLM: Muster des Token-Verbrauchs nach Typ und KI-Modell
Zusätzlich zu den Templates enthalten jetzt alle Run-Metriken P50- und P95-Perzentile für Dauer, Kosten und Tokens pro Run. Perzentile machen Ausreißer sichtbar, die in Durchschnittswerten untergehen. Auch das Cost Tracking ist granularer: Jeder Run zeigt berechnete Kosten auf Grundlage der tatsächlichen Token-Nutzung und der KI-Modell-Preise, aufgeteilt nach Input, Output, Thinking und Cached Tokens. Unser Observability-Leitfaden erklärt, wie sich Kosten, Tokens und Runs auswerten lassen.
CLI-Befehl für die Migration
Für den Wechsel von einem anderen Framework zu Connic gibt es jetzt einen Befehl. Der neue CLI-Befehl connic migrate scannt das Projekt, erkennt Agenten, Tools und KI-Modelle und legt eine vollständige Connic-Projektstruktur an.
$ connic migrate ./my-langchain-project
Detected framework: LangChain
Found 3 agents, 7 tools, 2 models
Scaffolding project...
Created:
agents/order-processor.yaml
agents/support-agent.yaml
agents/classifier.yaml
tools/lookup_order.py
tools/search_docs.py
MIGRATION_REPORT.mdUnterstützte Frameworks:
- •LangChain: Extrahiert Agenten aus Aufrufen von
create_agent()undcreate_react_agent() - •Google ADK: Liest
root_agent.yamlund Python-Agentenklassen einschließlich Sequential, Parallel und Loop-Agenten
Eine generierte MIGRATION_REPORT.md listet alle konvertierten Elemente, ungelöste Referenzen und manuell zu prüfende Punkte auf. Eine schrittweise Anleitung beschreibt die Migration von LangChain in den Produktivbetrieb.
Weitere Verbesserungen
- •Bulk Run Actions: Mehrere Agent Runs gleichzeitig im Dashboard erneut ausführen oder abbrechen
- •Retrieval Namespaces: Mit dem neuen Tool
retrieval_list_namespaceskönnen Agenten die hierarchische Struktur von Retrieval erkunden - •Scheduled Triggers: Mit
trigger_agent_atdie Ausführung eines anderen Agenten für einen bestimmten Zeitpunkt planen - •Web Search Filters: Das Tool
web_searchunterstützt jetzt die Parametercountryundinclude_newsfür gezieltere Ergebnisse - •Verschachtelte Projektstrukturen: Agent-YAML-Dateien lassen sich jetzt in Unterverzeichnissen unter
agents/organisieren - •Telegram Allowlist: Die Allowlist begrenzt, welche Telegram Nutzer-IDs mit dem Agenten interagieren können; die Session-TTL ist konfigurierbar
- •Judge Improvements: Evaluations lassen sich nach niedrigen Scores filtern; vor einer Bewertung mehrerer Runs wird eine Kostenschätzung angezeigt
- •Fullscreen Dashboard: Jedes Dashboard-Widget lässt sich zur genaueren Untersuchung der Daten im Vollbild öffnen