Zum Hauptinhalt springen
Connic
Build

Guardrails

Integrierte Sicherheitsprüfungen und anwendungsspezifische Python-Guardrails schützen Eingaben und Ausgaben von Agenten.

Zuletzt aktualisiert

Überblick

Guardrails sind Sicherheitsprüfungen, die vor und nach der Ausführung eines Agenten stattfinden. Sie schützen vor Prompt-Injection-Angriffen, der Offenlegung personenbezogener Daten, toxischen Inhalten, themenfremden Anfragen und anwendungsspezifischen Risiken. Jede Regel hat einen Modus, der festlegt, was bei einem Verstoß geschieht. Guardrails werden direkt im Agent YAML konfiguriert.

Beginne bei gängigen Sicherheitsrisiken mit integrierten Guardrails. Verwende Custom Guardrails, wenn eine Prüfung anwendungsspezifische Validierungs- oder Autorisierungslogik benötigt.

Ausführungsablauf
InputInput GuardrailsMiddleware (before)Agent-AusführungMiddleware (after)Output GuardrailsAntwort

Wenn ein Input-Guardrail blockiert, werden der Agent und die Before Middleware übersprungen und die Ablehnungsnachricht zurückgegeben. Standardmäßig wird die After Middleware auch bei dieser Ablehnung ausgeführt, sodass sie jede Antwort nachbearbeiten kann. Lege run_after_on_block: false unter guardrails fest, um sie bei einer Blockierung stattdessen zu überspringen.

Modi

ModusVerhaltenRun-Status
blockBeendet die Verarbeitung und gibt eine Ablehnungsnachricht zurück, die sich über rejection_message konfigurieren lässt. Bei einem Input-Verstoß wird der Agent nie ausgeführt; ein unsicherer Output wird ersetzt.Standardmäßig completed. Lege fail_run: true fest, um ihn als failed zu markieren.
warnErfasst den Verstoß als Trace Span und setzt die Verarbeitung fort.completed
redactErsetzt erkannte Inhalte durch Platzhalter wie [EMAIL_REDACTED]. Verfügbar für pii und pii_leakage.completed

Konfigurationsbeispiel

Konfiguriere Input- und Output-Regeln im Agent YAML:

agents/agent.yaml
guardrails:
  input:
    - type: prompt_injection
      mode: block
    - type: pii
      mode: redact
  output:
    - type: moderation
      mode: block
    - type: system_prompt_leakage
      mode: block

In der Referenz der integrierten Guardrails sind alle Regeln und Konfigurationsoptionen dokumentiert.

Observability

Jede Guardrail-Auswertung wird als Trace Span erfasst. Verstöße erscheinen in der Trace-Timeline mit Regeltyp, Modus, Richtung, Status, selbst vergebenem Namen und Meldung zum Verstoß.

  • Span-Name: guardrail:prompt_injection, guardrail:pii und ähnliche
  • Status: passed, blocked, warned oder redacted
  • Modus: block, warn oder redact
  • Richtung: input oder output