Guardrails
Integrierte Sicherheitsprüfungen und anwendungsspezifische Python-Guardrails schützen Eingaben und Ausgaben von Agenten.
Auf dieser Seite
Überblick
Guardrails sind Sicherheitsprüfungen, die vor und nach der Ausführung eines Agenten stattfinden. Sie schützen vor Prompt-Injection-Angriffen, der Offenlegung personenbezogener Daten, toxischen Inhalten, themenfremden Anfragen und anwendungsspezifischen Risiken. Jede Regel hat einen Modus, der festlegt, was bei einem Verstoß geschieht. Guardrails werden direkt im Agent YAML konfiguriert.
Beginne bei gängigen Sicherheitsrisiken mit integrierten Guardrails. Verwende Custom Guardrails, wenn eine Prüfung anwendungsspezifische Validierungs- oder Autorisierungslogik benötigt.
Wenn ein Input-Guardrail blockiert, werden der Agent und die Before Middleware übersprungen und die Ablehnungsnachricht zurückgegeben. Standardmäßig wird die After Middleware auch bei dieser Ablehnung ausgeführt, sodass sie jede Antwort nachbearbeiten kann. Lege run_after_on_block: false unter guardrails fest, um sie bei einer Blockierung stattdessen zu überspringen.
Modi
| Modus | Verhalten | Run-Status |
|---|---|---|
block | Beendet die Verarbeitung und gibt eine Ablehnungsnachricht zurück, die sich über rejection_message konfigurieren lässt. Bei einem Input-Verstoß wird der Agent nie ausgeführt; ein unsicherer Output wird ersetzt. | Standardmäßig completed. Lege fail_run: true fest, um ihn als failed zu markieren. |
warn | Erfasst den Verstoß als Trace Span und setzt die Verarbeitung fort. | completed |
redact | Ersetzt erkannte Inhalte durch Platzhalter wie [EMAIL_REDACTED]. Verfügbar für pii und pii_leakage. | completed |
Konfigurationsbeispiel
Konfiguriere Input- und Output-Regeln im Agent YAML:
guardrails:
input:
- type: prompt_injection
mode: block
- type: pii
mode: redact
output:
- type: moderation
mode: block
- type: system_prompt_leakage
mode: blockIn der Referenz der integrierten Guardrails sind alle Regeln und Konfigurationsoptionen dokumentiert.
Observability
Jede Guardrail-Auswertung wird als Trace Span erfasst. Verstöße erscheinen in der Trace-Timeline mit Regeltyp, Modus, Richtung, Status, selbst vergebenem Namen und Meldung zum Verstoß.
- Span-Name:
guardrail:prompt_injection,guardrail:piiund ähnliche - Status:
passed,blocked,warnedoderredacted - Modus:
block,warnoderredact - Richtung:
inputoderoutput