Integrierte Guardrails
Integrierte Input- und Output-Prüfungen für Prompt Injection, personenbezogene Daten, Moderation, Themensteuerung, Prompt Leakage und Datenexfiltration.
Auf dieser Seite
Input Guardrails
prompt_injection
Prüft den Input auf typische Prompt-Injection-Muster und verschleierte Varianten.
guardrails:
input:
- type: prompt_injection
mode: block
config:
sensitivity: high| Konfiguration | Beschreibung |
|---|---|
sensitivity | low | medium (Standard) | high |
provider | Optional. Auf lakera setzen, um die API von Lakera Guard zu verwenden |
Modi: block, warn
pii
Erkennt und maskiert personenbezogene Daten. Erkennt E-Mail-Adressen, Telefonnummern, SSNs, Kreditkarten, IBANs, IP-Adressen und API-Keys.
# Input: "My email is john@example.com and SSN is 123-45-6789"
# After redaction: "My email is [EMAIL_REDACTED] and SSN is [SSN_REDACTED]"
guardrails:
input:
- type: pii
mode: redact
config:
entities: [email, phone, ssn, credit_card]| Konfiguration | Beschreibung |
|---|---|
entities | Liste der zu erkennenden Datentypen (Standard: alle). Verfügbar: email, phone, ssn, credit_card, iban, ip_address und api_key. |
Modi: block, warn, redact
moderation
Moderation und Sicherheitsklassifizierung von Inhalten. Funktioniert für Input und Output.
guardrails:
input:
- type: moderation
mode: block
config:
categories: [hate, harassment, self_harm, violence, sexual]| Konfiguration | Beschreibung |
|---|---|
categories | hate, harassment, self_harm, violence, sexual, illegal_activity, dangerous_instructions |
threshold | Konfidenz-Schwellenwert von 0.0 bis 1.0 (Standard: 0.7; nur externe Provider) |
provider | Optional. openai (OpenAI Moderation API) oder perspective (Google Perspective API) |
Modi: block, warn
topic_restriction
Prüft mit einem KI-Modell, ob die Anfrage zum vorgesehenen Thema passt.
Fügt pro Anfrage einen LLM-Aufruf hinzu. Das Feld model wählt das KI-Modell zur Klassifizierung aus.
guardrails:
input:
- type: topic_restriction
mode: block
config:
allowed_topics: [product support, billing, account help]
off_topic_message: "I can only help with product support, billing, and account questions."
model: connic/gpt-5.6-luna| Konfiguration | Beschreibung |
|---|---|
allowed_topics | Liste erlaubter Themenbeschreibungen |
blocked_topics | Liste explizit blockierter Themen als Alternative zu allowed_topics |
off_topic_message | Benutzerdefinierte Ablehnungsnachricht |
model | KI-Modell für die Klassifizierung, zum Beispiel openai/gpt-5-mini. Unterstützt alle Provider einschließlich eigener OpenAI-kompatibler Provider. Standardmäßig wird das KI-Modell des Agenten verwendet. |
Modi: block, warn
regex
Prüft mit eigenen regulären Ausdrücken, ob Inhalte gegen anwendungsspezifische Regeln verstoßen. Funktioniert für Input und Output.
guardrails:
input:
- type: regex
mode: block
config:
patterns:
- pattern: "(?i)\\b(drop|delete|truncate)\\s+table\\b"
message: "SQL commands are not allowed"
output:
- type: regex
mode: warn
config:
patterns:
- pattern: "(?i)internal use only|confidential"
message: "Output contains internal-only content"| Konfiguration | Beschreibung |
|---|---|
patterns | Liste aus {pattern, message}-Objekten |
Modi: block, warn
Output Guardrails
Zusätzlich zu moderation und regex, die sowohl für Input als auch Output funktionieren, sind die folgenden Guardrails speziell für Output vorgesehen:
pii_leakage
Prüft Antworten des Agenten auf die konfigurierten Typen personenbezogener Daten.
guardrails:
output:
- type: pii_leakage
mode: block
config:
entities: [ssn, credit_card, api_key]| Konfiguration | Beschreibung |
|---|---|
entities | Zu erkennende Datentypen (Standard: ssn, credit_card, api_key) |
Modi: block, warn, redact
system_prompt_leakage
Prüft, ob eine Antwort des Agenten den konfigurierten System-Prompt offenlegt.
guardrails:
output:
- type: system_prompt_leakage
mode: block
config:
similarity_threshold: 0.6| Konfiguration | Beschreibung |
|---|---|
similarity_threshold | 0.0-1.0 (Standard: 0.6). Legt fest, wie ähnlich der Output dem System-Prompt sein muss, um die Regel auszulösen. |
Modi: block, warn
relevance
Prüft mit einem LLM-Klassifikator, ob eine Antwort für den Nutzer-Input und die Aufgabe des Agenten relevant ist.
Fügt pro Anfrage einen LLM-Aufruf hinzu. Das Feld model wählt das KI-Modell zur Klassifizierung aus.
guardrails:
output:
- type: relevance
mode: warn
config:
context: "Responses must relate to the user's support request."
model: connic/gpt-5.6-luna| Konfiguration | Beschreibung |
|---|---|
context | Zusätzliche Beschreibung, was „relevant“ bedeutet |
model | KI-Modell für die Klassifizierung. Standardmäßig das KI-Modell des Agenten. |
Modi: block, warn
data_exfiltration
Erkennt Versuche zur Datenexfiltration im Output: verdächtige URLs mit codierten Daten und in Markdown eingebettete Bilder von externen Domains.
guardrails:
output:
- type: data_exfiltration
mode: block
config:
allowed_domains: [example.com, cdn.example.com]| Konfiguration | Beschreibung |
|---|---|
allowed_domains | Liste erlaubter externer Domains (Standard: keine; alle werden markiert) |
Modi: block, warn
Externe Provider
Setze bei unterstützten Guardrails config.provider, um einen dieser Services zu verwenden:
| Provider | Für | Einrichtung |
|---|---|---|
openai | moderation | Verwendet die für das Projekt konfigurierten Zugangsdaten des OpenAI-Providers |
lakera | prompt_injection | Füge LAKERA_API_KEY als Umgebungsvariable hinzu. Den Key gibt es unter platform.lakera.ai |
perspective | moderation | Füge GOOGLE_PERSPECTIVE_API_KEY als Umgebungsvariable hinzu. Aktiviere die API in der Google Cloud Console und erstelle einen API-Key |
OpenAI-Moderation-Beispiel
guardrails:
input:
- type: moderation
mode: block
config:
provider: openai
categories: [hate, self_harm, violence, sexual]
threshold: 0.7Lakera-Guard-Beispiel
guardrails:
input:
- type: prompt_injection
mode: block
config:
provider: lakeraPerspective-API-Beispiel
guardrails:
input:
- type: moderation
mode: block
config:
provider: perspective
threshold: 0.7
languages: [en] # Configurable language list