Zum Hauptinhalt springen
Connic
Build

Integrierte Guardrails

Integrierte Input- und Output-Prüfungen für Prompt Injection, personenbezogene Daten, Moderation, Themensteuerung, Prompt Leakage und Datenexfiltration.

Zuletzt aktualisiert

Input Guardrails

prompt_injection

Prüft den Input auf typische Prompt-Injection-Muster und verschleierte Varianten.

agents/agent.yaml
guardrails:
  input:
    - type: prompt_injection
      mode: block
      config:
        sensitivity: high
KonfigurationBeschreibung
sensitivitylow | medium (Standard) | high
providerOptional. Auf lakera setzen, um die API von Lakera Guard zu verwenden

Modi: block, warn

pii

Erkennt und maskiert personenbezogene Daten. Erkennt E-Mail-Adressen, Telefonnummern, SSNs, Kreditkarten, IBANs, IP-Adressen und API-Keys.

agents/agent.yaml
# Input: "My email is john@example.com and SSN is 123-45-6789"
# After redaction: "My email is [EMAIL_REDACTED] and SSN is [SSN_REDACTED]"

guardrails:
  input:
    - type: pii
      mode: redact
      config:
        entities: [email, phone, ssn, credit_card]
KonfigurationBeschreibung
entitiesListe der zu erkennenden Datentypen (Standard: alle). Verfügbar: email, phone, ssn, credit_card, iban, ip_address und api_key.

Modi: block, warn, redact

moderation

Moderation und Sicherheitsklassifizierung von Inhalten. Funktioniert für Input und Output.

agents/agent.yaml
guardrails:
  input:
    - type: moderation
      mode: block
      config:
        categories: [hate, harassment, self_harm, violence, sexual]
KonfigurationBeschreibung
categorieshate, harassment, self_harm, violence, sexual, illegal_activity, dangerous_instructions
thresholdKonfidenz-Schwellenwert von 0.0 bis 1.0 (Standard: 0.7; nur externe Provider)
providerOptional. openai (OpenAI Moderation API) oder perspective (Google Perspective API)

Modi: block, warn

topic_restriction

Prüft mit einem KI-Modell, ob die Anfrage zum vorgesehenen Thema passt.

Fügt pro Anfrage einen LLM-Aufruf hinzu. Das Feld model wählt das KI-Modell zur Klassifizierung aus.

agents/agent.yaml
guardrails:
  input:
    - type: topic_restriction
      mode: block
      config:
        allowed_topics: [product support, billing, account help]
        off_topic_message: "I can only help with product support, billing, and account questions."
        model: connic/gpt-5.6-luna
KonfigurationBeschreibung
allowed_topicsListe erlaubter Themenbeschreibungen
blocked_topicsListe explizit blockierter Themen als Alternative zu allowed_topics
off_topic_messageBenutzerdefinierte Ablehnungsnachricht
modelKI-Modell für die Klassifizierung, zum Beispiel openai/gpt-5-mini. Unterstützt alle Provider einschließlich eigener OpenAI-kompatibler Provider. Standardmäßig wird das KI-Modell des Agenten verwendet.

Modi: block, warn

regex

Prüft mit eigenen regulären Ausdrücken, ob Inhalte gegen anwendungsspezifische Regeln verstoßen. Funktioniert für Input und Output.

agents/agent.yaml
guardrails:
  input:
    - type: regex
      mode: block
      config:
        patterns:
          - pattern: "(?i)\\b(drop|delete|truncate)\\s+table\\b"
            message: "SQL commands are not allowed"
  output:
    - type: regex
      mode: warn
      config:
        patterns:
          - pattern: "(?i)internal use only|confidential"
            message: "Output contains internal-only content"
KonfigurationBeschreibung
patternsListe aus {pattern, message}-Objekten

Modi: block, warn

Output Guardrails

Zusätzlich zu moderation und regex, die sowohl für Input als auch Output funktionieren, sind die folgenden Guardrails speziell für Output vorgesehen:

pii_leakage

Prüft Antworten des Agenten auf die konfigurierten Typen personenbezogener Daten.

agents/agent.yaml
guardrails:
  output:
    - type: pii_leakage
      mode: block
      config:
        entities: [ssn, credit_card, api_key]
KonfigurationBeschreibung
entitiesZu erkennende Datentypen (Standard: ssn, credit_card, api_key)

Modi: block, warn, redact

system_prompt_leakage

Prüft, ob eine Antwort des Agenten den konfigurierten System-Prompt offenlegt.

agents/agent.yaml
guardrails:
  output:
    - type: system_prompt_leakage
      mode: block
      config:
        similarity_threshold: 0.6
KonfigurationBeschreibung
similarity_threshold0.0-1.0 (Standard: 0.6). Legt fest, wie ähnlich der Output dem System-Prompt sein muss, um die Regel auszulösen.

Modi: block, warn

relevance

Prüft mit einem LLM-Klassifikator, ob eine Antwort für den Nutzer-Input und die Aufgabe des Agenten relevant ist.

Fügt pro Anfrage einen LLM-Aufruf hinzu. Das Feld model wählt das KI-Modell zur Klassifizierung aus.

agents/agent.yaml
guardrails:
  output:
    - type: relevance
      mode: warn
      config:
        context: "Responses must relate to the user's support request."
        model: connic/gpt-5.6-luna
KonfigurationBeschreibung
contextZusätzliche Beschreibung, was „relevant“ bedeutet
modelKI-Modell für die Klassifizierung. Standardmäßig das KI-Modell des Agenten.

Modi: block, warn

data_exfiltration

Erkennt Versuche zur Datenexfiltration im Output: verdächtige URLs mit codierten Daten und in Markdown eingebettete Bilder von externen Domains.

agents/agent.yaml
guardrails:
  output:
    - type: data_exfiltration
      mode: block
      config:
        allowed_domains: [example.com, cdn.example.com]
KonfigurationBeschreibung
allowed_domainsListe erlaubter externer Domains (Standard: keine; alle werden markiert)

Modi: block, warn

Externe Provider

Setze bei unterstützten Guardrails config.provider, um einen dieser Services zu verwenden:

ProviderFürEinrichtung
openaimoderationVerwendet die für das Projekt konfigurierten Zugangsdaten des OpenAI-Providers
lakeraprompt_injectionFüge LAKERA_API_KEY als Umgebungsvariable hinzu. Den Key gibt es unter platform.lakera.ai
perspectivemoderationFüge GOOGLE_PERSPECTIVE_API_KEY als Umgebungsvariable hinzu. Aktiviere die API in der Google Cloud Console und erstelle einen API-Key

OpenAI-Moderation-Beispiel

agents/agent.yaml
guardrails:
  input:
    - type: moderation
      mode: block
      config:
        provider: openai
        categories: [hate, self_harm, violence, sexual]
        threshold: 0.7

Lakera-Guard-Beispiel

agents/agent.yaml
guardrails:
  input:
    - type: prompt_injection
      mode: block
      config:
        provider: lakera

Perspective-API-Beispiel

agents/agent.yaml
guardrails:
  input:
    - type: moderation
      mode: block
      config:
        provider: perspective
        threshold: 0.7
        languages: [en]     # Configurable language list