Zum Hauptinhalt springen
Connic

Lege Sicherheitsregeln für KI-Agenten fest.
Direkt in Connic.

Nicht vertrauenswürdige Inputs werden vor der Ausführung und die finale Antwort vor der Auslieferung bewertet. Integrierte oder eigene Python-Regeln können blockieren, warnen oder sensible Inhalte maskieren. Jede Entscheidung bleibt mit dem Trace verknüpft.

Guardrails-Dokumentation lesen
  1. prompt_injectionInput
    bestanden
  2. piiInput
    maskiert
  3. Agent-AusführungRuntime
    abgeschlossen
  4. moderationOutput
    bestanden
  5. system_prompt_leakageOutput
    bestanden
john@example.com[EMAIL_REDACTED]

Prüfe Eingaben und Antworten auf Sicherheitsrisiken

Prüfe mit Guardrails eingehende Inhalte, bevor der Agent sie verarbeitet, und Antworten, bevor sie ausgegeben werden. Jede Prüfentscheidung wird protokolliert, auch wenn die Verarbeitung fortgesetzt wird.

Nicht vertrauenswürdiger Input
Verbindungs-Payload oder API Request
Kontrollierte Ausführung
Blockieren, warnen oder maskieren
Ein Input Block überspringt die Agent-Ausführung und Before Middleware. After Middleware läuft standardmäßig weiter, sofern run_after_on_block: false nicht gesetzt ist.

Erkenne Risiken mit Regeln und KI

Kombiniere schnelle Standardprüfungen, kontextbezogene KI-Prüfungen und eigene Python-Regeln passend zu deiner Anwendung.

Abdeckung der integrierten Guardrails
RegelRichtungModiZweck
prompt_injectionInputblock · warnVersuche erkennen, die Anweisungen des Agenten zu überschreiben
piiInputblock · warn · redactKonfigurierte PII-Entitäten erkennen oder ersetzen
moderationBeideblock · warnKonfigurierte Sicherheitskategorien prüfen
topic_restrictionInputblock · warnPrüfen, ob Anfragen erlaubte oder gesperrte Themen betreffen
regexBeideblock · warnAnwendungsspezifische Textmuster anwenden
pii_leakageOutputblock · warn · redactKonfigurierte PII aus Antworten heraushalten
system_prompt_leakageOutputblock · warnOutput mit dem tatsächlichen System Prompt vergleichen
relevanceOutputblock · warnKlassifizieren, ob die Antwort relevant geblieben ist
data_exfiltrationOutputblock · warnVerdächtige externe URLs und codierte Payloads markieren

Für Prompt-Injection- und Moderationsprüfungen stehen externe Provider-Optionen bereit. Alle integrierten Guardrails und Provider ansehen.

Starte mit vier Sicherheitsprüfungen für KI-Agenten

Prüfe auf Prompt Injection, personenbezogene Daten, problematische Antworten und die Offenlegung des System-Prompts. Nutze die Ausführungsprotokolle, um die Konfiguration an deine Anwendung anzupassen.

agents/support-agent.yaml
guardrails:
  input:
    - type: prompt_injection
      mode: block
    - type: pii
      mode: redact
  output:
    - type: moderation
      mode: block
    - type: system_prompt_leakage
      mode: block
Ergebnisse der Guardrail-Evaluation
SpanStatus
guardrail:prompt_injectionpassed
guardrail:piiredacted
guardrail:moderationpassed
guardrail:system_prompt_leakagepassed
Jede Evaluation erfasst Regel, Richtung, Status, Provider und Erkennungsdetails.
  • block

    Die unsichere Antwort ersetzen oder bei einem Input-Verstoß die Agent-Ausführung überspringen.

  • warn

    Den Verstoß als Trace Span protokollieren und die Verarbeitung fortsetzen.

  • redact

    Erkannte PII in unterstützten Prüfungen durch typisierte Platzhalter ersetzen.

Anwendungsspezifische Guardrails in Python

Eigene Prüfungen können Mandantenzugriffe kontrollieren, Datensatzstrukturen validieren und interne Richtlinien der Anwendung durchsetzen.

guardrails/require-ticket.py
from connic import GuardrailResult
import re

def check(content: str, context: dict) -> GuardrailResult:
    """Vor der Ausführung dieses Agenten eine Ticket-ID verlangen."""
    if not re.search(r"TICKET-\d{4,8}", content):
        return GuardrailResult(
            passed=False,
            message="Gib eine gültige Ticket-ID an."
        )

    return GuardrailResult(passed=True)
  • Erforderlicher Export

    check(content, context) aus einer passenden Datei unter guardrails/ exportieren.

  • Synchron oder asynchron

    Einen eigenen Policy- oder Autorisierungsdienst aufrufen, wenn eine lokale Regel nicht ausreicht.

  • Fehler nach konfiguriertem Modus behandeln

    Eine Exception wird protokolliert und als Verstoß behandelt: warn setzt die Verarbeitung fort, block stoppt sie.

  • Logs bleiben verknüpft

    Print, stderr und Standard-Logging erscheinen unter guardrail.<name> im selben Run.

Input-Prüfungen laufen vor der Middleware

Input-Guardrails können keine Kontextwerte verwenden, die erst die Before Middleware erzeugt. Die Anfrage steht unter content bereit. Prüfungen, die zusätzliche Kontextwerte aus der Middleware benötigen, gehören in die Middleware oder einen Output-Guardrail.

Häufig gestellte Fragen

Input Guardrails laufen vor Middleware und Agent-Ausführung. Output Guardrails laufen nach der Agent-Ausführung und nach der Middleware. Blockiert eine Input-Regel, werden Agent und Before Middleware übersprungen. After Middleware läuft standardmäßig trotzdem, sofern run_after_on_block nicht auf false gesetzt ist.

Block stoppt die Verarbeitung und gibt die konfigurierte Ablehnungsantwort zurück; bei einem Output Block wird die unsichere Antwort ersetzt. Warn protokolliert einen Verstoß im Trace und setzt die Verarbeitung fort. Redact ersetzt erkannte Inhalte durch typisierte Platzhalter und ist für PII-Input- sowie PII-Leakage-Output-Prüfungen verfügbar.

Integrierte Regeln erkennen Prompt Injection, personenbezogene Daten, unerlaubte Themen, Regex-Muster, die Ausgabe personenbezogener Daten oder des System-Prompts sowie Versuche, Daten nach außen zu übertragen. Weitere Prüfungen bewerten Moderation und Relevanz. Moderation und Regex lassen sich sowohl auf Eingaben als auch auf Antworten anwenden.

Ja. Eine Python-Datei unter guardrails/ entspricht namentlich der Regelkonfiguration und exportiert eine synchrone oder asynchrone Funktion check(content, context), die GuardrailResult zurückgibt.

Die Runtime erfasst und protokolliert den Traceback unter guardrail.<name> und behandelt die Exception anschließend als Verstoß. Im Modus warn läuft die Verarbeitung weiter; der standardmäßige Modus block stoppt sie und gibt die konfigurierte Ablehnungsnachricht zurück.

Ja. Jede Evaluation erscheint mit Regelname, Input- oder Output-Richtung, Provider, Status und Erkennungsdetails als Span im Run Trace. Logs eigener Guardrails werden demselben Run zugeordnet.