Zum Hauptinhalt springen
Connic
Zurück zum BlogProdukt im Fokus

Browser-Automatisierung für KI-Agenten: So funktioniert sie

Erfahre, wie Browser-Automatisierung für KI-Agenten funktioniert und wie Connic Browser, Sitzungen, Tabs, Dialoge und Dateien für Agenten verwaltet.

21. September 20268 Min. LesezeitAutor: Connic Engineering

Browser-Automatisierung gibt einem KI-Agenten Zugriff auf eine geöffnete Webseite, die er erfassen und bedienen kann. Der aktuelle Seitenzustand bestimmt den nächsten Schritt. Der Agent kann Daten eingeben, zwischen Tabs wechseln, Dateien verarbeiten und mehrstufige Aufgaben über die Webseite erledigen.

Was ist Browser-Automatisierung für KI-Agenten?

Browser-Automatisierung für KI-Agenten ist eine Schleife aus Erfassen, Entscheiden, Ausführen und Prüfen. Der Browser liefert den aktuellen Seitenzustand. Das KI-Modell wählt den nächsten Schritt. Ein Browser-Tool führt ihn aus und gibt den neuen Zustand für die nächste Entscheidung zurück.

Viele klassische Browser-Skripte beruhen auf vorab festgelegten Schritten und Locators. Ein Agent kann stattdessen einen neuen Schritt wählen, wenn die Seite ein anderes Steuerelement zeigt, einen Dialog öffnet oder die Aufgabe in einem neuen Tab fortsetzt. Der Browser bleibt dabei ein Werkzeug. Aufrufer oder System-Prompt geben das Ziel vor. Der Agent wählt die Aktionen und prüft, wann die Aufgabe abgeschlossen ist.

Computer-Use-Systeme arbeiten nach einem ähnlichen Muster. OpenAI beschreibt seinen Computer-Using-Agent als Schleife: Das KI-Modell sieht den aktuellen Bildschirm, gibt eine Aktion zurück und erhält nach deren Ausführung ein neues Bild. OpenAI erläutert sie in der Veröffentlichung zum Computer-Using-Agent. Browser-Agenten können zusätzlich strukturierte Seiten-Snapshots verwenden. Damit lassen sich Text und Steuerelemente direkt ansprechen, ohne jeden Schritt über Bildkoordinaten zu steuern.

Wie KI-Agenten Webseiten erfassen und bedienen

Ein Browser-Agent wiederholt vier Schritte, bis das gewünschte Ergebnis erreicht ist. Jeder Schritt baut auf dem vorherigen Ergebnis auf. Der Agent arbeitet dadurch mit der tatsächlich angezeigten Seite statt mit einer angenommenen Abfolge.

Die vier wiederkehrenden Schritte der Browser-Automatisierung für KI-Agenten
SchrittWas geschiehtErgebnis des Schritts
ErfassenSeitenstruktur lesen oder sichtbaren Ausschnitt aufnehmenText, Steuerelemente, Elementreferenzen oder Screenshot
EntscheidenDie nächste passende Aktion auswählenZiel, Aktion und erforderlicher Wert
HandelnKlicken, eingeben, auswählen, scrollen oder navigierenGeänderte Seite, neuer Tab, Dialog oder Datei
PrüfenDas Ergebnis vor dem nächsten Schritt kontrollierenAktueller Seitenzustand für die nächste Entscheidung

Strukturierte Snapshots enthalten Seitentext und aktuelle Elementreferenzen wie @e1. Nach einer Navigation oder einer anderen Änderung erfasst der Agent die Seite erneut und verwendet die neuen Referenzen. Bei visuellen Oberflächen ohne geeignetes Textelement kann er stattdessen Screenshot und Maussteuerung nutzen.

Was Agenten mit einem Browser erledigen können

Navigieren und Formulare ausfüllen
Links folgen, Werte eingeben, Optionen auswählen, die Tastatur nutzen, durch Seiten scrollen und den neuen Zustand vor dem nächsten Schritt prüfen.
Visuelle Oberflächen bedienen
Den sichtbaren Ausschnitt erfassen und Mauskoordinaten für Steuerelemente verwenden, die sich im Screenshot leichter finden lassen als im Seiten-Snapshot.
Tabs und Dialoge verarbeiten
Nach einem Popup den neuen Tab finden, zwischen zusammengehörigen Seiten wechseln sowie JavaScript-Warnungen, Bestätigungen und Eingabedialoge annehmen oder schließen.
Dateien herunterladen und weiterverwenden
Eine Datei zur Prüfung herunterladen oder sie während derselben offenen Browsersitzung in einem anderen Upload-Feld auswählen.

Wann Browser-Automatisierung das passende Werkzeug ist

Browser-Automatisierung passt, wenn die Webseite selbst die verfügbare Schnittstelle ist: bei einem angemeldeten Portal, einer dynamischen Anwendung, einem mehrstufigen Formular oder einem Ablauf über mehrere Seiten. Für öffentliche Recherche, reine Seiteninhalte oder strukturierte Operationen sind Websuche, Seitenabruf oder eine API oft besser geeignet.

Auswahl zwischen Websuche, Seitenabruf, APIs und Browser-Automatisierung für einen KI-Agenten
WerkzeugPassender EinsatzTypisches Ergebnis
WebsucheRelevante öffentliche Seiten findenTitel, Links und Ergebnisausschnitte
SeitenabrufLesbare Inhalte einer bekannten öffentlichen Seite extrahierenBereinigter Text oder Markdown
API oder VerbindungStabile, strukturierte Operationen mit vorhandener SchnittstelleValidierte Anfrage- und Antwortdaten
Browser-AutomatisierungDynamische, angemeldete oder rein UI-basierte AbläufeAbgeschlossene Interaktion mit neuem Zustand oder Datei

Connic stellt Websuche, Seitenabruf und Browser-Tools bereit. Ein Agent kann dadurch für jeden Schritt den passenden Modus wählen. Die Dokumentation der Web-Tools beschreibt die Ein- und Ausgaben.

Einen Browser-Agenten mit Connic entwickeln

Ergänze die Tools des Agenten um web_browser_*. Damit stehen alle Browser-Tools bereit: Seitenaktionen, Screenshots, Tabs, Dialoge und Dateiverarbeitung. Connic öffnet und verwaltet den Browser während des Runs. Im Agentenprojekt sind dafür weder ein eigener Browserdienst noch Code zur Browser-Steuerung nötig. Die Dokumentation der Browser-Tools beschreibt die einzelnen Operationen.

Browser Automation Demo: anmelden und ein Projekt erstellen

Die Browser Automation Demo arbeitet direkt im Dashboard von Connic. Sie verbindet Browser-Aktionen mit menschlichen Eingaben: Der Nutzer liefert Anmeldedaten und Projekttitel, der Agent füllt das Formular aus und gibt Projektname und URL zurück.

  1. E-Mail-Adresse, Passwort und Titel des neuen Projekts über drei getrennte menschliche Eingaben abfragen.
  2. Die Startseite von Connic öffnen, die Anmeldung finden und sich einloggen.
  3. Über Deploy via CLI ein Projekt mit dem angegebenen Titel erstellen.
  4. Name und URL des erstellten Projekts zurückgeben.

Die vollständige Agentendatei des Templates legt diese Aufgabe fest:

agents/browser-automation-demo.yaml
version: "1.0"

name: browser-automation-demo
model: connic/gpt-5.6-sol
description: "Browser automation demo that signs in to Connic and creates a project"

system_prompt: |
  Ask for the user's Connic email, password, and new project title using the
  three human-input tools.
  Open https://connic.co, sign in, and create a project with that title using
  Deploy via CLI.
  Return the created project's name and URL.

tools:
  - web_browser_*

approval:
  inputs:
    - get_connic_email:
        prompt: "Ask for the email address used to sign in to Connic."
        label: "Connic account email"
    - get_connic_password:
        prompt: "Ask for the password used to sign in to Connic."
        label: "Connic account password"
        sensitive: true
    - get_project_title:
        prompt: "Ask for the title of the new Connic project."
        label: "New project title"

Jeder Eintrag unter approval.inputs erzeugt ein Tool, das den Run für eine menschliche Antwort pausiert. Das Passwort verwendet sensitive: true: Das Eingabefeld ist maskiert, und der exakte Wert wird aus erfassten Traces und Logs entfernt. Für die Anmeldung erhält das Modell das Passwort.

Die Browser Automation Demo starten

Installiere das Template mit der vollständigen Agentendatei:

pip install connic-composer-sdk
connic init browser-demo --templates=browser-automation-demo

Füge es anhand des Quickstarts zu einem Connic-Projekt hinzu. Starte den Agenten manuell und lass das Eingabefeld leer. Beantworte die drei Eingabeanfragen nacheinander. Der Agent gibt Name und URL des erstellten Projekts zurück. Im Run-Trace lassen sich die Seitenbeobachtungen und Aktionen nachvollziehen.

Das Template der Browser Automation Demo enthält den vollständigen Quellcode und die Anleitung zur Einrichtung. Für eine andere Webseite lassen sich die Aufgabe im Prompt und die benötigten Eingaben anpassen.

Browserzustand über mehrere Runs wiederverwenden

Die Demo fragt die Anmeldedaten bei jedem Run neu ab. Für wiederkehrende Aufgaben kann Connic Cookies und Local Storage in einer persistenten Session speichern. Ein späterer Run kann diesen Zustand wiederverwenden und angemeldet bleiben, sofern die Webseite die Session weiterhin akzeptiert.

Jeder Run öffnet einen neuen Live-Browser. Offene Tabs, die aktuelle Seite, Elementreferenzen und Downloads werden nicht übernommen. Der Agent öffnet die benötigte URL und liest den aktuellen Seitenzustand. Die Session-Konfiguration legt fest, welche Runs den gespeicherten Browserzustand gemeinsam nutzen.

Connic hält die Seite zwischen Tool-Aufrufen verfügbar und schließt den Browser am Ende des Runs. Ist die Aufgabe früher erledigt, kann der Agent ihn direkt schließen.

Probiere Browser-Automatisierung mit Connic aus

Installiere die Browser Automation Demo, starte sie mit deinen Eingaben und passe den Ablauf an die gewünschte Webseite an.

Browser Automation Demo öffnen

Häufig gestellte Fragen

Browser-Automatisierung für KI-Agenten ist eine Rückkopplung, in der ein Agent eine Live-Webseite erfasst, eine Aktion auswählt und ausführt und anschließend den neuen Zustand prüft. So kann er seinen nächsten Schritt beim Navigieren, Ausfüllen von Formularen, Verarbeiten von Tabs oder Dialogen und Arbeiten mit Dateien anpassen.

Eine Websuche findet relevante öffentliche Seiten. Tools zum Seitenabruf extrahieren deren Inhalte. Browser-Automatisierung bedient dagegen eine Live-Oberfläche. Sie passt zu dynamischen, angemeldeten oder rein UI-basierten Abläufen mit Klicks, Eingaben, Navigation, Tabs, Dialogen oder Downloads.

Füge web_browser_* zur Tool-Liste in der YAML-Datei des Agenten hinzu. Damit stehen alle zehn Browser-Tools bereit. Der Agent kann während eines Runs einen aktuellen Browser öffnen, die Seite erfassen, Steuerelemente bedienen, Tabs und Dialoge verarbeiten, Dateien handhaben und den Browser am Ende schließen.

Mit aktivierter Browser-Persistenz stehen Cookies und Local Storage in späteren Runs derselben Connic-Session bereit. Jeder Run öffnet trotzdem einen neuen Live-Browser. Aktuelle Seite, Tabs, Elementreferenzen und heruntergeladene Dateien bleiben daher nicht über mehrere Runs erhalten.

Ja. Der Agent kann über ein referenziertes Steuerelement eine Datei bis 25 MiB herunterladen und sie optional als Anhang erhalten. Während derselben offenen Browsersitzung kann er die Download-ID verwenden, um diese Datei in einem Upload-Feld auszuwählen. Ein beliebiger lokaler Pfad aus dem Deployment wird nicht unterstützt.

Mehr aus dem Blog

Produkt im Fokus

Connic Run Context: Agenten mit den richtigen Daten ausführen

Connic Run Context hält selbst definierte Daten für Middleware und Tools bereit, ohne dass die KI sie kennen oder als Argumente übergeben muss.

8. September 202610 Min. Lesezeit
Produkt im Fokus

KI-Agenten-Routing: Agenten auslösen und Ergebnisse zurückgeben

Connic leitet externe Events an Agenten weiter und liefert Ergebnisse synchron oder über asynchrone Outbound-Verbindungen an das Zielsystem.

24. August 20269 Min. Lesezeit
Produkt im Fokus

Von Staging zum Produktivbetrieb: So isolieren Connic Environments KI-Agenten

Connic Environments ordnen Git-Branches isolierten Deployments mit eigenen Secrets, Verbindungen, Budgets und Run History zu. So können verschiedene Agenten und Codeversionen unabhängig voneinander bereitgestellt werden.

6. August 20268 Min. Lesezeit
Produkt im Fokus

LLM-Kontextkomprimierung für lang laufende KI-Agenten

Connic komprimiert ältere Gesprächsverläufe und übergroße Tool-Ergebnisse. Danach wiederholt die Runtime den KI-Modell-Aufruf, damit lange Agentensitzungen das Kontextlimit nicht überschreiten.

20. Juli 20268 Min. Lesezeit
Produkt im Fokus

Connic Tests: Regressionen vor dem Produktivbetrieb erkennen

Ein YAML-basiertes Testframework für KI-Agenten mit schwankenden Ergebnissen: wiederholte Testläufe, flexible Assertions, Mocks und multimodale Fixtures. Fehlgeschlagene Tests blockieren standardmäßig das Deployment.

6. Mai 20268 Min. Lesezeit
Produkt im Fokus

Human-in-the-Loop: Freigaben und sichere Eingaben für KI-Agenten

Connic-Agenten pausieren für Freigaben und Eingaben: Konfiguration, Schutz sensibler Antworten und Tests für Freigabe, Ablehnung und Timeout im Überblick.

5. April 202614 Min. Lesezeit
Produkt im Fokus

KI-Agenten absichern: Checkliste für den Produktivbetrieb

Sicherheitscheckliste für KI-Agenten mit ENISA-Befunden von 2026: Tool-Rechte, Freigaben, Logging und Maßnahmen bei Sicherheitsvorfällen in kritischen Sektoren.

21. März 202616 Min. Lesezeit
Produkt im Fokus

Guardrails für KI-Agenten: Sicherheit in Echtzeit

Connic Guardrails prüfen Ein- und Ausgaben von Agenten in Echtzeit, blockieren Prompt Injection, maskieren PII und setzen Themenbeschränkungen durch.

3. März 20269 Min. Lesezeit
Produkt im Fokus

Composer SDK: Bessere Werkzeuge für die Agentenentwicklung

Das Composer SDK automatisiert Projektgerüst und Validierung und unterstützt Cloud-gestützte Hot-Reload-Entwicklung sowie Deployments per CLI.

27. Dezember 20255 Min. Lesezeit