Browser-Automatisierung gibt einem KI-Agenten Zugriff auf eine geöffnete Webseite, die er erfassen und bedienen kann. Der aktuelle Seitenzustand bestimmt den nächsten Schritt. Der Agent kann Daten eingeben, zwischen Tabs wechseln, Dateien verarbeiten und mehrstufige Aufgaben über die Webseite erledigen.
Was ist Browser-Automatisierung für KI-Agenten?
Browser-Automatisierung für KI-Agenten ist eine Schleife aus Erfassen, Entscheiden, Ausführen und Prüfen. Der Browser liefert den aktuellen Seitenzustand. Das KI-Modell wählt den nächsten Schritt. Ein Browser-Tool führt ihn aus und gibt den neuen Zustand für die nächste Entscheidung zurück.
Viele klassische Browser-Skripte beruhen auf vorab festgelegten Schritten und Locators. Ein Agent kann stattdessen einen neuen Schritt wählen, wenn die Seite ein anderes Steuerelement zeigt, einen Dialog öffnet oder die Aufgabe in einem neuen Tab fortsetzt. Der Browser bleibt dabei ein Werkzeug. Aufrufer oder System-Prompt geben das Ziel vor. Der Agent wählt die Aktionen und prüft, wann die Aufgabe abgeschlossen ist.
Computer-Use-Systeme arbeiten nach einem ähnlichen Muster. OpenAI beschreibt seinen Computer-Using-Agent als Schleife: Das KI-Modell sieht den aktuellen Bildschirm, gibt eine Aktion zurück und erhält nach deren Ausführung ein neues Bild. OpenAI erläutert sie in der Veröffentlichung zum Computer-Using-Agent. Browser-Agenten können zusätzlich strukturierte Seiten-Snapshots verwenden. Damit lassen sich Text und Steuerelemente direkt ansprechen, ohne jeden Schritt über Bildkoordinaten zu steuern.
Wie KI-Agenten Webseiten erfassen und bedienen
Ein Browser-Agent wiederholt vier Schritte, bis das gewünschte Ergebnis erreicht ist. Jeder Schritt baut auf dem vorherigen Ergebnis auf. Der Agent arbeitet dadurch mit der tatsächlich angezeigten Seite statt mit einer angenommenen Abfolge.
| Schritt | Was geschieht | Ergebnis des Schritts |
|---|---|---|
| Erfassen | Seitenstruktur lesen oder sichtbaren Ausschnitt aufnehmen | Text, Steuerelemente, Elementreferenzen oder Screenshot |
| Entscheiden | Die nächste passende Aktion auswählen | Ziel, Aktion und erforderlicher Wert |
| Handeln | Klicken, eingeben, auswählen, scrollen oder navigieren | Geänderte Seite, neuer Tab, Dialog oder Datei |
| Prüfen | Das Ergebnis vor dem nächsten Schritt kontrollieren | Aktueller Seitenzustand für die nächste Entscheidung |
Strukturierte Snapshots enthalten Seitentext und aktuelle Elementreferenzen wie @e1. Nach einer Navigation oder einer anderen Änderung erfasst der Agent die Seite erneut und verwendet die neuen Referenzen. Bei visuellen Oberflächen ohne geeignetes Textelement kann er stattdessen Screenshot und Maussteuerung nutzen.
Was Agenten mit einem Browser erledigen können
Wann Browser-Automatisierung das passende Werkzeug ist
Browser-Automatisierung passt, wenn die Webseite selbst die verfügbare Schnittstelle ist: bei einem angemeldeten Portal, einer dynamischen Anwendung, einem mehrstufigen Formular oder einem Ablauf über mehrere Seiten. Für öffentliche Recherche, reine Seiteninhalte oder strukturierte Operationen sind Websuche, Seitenabruf oder eine API oft besser geeignet.
| Werkzeug | Passender Einsatz | Typisches Ergebnis |
|---|---|---|
| Websuche | Relevante öffentliche Seiten finden | Titel, Links und Ergebnisausschnitte |
| Seitenabruf | Lesbare Inhalte einer bekannten öffentlichen Seite extrahieren | Bereinigter Text oder Markdown |
| API oder Verbindung | Stabile, strukturierte Operationen mit vorhandener Schnittstelle | Validierte Anfrage- und Antwortdaten |
| Browser-Automatisierung | Dynamische, angemeldete oder rein UI-basierte Abläufe | Abgeschlossene Interaktion mit neuem Zustand oder Datei |
Connic stellt Websuche, Seitenabruf und Browser-Tools bereit. Ein Agent kann dadurch für jeden Schritt den passenden Modus wählen. Die Dokumentation der Web-Tools beschreibt die Ein- und Ausgaben.
Einen Browser-Agenten mit Connic entwickeln
Ergänze die Tools des Agenten um web_browser_*. Damit stehen alle Browser-Tools bereit: Seitenaktionen, Screenshots, Tabs, Dialoge und Dateiverarbeitung. Connic öffnet und verwaltet den Browser während des Runs. Im Agentenprojekt sind dafür weder ein eigener Browserdienst noch Code zur Browser-Steuerung nötig. Die Dokumentation der Browser-Tools beschreibt die einzelnen Operationen.
Browser Automation Demo: anmelden und ein Projekt erstellen
Die Browser Automation Demo arbeitet direkt im Dashboard von Connic. Sie verbindet Browser-Aktionen mit menschlichen Eingaben: Der Nutzer liefert Anmeldedaten und Projekttitel, der Agent füllt das Formular aus und gibt Projektname und URL zurück.
- E-Mail-Adresse, Passwort und Titel des neuen Projekts über drei getrennte menschliche Eingaben abfragen.
- Die Startseite von Connic öffnen, die Anmeldung finden und sich einloggen.
- Über Deploy via CLI ein Projekt mit dem angegebenen Titel erstellen.
- Name und URL des erstellten Projekts zurückgeben.
Die vollständige Agentendatei des Templates legt diese Aufgabe fest:
version: "1.0"
name: browser-automation-demo
model: connic/gpt-5.6-sol
description: "Browser automation demo that signs in to Connic and creates a project"
system_prompt: |
Ask for the user's Connic email, password, and new project title using the
three human-input tools.
Open https://connic.co, sign in, and create a project with that title using
Deploy via CLI.
Return the created project's name and URL.
tools:
- web_browser_*
approval:
inputs:
- get_connic_email:
prompt: "Ask for the email address used to sign in to Connic."
label: "Connic account email"
- get_connic_password:
prompt: "Ask for the password used to sign in to Connic."
label: "Connic account password"
sensitive: true
- get_project_title:
prompt: "Ask for the title of the new Connic project."
label: "New project title"Jeder Eintrag unter approval.inputs erzeugt ein Tool, das den Run für eine menschliche Antwort pausiert. Das Passwort verwendet sensitive: true: Das Eingabefeld ist maskiert, und der exakte Wert wird aus erfassten Traces und Logs entfernt. Für die Anmeldung erhält das Modell das Passwort.
Die Browser Automation Demo starten
Installiere das Template mit der vollständigen Agentendatei:
pip install connic-composer-sdk
connic init browser-demo --templates=browser-automation-demoFüge es anhand des Quickstarts zu einem Connic-Projekt hinzu. Starte den Agenten manuell und lass das Eingabefeld leer. Beantworte die drei Eingabeanfragen nacheinander. Der Agent gibt Name und URL des erstellten Projekts zurück. Im Run-Trace lassen sich die Seitenbeobachtungen und Aktionen nachvollziehen.
Das Template der Browser Automation Demo enthält den vollständigen Quellcode und die Anleitung zur Einrichtung. Für eine andere Webseite lassen sich die Aufgabe im Prompt und die benötigten Eingaben anpassen.
Browserzustand über mehrere Runs wiederverwenden
Die Demo fragt die Anmeldedaten bei jedem Run neu ab. Für wiederkehrende Aufgaben kann Connic Cookies und Local Storage in einer persistenten Session speichern. Ein späterer Run kann diesen Zustand wiederverwenden und angemeldet bleiben, sofern die Webseite die Session weiterhin akzeptiert.
Jeder Run öffnet einen neuen Live-Browser. Offene Tabs, die aktuelle Seite, Elementreferenzen und Downloads werden nicht übernommen. Der Agent öffnet die benötigte URL und liest den aktuellen Seitenzustand. Die Session-Konfiguration legt fest, welche Runs den gespeicherten Browserzustand gemeinsam nutzen.
Connic hält die Seite zwischen Tool-Aufrufen verfügbar und schließt den Browser am Ende des Runs. Ist die Aufgabe früher erledigt, kann der Agent ihn direkt schließen.
Installiere die Browser Automation Demo, starte sie mit deinen Eingaben und passe den Ablauf an die gewünschte Webseite an.
Browser Automation Demo öffnen