Zum Hauptinhalt springen
Connic

Website-Crawler

Von Connic

Übertrage Websites in das Retrieval von Agenten

WebsiteAutomatischer Sync

So funktioniert die Website-Crawler Source

Ein großer Teil des Wissens, das Agenten benötigen, ist bereits öffentlich verfügbar: Dokumentationen, Help Center, Changelogs oder Produktseiten. Der Website-Crawler erfasst diese Inhalte. Eine Start-URL und Crawl-Grenzen bestimmen den Umfang; Connic hält die Inhalte mit dem Retrieval synchron, ohne dass ein eigener Scraper betrieben werden muss.

Jede Seite wird in bereinigtes Markdown umgewandelt, wobei Navigation und wiederkehrende Seitenelemente entfernt werden. Anschließend wird sie wie jeder andere Retrieval-Eintrag in Chunks aufgeteilt und eingebettet. Erneute Crawls laufen nach dem festgelegten Zeitplan und verarbeiten nur Seiten erneut, deren Inhalt sich geändert hat.

Das wird synchronisiert

Seiten

Gerenderte Seiteninhalte werden in bereinigtes Markdown umgewandelt und von Menüs und wiederkehrenden Seitenelementen befreit.

Verlinkte Seiten

Der Crawler folgt Links innerhalb des festgelegten Umfangs bis zur konfigurierten Tiefe.

Sitemap-Dateien

Wenn eine sitemap.xml vorhanden ist, wird sie verwendet, um Seiten schneller und vollständiger zu finden.

Konfiguration im Detail

Alle Einstellungen zum Verbinden von Website-Crawler mit einem Projekt.

Crawl-Umfang

Start-URL*
Ausgangspunkt des Crawls, zum Beispiel die Startseite der Dokumentation.
Grenzen
Wie weit der Crawler Links von der Start-URL aus folgen darf.
Einzuschließende Pfade
Crawle nur URLs, die diesen durch Kommas getrennten Pfadmustern entsprechen. Lass das Feld leer, um keine Einschränkung festzulegen.
Auszuschließende Pfade
Überspringe URLs, die diesen durch Kommas getrennten Pfadmustern entsprechen.
Maximale Seitenzahl
Obergrenze der Seiten pro Crawl.
Maximale Linktiefe
Wie viele Linkebenen der Crawler von der Start-URL aus verfolgen darf.
sitemap.xml verwenden
Finde Seiten über die Sitemap der Website, wenn eine vorhanden ist.

Berechtigung

Berechtigung zum Crawlen dieser URLs bestätigen*
Bestätige, dass dir die Seiten unter diesen URLs gehören oder du anderweitig berechtigt bist, ihre Inhalte zu crawlen und zu übernehmen.

Synchronisierungsverhalten

Wo synchronisierte Inhalte abgelegt werden und wie häufig sie aktualisiert werden.

Ziel-Namespace
Der Retrieval-Namespace legt fest, unter welchem Namen die synchronisierten Einträge abgelegt werden. Verwende Punkte für Verschachtelungen, z. B. sources.website.
Synchronisierungsintervall
Wie häufig die Quelle auf Änderungen geprüft wird. Bei jedem Lauf werden nur geänderte Inhalte erneut verarbeitet.
Wenn Inhalte an der Quelle gelöscht werden
Seiten, die von der Website verschwinden, können beim nächsten Crawl aus dem Retrieval entfernt oder in der zuletzt gecrawlten Version beibehalten werden.

Informationen

Publisher
Von Connic
Typ
Website
Sync-Zeitplan
Alle 12 Stunden bis wöchentlich
Dokumentation
Retrieval-Docs

Website-Crawler Retrieval Source FAQ

Ausgehend von der konfigurierten URL folgt der Crawler Links innerhalb der festgelegten Grenzen, wandelt jede Seite in bereinigtes Markdown um und übergibt das Ergebnis an die Ingestion-Pipeline von Connic, die daraus Chunks und Embeddings erstellt.

Ja. Konfigurierbar sind die Crawl-Grenze (Startpfad, Domain oder Subdomains), ein- und auszuschließende Pfadmuster, eine Seitenobergrenze und eine maximale Linktiefe.

Nein. Connic führt den Crawl nach dem festgelegten Zeitplan aus. Es muss nichts gehostet werden, und die Crawling-Engine verarbeitet auch mit JavaScript gerenderte Seiten.

Je nach festgelegtem Zeitplan alle 12 Stunden, täglich oder wöchentlich. Erneute Crawls verarbeiten nur Seiten mit geändertem Inhalt, sodass auch häufige Zeitpläne kostengünstig bleiben.
Verbinde Website-Crawler mit Connic für aktuelle Agenten-Antworten

Beschreibe, wo die Inhalte liegen, wie aktuell sie sein müssen und wer darauf zugreifen darf. Unser Team hilft bei der Auswahl der Quellen, Namespaces und der passenden Retrieval-Konfiguration.

Sprich mit Sales