Website-Crawler
Übertrage Websites in das Retrieval von Agenten
So funktioniert die Website-Crawler Source
Ein großer Teil des Wissens, das Agenten benötigen, ist bereits öffentlich verfügbar: Dokumentationen, Help Center, Changelogs oder Produktseiten. Der Website-Crawler erfasst diese Inhalte. Eine Start-URL und Crawl-Grenzen bestimmen den Umfang; Connic hält die Inhalte mit dem Retrieval synchron, ohne dass ein eigener Scraper betrieben werden muss.
Jede Seite wird in bereinigtes Markdown umgewandelt, wobei Navigation und wiederkehrende Seitenelemente entfernt werden. Anschließend wird sie wie jeder andere Retrieval-Eintrag in Chunks aufgeteilt und eingebettet. Erneute Crawls laufen nach dem festgelegten Zeitplan und verarbeiten nur Seiten erneut, deren Inhalt sich geändert hat.
Das wird synchronisiert
Seiten
Gerenderte Seiteninhalte werden in bereinigtes Markdown umgewandelt und von Menüs und wiederkehrenden Seitenelementen befreit.
Verlinkte Seiten
Der Crawler folgt Links innerhalb des festgelegten Umfangs bis zur konfigurierten Tiefe.
Sitemap-Dateien
Wenn eine sitemap.xml vorhanden ist, wird sie verwendet, um Seiten schneller und vollständiger zu finden.
Konfiguration im Detail
Alle Einstellungen zum Verbinden von Website-Crawler mit einem Projekt.
Crawl-Umfang
- Start-URL*
- Ausgangspunkt des Crawls, zum Beispiel die Startseite der Dokumentation.
- Grenzen
- Wie weit der Crawler Links von der Start-URL aus folgen darf.
- Einzuschließende Pfade
- Crawle nur URLs, die diesen durch Kommas getrennten Pfadmustern entsprechen. Lass das Feld leer, um keine Einschränkung festzulegen.
- Auszuschließende Pfade
- Überspringe URLs, die diesen durch Kommas getrennten Pfadmustern entsprechen.
- Maximale Seitenzahl
- Obergrenze der Seiten pro Crawl.
- Maximale Linktiefe
- Wie viele Linkebenen der Crawler von der Start-URL aus verfolgen darf.
- sitemap.xml verwenden
- Finde Seiten über die Sitemap der Website, wenn eine vorhanden ist.
Berechtigung
- Berechtigung zum Crawlen dieser URLs bestätigen*
- Bestätige, dass dir die Seiten unter diesen URLs gehören oder du anderweitig berechtigt bist, ihre Inhalte zu crawlen und zu übernehmen.
Synchronisierungsverhalten
Wo synchronisierte Inhalte abgelegt werden und wie häufig sie aktualisiert werden.
- Ziel-Namespace
- Der Retrieval-Namespace legt fest, unter welchem Namen die synchronisierten Einträge abgelegt werden. Verwende Punkte für Verschachtelungen, z. B. sources.website.
- Synchronisierungsintervall
- Wie häufig die Quelle auf Änderungen geprüft wird. Bei jedem Lauf werden nur geänderte Inhalte erneut verarbeitet.
- Wenn Inhalte an der Quelle gelöscht werden
- Seiten, die von der Website verschwinden, können beim nächsten Crawl aus dem Retrieval entfernt oder in der zuletzt gecrawlten Version beibehalten werden.
Informationen
- Publisher
- Von Connic
- Kategorie
- Retrieval Sources
- Typ
- Website
- Sync-Zeitplan
- Alle 12 Stunden bis wöchentlich
- Dokumentation
- Retrieval-Docs
Website-Crawler Retrieval Source FAQ
Beschreibe, wo die Inhalte liegen, wie aktuell sie sein müssen und wer darauf zugreifen darf. Unser Team hilft bei der Auswahl der Quellen, Namespaces und der passenden Retrieval-Konfiguration.
Sprich mit Sales