Web Crawler
Der Web Crawler importiert automatisch Inhalte von Webseiten in Ihre Knowledge Base. Ideal wenn Sie bereits eine bestehende Dokumentation oder FAQ-Seite haben.
Voraussetzungen
- KB Crawler Feature muss in Ihrem Plan aktiviert sein
- Die Ziel-Website muss öffentlich erreichbar sein
URLs crawlen
- Knowledge Base → Crawler → "URLs crawlen"
- Geben Sie eine oder mehrere URLs ein (eine pro Zeile)
- Klicken Sie "Crawlen starten"
- Der Crawler lädt die Seiten, extrahiert den Text und erstellt Artikel
Sitemap importieren
Für größere Websites:
- Knowledge Base → Crawler → "Sitemap importieren"
- Geben Sie die Sitemap-URL ein (z.B.
https://example.com/sitemap.xml) - Der Crawler findet automatisch alle Seiten und importiert sie
Crawl-Quellen verwalten
Unter Crawler → Quellen sehen Sie alle konfigurierten URLs:
| Spalte | Beschreibung |
|---|---|
| URL | Die gecrawlte URL |
| Status | Active / Disabled |
| Letzter Crawl | Wann die URL zuletzt gecrawlt wurde |
| Content Hash | Änderungserkennung — nur geänderte Inhalte werden aktualisiert |
Auto-Recrawl
Wenn in Ihrem Plan Auto-Recrawl aktiviert ist, werden Quellen automatisch in einem konfigurierbaren Intervall (z.B. alle 7 Tage) erneut gecrawlt. So bleibt Ihre KB aktuell.
Konfiguration: Der Auto-Recrawl-Intervall wird im Plan unter kb_auto_recrawl_days festgelegt.
Robots.txt
Der Crawler respektiert die robots.txt-Datei der Ziel-Website. Seiten die dort gesperrt sind, werden nicht gecrawlt. Der Robots-Cache wird automatisch aktualisiert.
Limits
| Plan | Max. gecrawlte Seiten |
|---|---|
| Growth | 100 |
| Professional | 500 |
| Enterprise | Unbegrenzt |
Crawl-Jobs
Unter Crawler → Jobs sehen Sie den Status laufender und abgeschlossener Crawl-Vorgänge. Jobs können abgebrochen werden.