Wie funktioniert der Web-Crawler genau?
Zuletzt aktualisiert: 15. Mai 2026
Der KB-Web-Crawler
Statt deine Wissensbasis manuell mit Markdown zu füttern, kann der Crawler deine bestehende Website oder Help-Docs indexieren.
Setup
- Domain verifizieren (Settings → Knowledge Base → Domain hinzufügen → DNS-TXT-Record setzen)
- Start-URL eintragen (z.B. https://hilfe.deine-firma.de)
- Pfad-Filter (optional): nur unter /docs, oder /help, oder eigene Patterns
- Tiefe: maximal 3 Hops vom Seed weg (Default), bis zu 6 auf Pro
Was der Crawler tut
- Folgt internen Links ausgehend von den Seed-URLs (kein externer Crawl)
- Respektiert
robots.txt+ Meta-Robots - Extrahiert Haupt-Content (Mozilla Readability + eigener Pruner)
- Strippt Navigation, Footer, Werbung, Modal-Wrapper
- Pro Seite: erzeugt 1 Artikel + Vector-Embedding
- Folgt User-Agent:
SilentChatBot/1.0 (+https://silentchat.de/crawler)
Refresh-Intervalle
- Manuell: Settings → "Jetzt re-crawlen" startet sofort
- Automatisch: wöchentlich (Standard), täglich auf Enterprise
- Nur geänderte Seiten werden neu eingebettet (ETag + Content-Hash-Check)
Limits
| Plan | Seiten pro Domain | Domains |
|---|---|---|
| Starter | 100 | 1 |
| Growth | 500 | 3 |
| Pro | 2.000 | 10 |
| Enterprise | 10.000 | Unbegrenzt |
Häufige Probleme
- JS-rendered Pages: der Crawler nutzt einen Headless-Chrome — funktioniert. Aber Login-geschützte Inhalte sind nicht crawlbar.
- PDFs: PDFs werden separat indexiert über den Document-Upload, nicht via Crawler.
- Datenschutz: nichts mit PII darin (Forms-Confirmation-Pages etc.) sollte gecrawlt werden — Crawler hat keine Cookie-Authentifizierung.