SilentChat

Wie funktioniert der Web-Crawler genau?

Zuletzt aktualisiert: 15. Mai 2026

Der KB-Web-Crawler

Statt deine Wissensbasis manuell mit Markdown zu füttern, kann der Crawler deine bestehende Website oder Help-Docs indexieren.

Setup

  1. Domain verifizieren (Settings → Knowledge Base → Domain hinzufügen → DNS-TXT-Record setzen)
  2. Start-URL eintragen (z.B. https://hilfe.deine-firma.de)
  3. Pfad-Filter (optional): nur unter /docs, oder /help, oder eigene Patterns
  4. Tiefe: maximal 3 Hops vom Seed weg (Default), bis zu 6 auf Pro

Was der Crawler tut

  • Folgt internen Links ausgehend von den Seed-URLs (kein externer Crawl)
  • Respektiert robots.txt + Meta-Robots
  • Extrahiert Haupt-Content (Mozilla Readability + eigener Pruner)
  • Strippt Navigation, Footer, Werbung, Modal-Wrapper
  • Pro Seite: erzeugt 1 Artikel + Vector-Embedding
  • Folgt User-Agent: SilentChatBot/1.0 (+https://silentchat.de/crawler)

Refresh-Intervalle

  • Manuell: Settings → "Jetzt re-crawlen" startet sofort
  • Automatisch: wöchentlich (Standard), täglich auf Enterprise
  • Nur geänderte Seiten werden neu eingebettet (ETag + Content-Hash-Check)

Limits

PlanSeiten pro DomainDomains
Starter1001
Growth5003
Pro2.00010
Enterprise10.000Unbegrenzt

Häufige Probleme

  • JS-rendered Pages: der Crawler nutzt einen Headless-Chrome — funktioniert. Aber Login-geschützte Inhalte sind nicht crawlbar.
  • PDFs: PDFs werden separat indexiert über den Document-Upload, nicht via Crawler.
  • Datenschutz: nichts mit PII darin (Forms-Confirmation-Pages etc.) sollte gecrawlt werden — Crawler hat keine Cookie-Authentifizierung.
Wie funktioniert der Web-Crawler genau? — Help Center — SilentChat | SilentChat