Der Crawler

Unser Crawler, und wie Sie ihn abschalten.

Wenn SeoBoostyBot in Ihren Logs aufgetaucht ist, steht auf dieser Seite, wer ihn betreibt und wie Sie ihn stoppen. Alles, was hier steht, beschreibt den Crawler so, wie er heute läuft.

Erkennung

Woran Sie ihn erkennen.

Zwei Dinge identifizieren den Crawler. Eine User-Agent-Zeichenkette, die sich nie ändert, und eine veröffentlichte Liste der Adressen, von denen er kommt. Was sich von einer Adresse außerhalb dieser Liste SeoBoostyBot nennt, kam nicht von uns.

User Agent

SeoBoostyBot/1.0 (+https://seoboosty.com/bot)

Maschinenlesbar

Die aktuelle Liste, für alles auf Ihrer Seite, das so etwas automatisch einliest:

/bot/ips.json

Woher er kommt

Die Adressen stehen in einer Datei statt auf dieser Seite, damit jede Allow-Liste bei Ihnen den aktuellen Satz liest und keine Kopie, die inzwischen veraltet ist.

Die Datei ist die maßgebliche Quelle. Ändert sich eine Adresse, ändert sich die Datei mit ihr, und bei Ihnen muss nichts von Hand nachgezogen werden.

Was er liest

Er liest Seiten und notiert Links.

SeoBoosty sucht abgelaufene Domains, auf die etablierte Seiten weiterhin verlinken. Um sie zu finden, liest der Crawler öffentlich erreichbare Seiten und notiert, welche Seite auf welche Domain verlinkt. Mehr ist es nicht.

Was er tut

  • Er fordert Seiten an, die ohnehin öffentlich sind, genau wie ein Browser es täte
  • Er liest die Links der Seite, mit Ankertext und rel-Attribut
  • Er behält den Link, den Ankertext und die Adresse der Seite, auf der er stand

Was er nie tut

  • Ein Formular abschicken
  • Sich anmelden, mit welchen Zugangsdaten auch immer
  • Etwas kaufen oder eine Bestellung auslösen
  • Ihren Seitentext, Ihre Bilder oder Ihre Dateien speichern

Was wir behalten, sind Links und Ankertexte. Der Crawler liest Ihre Seite einmal, um sie zu finden, und wirft den Text danach weg.

Wie er sich verhält

Was er tut, wenn Ihr Server sich wehrt.

Jede Zeile unten beschreibt den Crawler, der heute in Produktion läuft, und die Zahlen stammen aus seinen eigenen Logs.

  1. 01robots.txt zuerst

    Der Crawler holt Ihre robots.txt und wendet die Disallow-Regeln an, bevor er eine Seite anfordert. In einem Zehn-Minuten-Fenster dieser Tage hat er 3.554 URLs allein wegen robots.txt ausgelassen.

  2. 02Ein 429 bremst ihn

    Der Crawler nimmt einen HTTP 429 beim Wort und geht auf diesem Host vom Gas, statt im selben Takt weiterzufragen.

  3. 03Eine Challenge viertelt sein Tempo

    Sieht eine Antwort nach Bot-Challenge oder WAF-Block aus, drosselt sich der Crawler auf diesem Host um den Faktor vier.

  4. 04Einen fehlerhaften Host lässt er liegen

    Ein Schutzschalter beobachtet die Fehler pro Host. Sobald er auslöst, lässt der Crawler diesen Host liegen, statt weiter auf ihn einzuschlagen.

  5. 05Sekunden zwischen den Anfragen

    Zwischen zwei Anfragen an dieselbe Domain lässt der Crawler Sekunden vergehen. Er hat keinen Burst-Modus und öffnet keine Flut paralleler Verbindungen gegen eine einzelne Seite.

Wie Sie ihn steuern

Zeilen zum Kopieren.

Was Sie in der robots.txt für SeoBoostyBot eintragen, greift beim nächsten Besuch des Crawlers, und er liest die robots.txt regelmäßig neu. Sie müssen uns vorher nicht schreiben.

Ihn ganz aussperren

Sobald der Crawler das gelesen hat, fordert er auf der Seite nichts mehr an.

User-agent: SeoBoostyBot
Disallow: /

Ihn bremsen

Zehn Sekunden zwischen den Anfragen an Ihre Seite. Setzen Sie die Zahl, die zu Ihrem Server passt.

User-agent: SeoBoostyBot
Crawl-delay: 10

Einen Teil der Seite sperren

Gewöhnliche Pfadregeln. Alles, was Sie auslassen, bleibt offen.

User-agent: SeoBoostyBot
Disallow: /admin/
Disallow: /search

In der Firewall blockieren

Für alle, die nicht auf das nächste Lesen der robots.txt warten wollen. Holen Sie die aktuellen Adressen und geben Sie sie direkt an Firewall oder WAF.

curl -s https://seoboosty.com/bot/ips.json | jq -r '.ipv4[]'

Schreiben Sie das Token SeoBoostyBot in die User-agent-Zeile, ohne Version und ohne URL dahinter.

Kontakt

Für alles Weitere schreiben Sie uns.

Ein Postfach nimmt alles zum Crawler entgegen, und ein Mensch liest es. Bitten Sie uns, Ihre Seite nicht mehr zu crawlen, dann hören wir auf. Begründen müssen Sie das nicht.

Kontaktformular öffnen

Fragen zum Crawler

[email protected]

Schicken Sie die Domain und ein paar Logzeilen mit, falls Sie welche haben. Das reicht meist, um zu bestätigen, dass der Verkehr von uns kam, und um zu sagen, was er dort getan hat.