Der Crawler
Unser Crawler, und wie Sie ihn abschalten.
Wenn SeoBoostyBot in Ihren Logs aufgetaucht ist, steht auf dieser Seite, wer ihn betreibt und wie Sie ihn stoppen. Alles, was hier steht, beschreibt den Crawler so, wie er heute läuft.
Erkennung
Woran Sie ihn erkennen.
Zwei Dinge identifizieren den Crawler. Eine User-Agent-Zeichenkette, die sich nie ändert, und eine veröffentlichte Liste der Adressen, von denen er kommt. Was sich von einer Adresse außerhalb dieser Liste SeoBoostyBot nennt, kam nicht von uns.
User Agent
SeoBoostyBot/1.0 (+https://seoboosty.com/bot)Maschinenlesbar
Die aktuelle Liste, für alles auf Ihrer Seite, das so etwas automatisch einliest:
/bot/ips.jsonWoher er kommt
Die Adressen stehen in einer Datei statt auf dieser Seite, damit jede Allow-Liste bei Ihnen den aktuellen Satz liest und keine Kopie, die inzwischen veraltet ist.
Die Datei ist die maßgebliche Quelle. Ändert sich eine Adresse, ändert sich die Datei mit ihr, und bei Ihnen muss nichts von Hand nachgezogen werden.
Was er liest
Er liest Seiten und notiert Links.
SeoBoosty sucht abgelaufene Domains, auf die etablierte Seiten weiterhin verlinken. Um sie zu finden, liest der Crawler öffentlich erreichbare Seiten und notiert, welche Seite auf welche Domain verlinkt. Mehr ist es nicht.
Was er tut
- Er fordert Seiten an, die ohnehin öffentlich sind, genau wie ein Browser es täte
- Er liest die Links der Seite, mit Ankertext und rel-Attribut
- Er behält den Link, den Ankertext und die Adresse der Seite, auf der er stand
Was er nie tut
- Ein Formular abschicken
- Sich anmelden, mit welchen Zugangsdaten auch immer
- Etwas kaufen oder eine Bestellung auslösen
- Ihren Seitentext, Ihre Bilder oder Ihre Dateien speichern
Was wir behalten, sind Links und Ankertexte. Der Crawler liest Ihre Seite einmal, um sie zu finden, und wirft den Text danach weg.
Wie er sich verhält
Was er tut, wenn Ihr Server sich wehrt.
Jede Zeile unten beschreibt den Crawler, der heute in Produktion läuft, und die Zahlen stammen aus seinen eigenen Logs.
01robots.txt zuerst
Der Crawler holt Ihre robots.txt und wendet die Disallow-Regeln an, bevor er eine Seite anfordert. In einem Zehn-Minuten-Fenster dieser Tage hat er 3.554 URLs allein wegen robots.txt ausgelassen.
02Ein 429 bremst ihn
Der Crawler nimmt einen HTTP 429 beim Wort und geht auf diesem Host vom Gas, statt im selben Takt weiterzufragen.
03Eine Challenge viertelt sein Tempo
Sieht eine Antwort nach Bot-Challenge oder WAF-Block aus, drosselt sich der Crawler auf diesem Host um den Faktor vier.
04Einen fehlerhaften Host lässt er liegen
Ein Schutzschalter beobachtet die Fehler pro Host. Sobald er auslöst, lässt der Crawler diesen Host liegen, statt weiter auf ihn einzuschlagen.
05Sekunden zwischen den Anfragen
Zwischen zwei Anfragen an dieselbe Domain lässt der Crawler Sekunden vergehen. Er hat keinen Burst-Modus und öffnet keine Flut paralleler Verbindungen gegen eine einzelne Seite.
Wie Sie ihn steuern
Zeilen zum Kopieren.
Was Sie in der robots.txt für SeoBoostyBot eintragen, greift beim nächsten Besuch des Crawlers, und er liest die robots.txt regelmäßig neu. Sie müssen uns vorher nicht schreiben.
Ihn ganz aussperren
Sobald der Crawler das gelesen hat, fordert er auf der Seite nichts mehr an.
User-agent: SeoBoostyBot
Disallow: /Ihn bremsen
Zehn Sekunden zwischen den Anfragen an Ihre Seite. Setzen Sie die Zahl, die zu Ihrem Server passt.
User-agent: SeoBoostyBot
Crawl-delay: 10Einen Teil der Seite sperren
Gewöhnliche Pfadregeln. Alles, was Sie auslassen, bleibt offen.
User-agent: SeoBoostyBot
Disallow: /admin/
Disallow: /searchIn der Firewall blockieren
Für alle, die nicht auf das nächste Lesen der robots.txt warten wollen. Holen Sie die aktuellen Adressen und geben Sie sie direkt an Firewall oder WAF.
curl -s https://seoboosty.com/bot/ips.json | jq -r '.ipv4[]'Schreiben Sie das Token SeoBoostyBot in die User-agent-Zeile, ohne Version und ohne URL dahinter.
Kontakt
Für alles Weitere schreiben Sie uns.
Ein Postfach nimmt alles zum Crawler entgegen, und ein Mensch liest es. Bitten Sie uns, Ihre Seite nicht mehr zu crawlen, dann hören wir auf. Begründen müssen Sie das nicht.
Kontaktformular öffnenFragen zum Crawler
[email protected]
Schicken Sie die Domain und ein paar Logzeilen mit, falls Sie welche haben. Das reicht meist, um zu bestätigen, dass der Verkehr von uns kam, und um zu sagen, was er dort getan hat.