El rastreador

Nuestro rastreador, y cómo apagarlo.

Si SeoBoostyBot ha aparecido en tus logs, esta página te dice quién lo opera y cómo pararlo. Todo lo que aquí se publica describe el rastreador tal y como funciona hoy.

Identidad

Cómo reconocerlo.

Dos cosas identifican al rastreador: una cadena de user agent que no cambia nunca y una lista publicada de las direcciones desde las que llega. Cualquier cosa que se llame SeoBoostyBot desde una dirección que no esté en esa lista no ha salido de aquí.

User agent

SeoBoostyBot/1.0 (+https://seoboosty.com/bot)

Legible por máquina

La lista actual, para cualquier cosa de tu lado que necesite leerla:

/bot/ips.json

Desde dónde llega

Las direcciones se publican como fichero en vez de imprimirse en esta página, para que cualquier cosa de tu lado que mantenga una lista de permitidos lea el conjunto actual y no una copia que se ha quedado vieja.

El fichero es la fuente de verdad. Si alguna dirección cambia, el fichero cambia con ella y en tu lado no hay que editar nada a mano.

Qué lee

Lee páginas y anota enlaces.

SeoBoosty busca dominios expirados que sitios asentados siguen enlazando. Para encontrarlos, el rastreador lee páginas de acceso público y anota qué página enlaza a qué dominio. Ese es todo el trabajo.

Lo que hace

  • Pide páginas que ya son públicas, igual que haría un navegador
  • Lee los enlaces de la página, con su anchor text y su atributo rel
  • Guarda el enlace, el anchor text y la dirección de la página donde estaba

Lo que no hace nunca

  • Enviar un formulario
  • Intentar iniciar sesión, con las credenciales que sean
  • Comprar nada ni hacer ningún pedido
  • Almacenar el texto de tu página, tus imágenes o tus ficheros

Lo que guardamos son enlaces y anchor text. El rastreador lee tu página una vez para encontrarlos y después tira el texto.

Cómo se comporta

Qué hace cuando tu servidor le planta cara.

Cada línea de abajo describe el rastreador tal y como corre hoy en producción, y las cifras salen de sus propios logs.

  1. 01Lee robots.txt primero

    El rastreador descarga tu robots.txt y aplica las reglas Disallow antes de pedir ninguna página. En una ventana reciente de diez minutos se saltó 3.554 URLs solo por robots.txt.

  2. 02Un 429 lo frena

    El rastreador se toma en serio un HTTP 429 y afloja con ese host, en vez de reintentar al mismo ritmo.

  3. 03Un desafío le baja el ritmo a la cuarta parte

    Cuando una respuesta parece un desafío antibot o un bloqueo de WAF, el rastreador se frena cuatro veces sobre ese host.

  4. 04Se marcha de un host que falla

    Un cortacircuitos vigila los errores por host. En cuanto salta, el rastreador abandona ese host en vez de seguir aporreándolo.

  5. 05Segundos entre peticiones

    El rastreador deja segundos entre peticiones al mismo dominio. No tiene modo ráfaga y no abre una avalancha de conexiones en paralelo contra un solo sitio.

Cómo controlarlo

Líneas que puedes pegar.

Lo que pongas en robots.txt para SeoBoostyBot surte efecto en la siguiente visita del rastreador, y él relee robots.txt con regularidad. No hace falta que nos escribas antes.

Bloquearlo del todo

En cuanto el rastreador lea esto, no pide nada del sitio.

User-agent: SeoBoostyBot
Disallow: /

Frenarlo

Diez segundos entre peticiones a tu sitio. Pon el número que le venga bien a tu servidor.

User-agent: SeoBoostyBot
Crawl-delay: 10

Bloquear una parte del sitio

Reglas de ruta normales. Todo lo que dejes fuera sigue abierto.

User-agent: SeoBoostyBot
Disallow: /admin/
Disallow: /search

Bloquearlo en el firewall

Para quien prefiera no esperar a la siguiente lectura de robots.txt. Descarga las direcciones actuales y pásalas directas a tu firewall o a tu WAF.

curl -s https://seoboosty.com/bot/ips.json | jq -r '.ipv4[]'

Escribe el token SeoBoostyBot en la línea User-agent, sin versión y sin ninguna URL detrás.

Contacto

Para cualquier otra cosa, escríbenos.

Un solo buzón recoge todo lo del rastreador y lo lee una persona. Pídenos que dejemos de rastrear tu sitio y paramos, y no hace falta que expliques por qué.

Abrir el formulario de contacto

Preguntas sobre el rastreador

[email protected]

Mándanos el dominio y unas cuantas líneas de log si las tienes. Con eso suele bastar para confirmar que el tráfico era nuestro y decirte qué estaba haciendo.