Краулер
Наш краулер и как его выключить.
Если SeoBoostyBot попал к вам в логи, здесь написано, кто его запускает и как его остановить. Всё, что написано ниже, описывает краулер таким, какой он сегодня и есть.
Опознание
Как его узнать.
Опознаётся он по двум вещам: по строке user agent, которая никогда не меняется, и по опубликованному списку адресов, с которых он приходит. Всё, что называет себя SeoBoostyBot с адреса вне этого списка, пришло не от нас.
User-agent
SeoBoostyBot/1.0 (+https://seoboosty.com/bot)Откуда он приходит
Адреса лежат в файле, а не напечатаны на этой странице, чтобы любой белый список на вашей стороне читал актуальный набор, а не копию, которая успела устареть.
Файл это источник истины. Если адрес когда-нибудь изменится, файл изменится вместе с ним, и у вас руками править ничего не придётся.
Что он читает
Он читает страницы и записывает ссылки.
SeoBoosty ищет истёкшие домены, на которые до сих пор ссылаются солидные сайты. Чтобы их найти, краулер читает открытые страницы и записывает, какая страница на какой домен ссылается. Вся работа на этом заканчивается.
Что он делает
- Запрашивает страницы, которые и так открыты, ровно как это делает браузер
- Читает ссылки на странице вместе с анкором и атрибутом rel
- Сохраняет ссылку, анкор и адрес страницы, где она стояла
Что он не делает никогда
- Отправлять формы
- Пробовать войти под какими бы то ни было данными
- Покупать что-либо и оформлять заказы
- Сохранять ваш текст, ваши картинки и ваши файлы
Храним мы ссылки и анкоры. Страницу краулер читает один раз, чтобы их найти, и текст после этого выбрасывает.
Как себя ведёт
Что он делает, когда сервер упирается.
Каждая строка ниже описывает краулер, который работает в проде прямо сейчас, а цифры взяты из его собственных логов.
01Сначала robots.txt
Краулер забирает ваш robots.txt и применяет правила Disallow до того, как запросит страницу. В одном из недавних десятиминутных срезов он пропустил 3 554 адреса только по robots.txt.
02429 его тормозит
Ответ 429 краулер принимает всерьёз и сбавляет темп на этом хосте, вместо того чтобы повторять запрос с прежней частотой.
03Антибот-проверка режет темп вчетверо
Если ответ похож на антибот-проверку или на блок от WAF, краулер снижает частоту на этом хосте в четыре раза.
04От проблемного хоста он уходит
Предохранитель следит за ошибками по каждому хосту. Как только он срабатывает, краулер бросает хост, вместо того чтобы долбить его дальше.
05Между запросами секунды
К одному домену краулер ходит с паузой в секунды. Никаких залпов и никакого вала параллельных соединений к одному сайту.
Как им управлять
Строки, которые можно скопировать.
Что вы напишете в robots.txt для SeoBoostyBot, подействует на ближайшем заходе краулера. robots.txt он перечитывает регулярно, так что писать нам заранее не нужно.
Закрыть всё
Как только краулер это прочитает, он перестанет запрашивать на сайте что-либо.
User-agent: SeoBoostyBot
Disallow: /Замедлить
Десять секунд между запросами к вашему сайту. Ставьте любое число, какое подходит серверу.
User-agent: SeoBoostyBot
Crawl-delay: 10Закрыть часть сайта
Обычные правила по путям. Всё, что вы не перечислили, остаётся открытым.
User-agent: SeoBoostyBot
Disallow: /admin/
Disallow: /searchЗаблокировать на файрволе
Для тех, кто не хочет ждать следующего чтения robots.txt. Заберите актуальные адреса и передайте их прямо в файрвол или WAF.
curl -s https://seoboosty.com/bot/ips.json | jq -r '.ipv4[]'В строке User-agent пишите токен SeoBoostyBot, без версии и без адреса после него.
Связаться
Всё остальное пишите нам.
Всё про краулер идёт в один ящик, и читает его человек. Попросите не ходить к вам на сайт, и мы перестанем. Объяснять причину не нужно.
Открыть форму связиВопросы про краулер
[email protected]
Пришлите домен и несколько строк из лога, если они есть. Обычно этого хватает, чтобы подтвердить, что трафик наш, и сказать, чем он у вас занимался.