Обычные сканирующие боты, которые просто запрашивают страницы сайта, сами по себе не должны ухудшать поведенческие сигналы сайта. Они могут заметно искажать данные веб-аналитики, если система не распознаёт их как роботов, но искажение отчёта и ухудшение ранжирования — не одно и то же.
Почему обычный обход сайта не равен поведению пользователя
При сканировании бот отправляет HTTP-запросы к страницам. Многие краулеры вообще не исполняют JavaScript, поэтому установленный на сайте счётчик аналитики может не зафиксировать такой запрос как визит.
Другие боты используют браузерные движки, исполняют JavaScript и способны попасть в статистику. Яндекс Метрика разделяет обычные визиты и роботный трафик: известных роботов она определяет по техническим признакам, а часть маскирующихся роботов — по их поведению.
Поэтому возможна ситуация, когда в серверных логах видно много обходов, но в Метрике они практически не меняют посещаемость. Возможен и обратный вариант: плохо определяемые боты попадают в отчёты и ухудшают показатель отказов, глубину просмотра или время на сайте.
На ресурсе со 100 реальными посетителями в сутки даже несколько десятков учтённых роботных визитов уже способны заметно изменить отображаемые средние показатели. Это проблема качества аналитики, а не автоматическое доказательство ухудшения SEO.
Когда боты могут затронуть поисковые сигналы
Нужно разделять обычное сканирование и имитацию пользователей.
К обычному сканированию относятся поисковые роботы, парсеры, сервисы мониторинга, анализаторы ссылок и другие программы, которые просто обращаются к URL. Такой обход не превращается в негативный поведенческий сигнал только потому, что бот быстро открыл страницу и ушёл.
Другая ситуация — программы, специально имитирующие пользователей: выполняют запросы в поисковой системе, переходят на определённый результат, просматривают страницы и совершают другие действия. Яндекс прямо относит такую имитацию действий пользователей к поисковому спаму.
Поэтому двадцать обычных краулеров и двадцать ботов, эмулирующих переходы из поисковой выдачи, — принципиально разные виды трафика.
Нельзя также считать показатель отказов или среднее время из Метрики точной копией сигналов, которые поисковая система использует при ранжировании. Метрики аналитической системы предназначены прежде всего для анализа сайта владельцем. По одному изменению отказов в отчёте нельзя установить, что позиции должны измениться в ту же сторону.
Google также отдельно указывает, что интенсивность обхода сайта роботами не является сигналом ранжирования: более частое сканирование само по себе не повышает и не понижает позиции.
Реальный SEO-риск — нагрузка на сервер
Бот-трафик способен повлиять на поиск косвенно, если он создаёт настолько большую нагрузку, что сайт начинает медленно отвечать, выдавать ошибки 5xx, таймауты или ограничивать доступ поисковым роботам.
Поэтому считать только количество разных ботов неправильно. Один агрессивный парсер может сделать больше запросов, чем десятки нормальных краулеров вместе.
Нужно смотреть:
- количество HTTP-запросов от роботов;
- запросы в минуту;
- какие URL они обходят;
- долю ответов 4xx и 5xx;
- нагрузку на процессор и базу данных;
- время ответа сервера;
- объём переданного трафика.
Если сайт нормально работает и несколько десятков роботов в сутки не создают заметной нагрузки, бороться с ними ради «поведенческих факторов» нет смысла.
Как проверить влияние ботов
Сначала откройте в Яндекс Метрике отчёт «Мониторинг → Роботы». Сравните данные с роботами и без них. Если после исключения роботов показатель отказов, глубина просмотра или другие показатели значительно меняются, бот-трафик действительно загрязняет аналитику.
Затем проверьте серверные access-логи. Они покажут обращения, которых вообще может не быть в Метрике. Смотрите User-Agent, IP, URL, частоту запросов и HTTP-статусы.
Отдельно проверьте источник подозрительных визитов. Простые прямые обращения к URL и массовый обход страниц не равнозначны имитации поискового поведения. Повод для более серьёзной проверки возникает, если неизвестные автоматизированные посетители изображают переходы из поисковой выдачи и действия обычных пользователей.
Блокировать Googlebot, Яндекс робота и другие необходимые поисковые краулеры ради улучшения поведенческих показателей не нужно. Для агрессивных сторонних ботов разумнее использовать ограничения частоты запросов, правила веб-сервера или WAF, предварительно убедившись, что под блокировку не попадают нужные поисковые роботы.
При посещаемости около 100 человек в сутки главный вопрос не в количестве названий ботов в логах, а в том, попадают ли их действия в пользовательскую статистику и создают ли они заметную нагрузку. Если нет ни одного из этих эффектов, обычное сканирование сайта можно игнорировать.