Ржанский Д.

Нужно ли индексировать PDF-файлы на сайте?

Нужно ли индексировать PDF-файлы на сайте, когда они полезны для поиска, когда создают дубли и как корректно исключить их из индекса.

Дмитрий Ржанский Дмитрий Ржанский 1 просмотров

PDF не нужно автоматически закрывать от индекса: полезные самостоятельные документы стоит оставлять индексируемыми, а дубли, устаревшие версии и технические файлы — исключать.

Google и Яндекс умеют индексировать PDF как отдельные документы. Google относит PDF к поддерживаемым индексируемым форматам, а Яндекс извлекает из PDF текстовое содержимое. Поэтому PDF может самостоятельно попасть в выдачу и ранжироваться по запросам, которым соответствует его содержимое.

Но представление о том, что большое количество проиндексированных PDF само по себе увеличивает «общую релевантность сайта», неверно. Нет подтверждённого механизма, по которому добавление десятков или тысяч индексируемых PDF автоматически усиливало бы остальные страницы сайта. Каждый дополнительный файл прежде всего создаёт отдельный URL и отдельный кандидат на попадание в поиск.

Когда PDF стоит оставлять в индексе

Индексирование оправдано, если файл представляет самостоятельную ценность для пользователя и по нему действительно имеет смысл попасть из поиска на сам PDF.

Например:

  • техническая документация;
  • инструкции и руководства;
  • исследования и отчёты;
  • нормативные документы;
  • спецификации;
  • каталоги, если они содержат уникальную и востребованную информацию;
  • презентации или методические материалы, которые нормально воспринимаются без дополнительной HTML-страницы.

Количество файлов само по себе не является причиной их закрывать. Если на сайте 2 000 уникальных инструкций к оборудованию и каждая отвечает на отдельный поисковый спрос, массовая индексация может быть совершенно нормальной.

Когда PDF лучше не индексировать

Закрывать имеет смысл файлы, которые не должны становиться самостоятельными посадочными страницами:

  • PDF полностью или почти полностью дублирует HTML-страницу;
  • разные версии одного документа доступны по отдельным URL;
  • в индексе остаются старые прайсы, каталоги, инструкции и регламенты;
  • PDF создаются автоматически и отличаются только незначительными данными;
  • это внутренние формы, счета, сертификаты, шаблоны или прочие служебные файлы;
  • документ практически не имеет самостоятельной поисковой ценности.

Особенно проблемна схема, когда на сайте есть полноценная HTML-страница и рядом PDF с тем же текстом. Поисковой системе приходится определять, какой URL считать основной версией документа, а в выдаче иногда может оказаться PDF вместо более удобной HTML-страницы.

В такой ситуации необязательно просто ставить noindex. Если PDF является альтернативной версией HTML-документа, можно передать для PDF HTTP-заголовок:

Link: https://example.com/page/; rel="canonical"

Google поддерживает rel="canonical" через HTTP-заголовок для документов, отличных от HTML, включая PDF. Яндекс также поддерживает указание canonical для PDF через HTTP-заголовок. При этом canonical является указанием предпочтительной версии, а не абсолютной гарантией выбора именно этого URL.

Как правильно закрыть PDF от индексации

У самого PDF нет HTML-блока , поэтому обычный:

в него не вставить.

Для PDF используется HTTP-заголовок:

X-Robots-Tag: noindex

Например, сервер при запросе файла должен возвращать:

HTTP/1.1 200 OK Content-Type: application/pdf X-Robots-Tag: noindex

Это позволяет оставить файл доступным пользователям и поисковому роботу, но запретить его появление в результатах поиска.

Не следует одновременно закрывать такой PDF через robots.txt, если задача — удалить уже известный поисковой системе файл с помощью noindex. Робот должен иметь возможность запросить PDF и увидеть X-Robots-Tag: noindex. Для Google это прямо необходимо для обработки директивы noindex.

Если документ вообще больше не существует, вместо noindex логичнее отдавать 404 или 410. Если старый PDF заменён новым эквивалентным документом, обычно правильнее сделать 301-редирект со старого URL на новый.

Что делать, если PDF на сайте очень много

Сначала их нужно разделить хотя бы на четыре группы:

  1. Уникальные документы с самостоятельным поисковым спросом — оставить индексируемыми.
  2. PDF-копии существующих HTML-страниц — определить основную версию и при необходимости настроить canonical.
  3. Устаревшие документы с актуальной заменой — заменить или перенаправить на актуальную версию.
  4. Служебные и бесполезные для поиска файлы — X-Robots-Tag: noindex.

Закрывать все PDF одной строкой только потому, что их несколько тысяч, — слишком грубое решение. Но и держать весь файловый архив индексируемым ради предполагаемого увеличения тематической релевантности смысла нет.

Практический критерий простой: если пользователь может прийти из поиска непосредственно на PDF и получить полноценный ответ — файл может оставаться в индексе. Если предпочтительной точкой входа должна быть другая страница сайта либо PDF вообще не предназначен для поискового трафика — его индексирование обычно не нужно.

Разобрать проблему на вашем сайте

Опишите проблему — найду вероятную причину и предложу понятный план исправлений без лишних работ.

Связаться