Как настроить robots.txt в WordPress для индексации нужных страниц

Если robots.txt в WordPress настроен неаккуратно, поисковик может тратить обход на мусорные URL или, наоборот, не добираться до важных страниц. В итоге сайт индексируется хуже, чем мог бы. Правильная схема здесь простая: закрыть от обхода только то, что действительно не нужно в поиске, и не мешать роботам видеть публичные страницы, записи, категории и другие полезные разделы.

В WordPress файл robots.txt обычно не создают вручную в корне сайта, а отдают через виртуальный файл, который формирует сам движок. Это удобно, но из-за этого многие путают его с реальным файлом на сервере и делают лишние правки не там, где нужно. Ниже — рабочий порядок настройки без типичных ошибок.

Что должен делать robots.txt на WordPress-сайте

robots.txt не добавляет страницы в индекс и не удаляет их оттуда. Его задача проще: подсказать поисковым роботам, какие разделы не стоит обходить. Это важно для служебных URL, страниц админки, внутренних поисков, технических параметров и других адресов, которые не несут пользы в выдаче.

Для индексации нужных страниц robots.txt нужен не как инструмент “ускорения”, а как фильтр. Если закрыть лишнее слишком широко, можно случайно перекрыть доступ к CSS, JS, изображениям или к самим страницам сайта. Тогда поисковик увидит сайт хуже, а иногда и вовсе начнёт считать его проблемным.

Какой robots.txt обычно нужен WordPress-сайту

Для большинства сайтов достаточно короткого и понятного файла. Базовый вариант выглядит так:

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://example.com/sitemap.xml

Здесь закрыта админка WordPress, но оставлен доступ к admin-ajax.php, который нужен многим темам и плагинам на фронтенде. Строка с картой сайта не обязательна, но полезна: она помогает поисковикам быстрее находить важные URL. Адрес карты нужно подставить свой — обычно это либо основной sitemap, либо индекс карт сайта, который отдаёт SEO-плагин.

Если сайт работает на поддомене или в подкаталоге, проверьте, что в строке Sitemap указан именно тот домен, который реально открыт для индексации. Ошибка здесь встречается чаще, чем кажется: файл формально есть, но поисковик получает неверный адрес карты.

Что можно закрыть, а что лучше не трогать

Закрывать стоит только то, что не должно попадать в обход и не несёт ценности для поиска. Обычно это:

  • /wp-admin/ — административная часть сайта;
  • служебные параметры и внутренний поиск, если они создают мусорные URL;
  • временные или технические разделы, которые не должны обходиться роботами.

А вот закрывать в robots.txt публичные страницы, записи, рубрики, метки, медиафайлы или важные каталоги темы без явной причины не стоит. Если страница должна индексироваться, робот должен иметь к ней доступ. Особенно это касается CSS и JS: если их закрыть, поисковик может некорректно отрендерить страницу и хуже понять её содержимое.

Отдельный момент — дубли и страницы с параметрами. Если проблема не в обходе, а в том, что в индекс попадают лишние варианты одной и той же страницы, robots.txt не всегда лучший инструмент. Иногда правильнее использовать canonical, noindex или настройки самого плагина SEO. Но если задача именно в том, чтобы не тратить краулинговый бюджет на мусорные URL, robots.txt подходит хорошо.

Как изменить robots.txt в WordPress

Есть два практичных способа: через плагин SEO или вручную на сервере. Для большинства владельцев сайтов удобнее первый вариант, потому что он не требует доступа к FTP и не ломает структуру файлов.

Через SEO-плагин

Во многих SEO-плагинах есть встроенный редактор robots.txt. Обычно он находится в разделе настроек файлов сайта или инструментов. Там можно добавить свои правила и сохранить их без ручного редактирования файлов на хостинге.

Плюс этого способа в том, что WordPress продолжает сам отдавать файл, а вы меняете только содержимое. Минус — если плагин отключить, настройки могут исчезнуть из интерфейса, хотя на практике это зависит от конкретного решения. Поэтому после изменений всегда проверяйте, как файл выглядит снаружи.

Через реальный файл на сервере

Если на сайте уже есть физический robots.txt в корне, он обычно имеет приоритет над виртуальным файлом WordPress. В этом случае править нужно именно его через FTP, файловый менеджер хостинга или SSH-доступ, если он у вас есть.

Перед редактированием сделайте копию файла. Ошибка в robots.txt не ломает сайт целиком, но может быстро ухудшить видимость в поиске. Особенно опасно случайно оставить слишком широкое правило вроде Disallow: / — оно закрывает от обхода весь сайт.

После правки сохраните файл в кодировке UTF-8 без BOM, если редактируете его в текстовом редакторе. Лишние символы в начале файла иногда создают странное поведение на стороне сервера.

Как проверить, что robots.txt настроен правильно

Проверка нужна обязательно, потому что визуально файл может выглядеть нормально, а фактически отдавать другой ответ. Смотрите на три вещи:

  1. Файл открывается по адресу https://ваш-домен/robots.txt и возвращает текст, а не ошибку 404 или редирект на неожиданный URL.
  2. Внутри нет правил, которые закрывают важные публичные разделы сайта.
  3. Строка с картой сайта ведёт на существующий sitemap.

Если используете Google Search Console или Яндекс Вебмастер, проверьте, как поисковая система видит файл. Это полезно, когда на сайте есть кэш, CDN или нестандартная конфигурация сервера: браузер может показывать одно, а робот получать другое.

Ещё один практичный тест — открыть несколько важных страниц сайта в режиме обычного просмотра и убедиться, что они не закрыты правилами robots.txt. Для этого не нужен сложный аудит: достаточно проверить, что в файле нет запрета на нужные разделы и что страницы доступны по прямым URL.

Типичные ошибки, из-за которых поисковики теряют важные страницы

Чаще всего проблемы возникают не из-за самого robots.txt, а из-за слишком широких правил. Вот что встречается на практике:

  • Disallow: / — закрывает весь сайт от обхода;
  • запрет на папку, где лежат публичные страницы темы или каталога;
  • закрытие CSS и JS, из-за чего робот видит страницу не так, как пользователь;
  • неверный адрес sitemap;
  • одновременное использование нескольких мест, где задаётся robots.txt, и конфликт между ними.

Если после правки страницы перестали нормально попадать в поиск, не спешите снова расширять запреты. Сначала проверьте, не закрыли ли вы именно те URL, которые должны быть доступны для обхода. Затем убедитесь, что на страницах нет других ограничений: мета-тега noindex, заголовка X-Robots-Tag или каноникал-ссылки на другой адрес.

Практическая схема настройки без лишнего риска

Если нужен безопасный рабочий вариант, действуйте так:

  1. Оставьте доступ к публичным страницам, записям, рубрикам и медиа, если они должны индексироваться.
  2. Закройте только административные и технические разделы.
  3. Добавьте актуальный sitemap.
  4. Проверьте файл по прямому адресу в браузере.
  5. Убедитесь, что важные URL не попали под запрет.

Для обычного WordPress-сайта этого достаточно. Не нужно пытаться “оптимизировать” robots.txt до сложного набора директив, если у вас нет чёткой технической причины. Чем проще файл, тем меньше шанс случайно отрезать поисковику доступ к нужным страницам.

Если на сайте много технических дублей, фильтров или параметров, лучше сначала понять, какие именно URL создают проблему, а уже потом решать, закрывать их robots.txt или другим способом. В этом вопросе аккуратность важнее объёма правил: один лишний запрет может стоить заметной части трафика.

⭐⭐⭐⭐⭐