AGD Index

Robots.txt и noindex: как найти и убрать блокировки индексации

Вы отправили страницу на индексацию — а она не появляется в выдаче. Часто дело не в «медленном Google»: страница просто закрыта от индексации, и вы платите за визиты ботов, которые ничего не могут сделать. Разбираем четыре уровня блокировок: robots.txt, meta robots, HTTP-заголовок X-Robots-Tag и canonical — как их найти, что они значат и как убрать.

Robots.txt: Disallow — это не noindex

robots.txt — файл в корне сайта, который читают поисковые роботы. Он управляет обходом (crawl), но не индексацией напрямую. Главная ошибка вебмастеров — путать два механизма:

  • Disallow: /page/ в robots.txt запрещает роботу заходить на страницу. Googlebot не видит её содержимое — а значит, не видит и мета-теги на ней.
  • noindex на самой странице запрещает включать её в индекс. Робот заходит, читает запрет и не индексирует.

Важное следствие: страница, закрытая только через robots.txt, может остаться в индексе — без контента, только по URL. Так происходит, если на неё ссылаются внешние сайты: Google знает адрес, показать содержимое не может, но URL висит в выдаче «по ссылке».

Правило Google: если хотите удалить страницу из индекса — используйте noindex и не закрывайте её в robots.txt, иначе робот никогда не увидит ваш noindex.

Как выглядит проблема в robots.txt

Откройте https://ваш-сайт.ru/robots.txt и ищите:

User-agent: *
Disallow: /

Это полная блокировка всего сайта — частая ситуация на staging-копиях, которые забыли открыть после переезда.

Disallow: /page

Блокирует все URL, начинающиеся с /page — включая /page-2, /pages/price и подобное. Проверяйте, не попадают ли под маску нужные разделы.

Meta robots: noindex на странице

Второй уровень — тег в <head> страницы:

<meta name="robots" content="noindex, nofollow">

Что значат значения:

  • noindex — не включать страницу в индекс;
  • nofollow — не переходить по ссылкам на этой странице (для краулинга со страницы);
  • none — синоним noindex, nofollow;
  • index, follow — явное разрешение (по умолчанию, можно не ставить);
  • noindex, follow — страницу не индексировать, но по ссылкам ходить можно.

Отдельно бывает noimageindex, notranslate и значения для отдельных роботов: <meta name="googlebot" content="noindex"> закроет страницу только от Google.

Где прячется noindex

  • Настройки CMS и SEO-плагинов: галочка «Попросить поисковые системы не индексировать сайт» в WordPress (Настройки → Чтение) проставляет noindex всему сайту.
  • Режимы «на ремонте» и maintenance-плагины.
  • Страницы, закрытые «на всякий случай» при запуске — и забытые.
  • Автоматические правила шаблонов: архивы тегов, результаты внутреннего поиска, страницы пагинации.

X-Robots-Tag: noindex в HTTP-заголовке

Третий уровень — заголовок ответа сервера:

X-Robots-Tag: noindex

Он работает как meta robots, но на уровне сервера — и подходит файлам, у которых нет HTML: PDF, DOCX, изображения. Часто ставится в nginx/apache для целых папок, например /files/*.pdf — и случайно накрывает нужные документы.

Проверить заголовки можно любым HTTP-сниффером или командой curl -I https://site.com/page/ — ищите строку X-Robots-Tag.

Canonical: «эта страница — не главная»

Четвёртая блокировка — не запрет, а перенаправление сигнала:

<link rel="canonical" href="https://другой-адрес/">

Если canonical указывает на другой URL, Google считает страницу копией и индексирует не её, а адрес из canonical. Страница попадает в отчёт как «Дублированная страница. Google выбрал другую каноническую страницу».

Частые ошибки:

  • canonical на http:// вместо https://;
  • canonical со слешем/без, с www/без — должны совпадать с реальным адресом;
  • SEO-плагин автоматически назначил canonical на категорию;
  • при миграции canonical забыли переписать на новый домен.

Как проверить страницу на блокировки: пошаговый план

  1. Посмотрите robots.txt: откройте site.com/robots.txt, найдите Disallow-правила для вашего URL. Учитывайте порядок правил и User-agent: *.
  2. Откройте исходный код страницы (Ctrl+U) и найдите <meta name="robots" и <link rel="canonical".
  3. Проверьте заголовки ответа сервера (curl -I): статус должен быть 200 OK, без X-Robots-Tag: noindex, без неожиданных 301/302.
  4. Проверка URL в Search Console: вставьте адрес в верхнюю строку GSC — инструмент покажет, разрешён ли обход, какой canonical видит Google и есть ли ошибки.
  5. Отчёт «Статус индексирования» в GSC: кластер «Исключено страницами» покажет все заблокированные URL с причиной («Заблокировано файлом robots.txt», «Отмечена как „noindex“», «Дублированная страница»).

Быстрая ручная проверка из выдачи: site:ваш-сайт.ru/страница — если URL найден, страница в индексе есть (возможно, без контента — как в случае robots-блокировки).

Как правильно закрыть страницы, когда это нужно

Иногда закрыть — правильно. Закрывают от индексации:

  • админки и служебные разделы;
  • результаты внутреннего поиска;
  • корзины, личные кабинеты, страницы оформления заказа;
  • черновики и staging.

Правильный способ для HTML-страниц — noindex в meta robots при открытом robots.txt. Закрытие служебных папок в robots.txt тоже допустимо — но помните разницу: Disallow остановит обход, а уже попавшие в индекс URL так не удалить.

После исправления: как вернуть страницу в индекс

  1. Уберите блокировку (правило robots.txt / мета-тег / заголовок / canonical).
  2. Убедитесь, что страница отдаёт 200 OK и видна в «Проверке URL».
  3. Запросите индексирование в Search Console — штучно.
  4. Для массовых исправлений (сотни URL после снятия noindex) — отправьте обновлённый список визитами ботов: AGD Index направит Googlebot/Bingbot на каждый URL, и переобход запустится без дневных квот GSC.

Часто задаваемые вопросы

Чем noindex отличается от Disallow в robots.txt?

Disallow запрещает роботу заходить на URL (обход), noindex запрещает включать страницу в индекс. Страница, закрытая только в robots.txt, может остаться в выдаче без контента; чтобы удалить её из индекса, используйте noindex и откройте обход.

Как посмотреть robots.txt любого сайта?

Откройте https://адрес-сайта/robots.txt в браузере. Проверить логику правил под конкретный URL можно в отчёте «Файлы Sitemap и robots.txt» в Search Console или онлайн-валидаторах robots.txt.

Что значит meta robots content noindex, nofollow?

Страница не будет включена в индекс (noindex), а robot не будет переходить по ссылкам, размещённым на этой странице (nofollow). Это стандартный способ закрыть служебную страницу целиком.

Страница закрыта в robots.txt, но всё равно в выдаче. Почему?

Google увидел URL по внешним ссылкам. Так как обход запрещён, Google не знает про noindex (его на странице робот не читает) и показывает URL «по ссылке». Решение: открыть страницу в robots.txt и закрыть через meta noindex — после переобхода URL исчезнет из выдачи.

Как убрать noindex, поставленный WordPress?

Проверьте: Настройки → Чтение → «Попросить поисковые системы не индексировать сайт» (галочка должна быть снята), затем настройки вашего SEO-плагина — разделы «Индексирование» / Titles & Meta, где noindex мог быть включён для типов страниц. После снятия запросите переобход.

Отправка ботов помогает при noindex?

Нет — и это честный ответ. Визит бота гарантирует обход, а не включение в индекс. Если страница закрыта noindex или robots.txt, сначала снимите блокировку, и только потом отправляйте URL. Именно поэтому перед любой массовой отправкой стоит пройти чек-лист из этой статьи.

Что дальше

Бот для индексации страниц в Google и Bing

Подходит для новых сайтов и массовой загрузки backlinks. Направляем реальных поисковых ботов Googlebot и Bingbot на ваши URL — страницы и ссылки обнаруживаются быстрее, чем при ожидании естественного обхода.

Открыть Telegram-бота