Robots.txt и noindex: как найти и убрать блокировки индексации
Вы отправили страницу на индексацию — а она не появляется в выдаче. Часто дело не в «медленном Google»: страница просто закрыта от индексации, и вы платите за визиты ботов, которые ничего не могут сделать. Разбираем четыре уровня блокировок: robots.txt, meta robots, HTTP-заголовок X-Robots-Tag и canonical — как их найти, что они значат и как убрать.
Robots.txt: Disallow — это не noindex
robots.txt — файл в корне сайта, который читают поисковые роботы. Он управляет обходом (crawl), но не индексацией напрямую. Главная ошибка вебмастеров — путать два механизма:
Disallow: /page/в robots.txt запрещает роботу заходить на страницу. Googlebot не видит её содержимое — а значит, не видит и мета-теги на ней.noindexна самой странице запрещает включать её в индекс. Робот заходит, читает запрет и не индексирует.
Важное следствие: страница, закрытая только через robots.txt, может остаться в индексе — без контента, только по URL. Так происходит, если на неё ссылаются внешние сайты: Google знает адрес, показать содержимое не может, но URL висит в выдаче «по ссылке».
Правило Google: если хотите удалить страницу из индекса — используйте noindex и не закрывайте её в robots.txt, иначе робот никогда не увидит ваш noindex.
Как выглядит проблема в robots.txt
Откройте https://ваш-сайт.ru/robots.txt и ищите:
User-agent: *
Disallow: /
Это полная блокировка всего сайта — частая ситуация на staging-копиях, которые забыли открыть после переезда.
Disallow: /page
Блокирует все URL, начинающиеся с /page — включая /page-2, /pages/price и подобное. Проверяйте, не попадают ли под маску нужные разделы.
Meta robots: noindex на странице
Второй уровень — тег в <head> страницы:
<meta name="robots" content="noindex, nofollow">
Что значат значения:
- noindex — не включать страницу в индекс;
- nofollow — не переходить по ссылкам на этой странице (для краулинга со страницы);
- none — синоним
noindex, nofollow; - index, follow — явное разрешение (по умолчанию, можно не ставить);
- noindex, follow — страницу не индексировать, но по ссылкам ходить можно.
Отдельно бывает noimageindex, notranslate и значения для отдельных роботов: <meta name="googlebot" content="noindex"> закроет страницу только от Google.
Где прячется noindex
- Настройки CMS и SEO-плагинов: галочка «Попросить поисковые системы не индексировать сайт» в WordPress (Настройки → Чтение) проставляет noindex всему сайту.
- Режимы «на ремонте» и maintenance-плагины.
- Страницы, закрытые «на всякий случай» при запуске — и забытые.
- Автоматические правила шаблонов: архивы тегов, результаты внутреннего поиска, страницы пагинации.
X-Robots-Tag: noindex в HTTP-заголовке
Третий уровень — заголовок ответа сервера:
X-Robots-Tag: noindex
Он работает как meta robots, но на уровне сервера — и подходит файлам, у которых нет HTML: PDF, DOCX, изображения. Часто ставится в nginx/apache для целых папок, например /files/*.pdf — и случайно накрывает нужные документы.
Проверить заголовки можно любым HTTP-сниффером или командой curl -I https://site.com/page/ — ищите строку X-Robots-Tag.
Canonical: «эта страница — не главная»
Четвёртая блокировка — не запрет, а перенаправление сигнала:
<link rel="canonical" href="https://другой-адрес/">
Если canonical указывает на другой URL, Google считает страницу копией и индексирует не её, а адрес из canonical. Страница попадает в отчёт как «Дублированная страница. Google выбрал другую каноническую страницу».
Частые ошибки:
- canonical на
http://вместоhttps://; - canonical со слешем/без, с
www/без — должны совпадать с реальным адресом; - SEO-плагин автоматически назначил canonical на категорию;
- при миграции canonical забыли переписать на новый домен.
Как проверить страницу на блокировки: пошаговый план
- Посмотрите robots.txt: откройте
site.com/robots.txt, найдите Disallow-правила для вашего URL. Учитывайте порядок правил иUser-agent: *. - Откройте исходный код страницы (Ctrl+U) и найдите
<meta name="robots"и<link rel="canonical". - Проверьте заголовки ответа сервера (
curl -I): статус должен быть 200 OK, безX-Robots-Tag: noindex, без неожиданных 301/302. - Проверка URL в Search Console: вставьте адрес в верхнюю строку GSC — инструмент покажет, разрешён ли обход, какой canonical видит Google и есть ли ошибки.
- Отчёт «Статус индексирования» в GSC: кластер «Исключено страницами» покажет все заблокированные URL с причиной («Заблокировано файлом robots.txt», «Отмечена как „noindex“», «Дублированная страница»).
Быстрая ручная проверка из выдачи: site:ваш-сайт.ru/страница — если URL найден, страница в индексе есть (возможно, без контента — как в случае robots-блокировки).
Как правильно закрыть страницы, когда это нужно
Иногда закрыть — правильно. Закрывают от индексации:
- админки и служебные разделы;
- результаты внутреннего поиска;
- корзины, личные кабинеты, страницы оформления заказа;
- черновики и staging.
Правильный способ для HTML-страниц — noindex в meta robots при открытом robots.txt. Закрытие служебных папок в robots.txt тоже допустимо — но помните разницу: Disallow остановит обход, а уже попавшие в индекс URL так не удалить.
После исправления: как вернуть страницу в индекс
- Уберите блокировку (правило robots.txt / мета-тег / заголовок / canonical).
- Убедитесь, что страница отдаёт 200 OK и видна в «Проверке URL».
- Запросите индексирование в Search Console — штучно.
- Для массовых исправлений (сотни URL после снятия noindex) — отправьте обновлённый список визитами ботов: AGD Index направит Googlebot/Bingbot на каждый URL, и переобход запустится без дневных квот GSC.
Часто задаваемые вопросы
Чем noindex отличается от Disallow в robots.txt?
Disallow запрещает роботу заходить на URL (обход), noindex запрещает включать страницу в индекс. Страница, закрытая только в robots.txt, может остаться в выдаче без контента; чтобы удалить её из индекса, используйте noindex и откройте обход.
Как посмотреть robots.txt любого сайта?
Откройте https://адрес-сайта/robots.txt в браузере. Проверить логику правил под конкретный URL можно в отчёте «Файлы Sitemap и robots.txt» в Search Console или онлайн-валидаторах robots.txt.
Что значит meta robots content noindex, nofollow?
Страница не будет включена в индекс (noindex), а robot не будет переходить по ссылкам, размещённым на этой странице (nofollow). Это стандартный способ закрыть служебную страницу целиком.
Страница закрыта в robots.txt, но всё равно в выдаче. Почему?
Google увидел URL по внешним ссылкам. Так как обход запрещён, Google не знает про noindex (его на странице робот не читает) и показывает URL «по ссылке». Решение: открыть страницу в robots.txt и закрыть через meta noindex — после переобхода URL исчезнет из выдачи.
Как убрать noindex, поставленный WordPress?
Проверьте: Настройки → Чтение → «Попросить поисковые системы не индексировать сайт» (галочка должна быть снята), затем настройки вашего SEO-плагина — разделы «Индексирование» / Titles & Meta, где noindex мог быть включён для типов страниц. После снятия запросите переобход.
Отправка ботов помогает при noindex?
Нет — и это честный ответ. Визит бота гарантирует обход, а не включение в индекс. Если страница закрыта noindex или robots.txt, сначала снимите блокировку, и только потом отправляйте URL. Именно поэтому перед любой массовой отправкой стоит пройти чек-лист из этой статьи.
Что дальше
- Если страницы открыты, но Google их не берёт — 11 причин, почему Google не индексирует страницы.
- Статус «Обошёл — не проиндексировал» разбираем отдельно: Crawled — currently not indexed.
- Готовые списки URL после исправлений — тарифы визитов ботов.
Бот для индексации страниц в Google и Bing
Подходит для новых сайтов и массовой загрузки backlinks. Направляем реальных поисковых ботов Googlebot и Bingbot на ваши URL — страницы и ссылки обнаруживаются быстрее, чем при ожидании естественного обхода.
Открыть Telegram-бота