Disallow в robots.txt запрещает роботу читать страницу. Noindex на самой странице просит убрать её из поискового индекса. Если раздел закрыт через Disallow, робот не прочитает добавленный noindex. Для публичного архива сначала выведите noindex, затем разрешите обход; личные данные защищайте входом в аккаунт.
Публичный архив и личный кабинет требуют разных действий
Чтобы Google прочитал noindex, страница должна быть доступна для обхода. Официальная документация.
Раздел /archive/ с публичными подборками отличается от /account/ с личными сведениями. Публичный архив можно оставить доступным роботу и вывести на нём noindex. Для второго требуется контроль доступа: robots.txt и noindex не скрывают данные от прямого запроса человека. Составьте список публичных адресов, которые нужно исключить из поиска, отдельно от приватных. Разрешайте обход только публичных страниц. Если архив и личные документы находятся под одним путём, сначала проверьте авторизацию и разделите настройки доступа. Не открывайте весь путь ради noindex.
Что проверить до снятия Disallow
| Страница | Что сейчас мешает | Что изменить | Как подтвердить результат |
|---|---|---|---|
| Публичный раздел под Disallow | Робот не читает страницу | Проверить noindex | Нужен доступ к директиве |
| Публичный раздел с noindex | Обход разрешён | Ожидать обработку | Срок не гарантирован |
| Приватный кабинет | Приватные данные | Авторизация | Не открывать для робота |
| noindex только после работы скрипта | Скрипт может не выполниться | Проверить ответ | Предпочесть серверный вывод |
Найдите noindex в HTML и заголовках
Получите обычным запросом страницы (GET) исходный HTML до выполнения скриптов. Проверьте тег meta robots и служебный заголовок ответа X-Robots-Tag. Затем запросите robots.txt соответствующего хоста. Одно присутствие noindex в сохранённой настройке системы управления сайтом (CMS) не подтверждает его публичный вывод. Не рассчитывайте только на позднюю вставку скриптом, особенно если исходная страница уже недоступна роботу. Проверьте точный путь, регистр и специальные группы User-agent. В Search Console посмотрите дату последнего обхода. Сообщение о блокировке могло появиться ещё до изменения файла; оно не описывает автоматически нынешний ответ.
В терминале получите страницу архива командой ниже; при необходимости передайте её разработчику.
curl -sS -D headers.txt -o response.html 'https://example.com/archive/old/'В headers.txt ищите X-Robots-Tag, а в response.html — meta robots. У публичного архива noindex должен появиться в реальном ответе сервера до снятия Disallow. Обычная услуга не должна получить тот же запрет. Замените example.com своим доменом; этот GET не изменяет настройки сайта. Справка curl.
В HTML ищите <meta name="robots" content="noindex">, в заголовках — X-Robots-Tag: noindex. В /robots.txt найдите запрет, совпадающий с этим путём. Снимайте его только после появления noindex на публичных страницах.
В каком порядке менять архивный раздел
На тестовой среде подготовьте архивную страницу с серверным noindex, но пока не меняйте robots.txt рабочего сайта. Проверьте новый ответ, затем разверните его на целевых публичных страницах. Убедившись в наличии noindex, уберите мешающий Disallow для нужного робота и публичного пути. Снова запросите архив и robots.txt. Затем следите за новым обходом в Search Console: исключение из поиска происходит после обработки страницы, и точную дату заранее назначить нельзя.
Уберите архив из sitemap
Уберите исключаемые публичные адреса из списка страниц, которые вы предлагаете для индексации через sitemap. Внутренние ссылки оценивайте по пользе посетителю: noindex не означает, что архив должен стать недоступным в навигации. Не меняйте все ссылки на nofollow автоматически. Проверка должна показать, что человек может открыть полезный архив, робот может получить директиву, а текущие открытые услуги не получили noindex случайно. После обновления SEO-плагина повторите проверку одного архивного, одного обычного и одного приватного URL.
Проверьте архив, услугу и кабинет
Архив открывается и возвращает noindex, обычная услуга остаётся без него, кабинет требует входа. В Search Console проверьте дату последнего обхода архивного URL: старое сообщение о Disallow может относиться к версии до изменения. Срок исчезновения из поиска заранее не гарантирован.
Читайте также: robots.txt, meta robots и X-Robots-Tag: в чём разница и когда что использовать и 7 ошибок в robots.txt, которые убивают индексацию. Проверки сайта доступны на странице технического аудита reChecker.