Краулинговый бюджет — тема, о которой вспоминают, когда новые страницы долго не попадают в индекс, хотя с ними технически всё в порядке. Для небольшого сайта на пару сотен страниц это почти никогда не проблема. А вот для каталогов, маркетплейсов, агрегаторов и любых сайтов с автогенерируемыми страницами — это один из факторов, который реально ограничивает рост органического трафика.
Что такое crawl budget
Crawl budget — это количество страниц сайта, которое поисковый робот готов обойти за определённый период времени. Бюджет не бесконечен: у Googlebot и Яндекс.Робота есть ограничения по нагрузке на конкретный сервер (чтобы не положить сайт частыми запросами) и общий лимит ресурсов, который распределяется между миллиардами сайтов в интернете.
Бюджет складывается из двух составляющих:
- Crawl rate limit — техническое ограничение: сколько запросов в секунду робот готов слать, не перегружая сервер. Зависит от скорости ответа сайта: чем быстрее отвечает сервер, тем больше страниц успевает обойти робот за то же время.
- Crawl demand — «спрос» на обход именно вашего сайта со стороны поисковика: насколько часто обновляется контент, насколько сайт авторитетен, насколько востребованы его страницы в поиске.
Если сайт маленький и не обновляется быстро — крайне маловероятно, что краулинговый бюджет вообще станет узким местом. Google прямо говорит: для сайтов до нескольких тысяч страниц с разумной частотой обновления беспокоиться об этом не нужно. Проблема возникает на масштабе — десятки и сотни тысяч URL, особенно генерируемых автоматически.
Куда утекает бюджет
Самая частая причина не в том, что сайт «слишком большой», а в том, что бюджет тратится не на то.
Параметры URL и фасетная навигация
Интернет-магазин с фильтрами по цене, цвету, размеру может генерировать тысячи комбинаций URL для одного и того же набора товаров: ?color=red&size=42, ?sort=price&page=2 и так далее. Каждая такая комбинация — отдельный URL, который робот может обойти, потратив на него часть бюджета, хотя по содержанию страница почти не отличается от других.
Дубли и слабо различающиеся страницы
Похожая ситуация с тегами, архивами по дате, страницами пагинации, печатными версиями страниц — всё это технически разные URL с пересекающимся содержанием.
Программно генерируемые страницы без модерации
Это более системная проблема: когда любое действие пользователя (поиск, проверка, фильтр) автоматически создаёт новую индексируемую страницу. Мы недавно разбирали на собственном примере, как фича «опубликовать результат проверки на отдельной странице» превратилась в десятки тысяч слабо востребованных URL — подробности в статье про scaled content abuse. Краулинговый бюджет в такой ситуации уходит на обход тысяч страниц с нулевой пользой вместо того, чтобы чаще переобходить действительно важный контент.
Редиректы и битые ссылки
Каждый переход по цепочке редиректов или попытка обойти несуществующую страницу — тоже расход бюджета. Если на сайте много битых внутренних ссылок, проверить их можно через массовую проверку URL.
Как понять, что бюджет действительно ограничивает индексацию
Признаки, что стоит этим заняться:
- новые важные страницы попадают в индекс через недели, а не дни;
- в Search Console / Яндекс.Вебмастере растёт число страниц со статусом «обнаружено, но не проиндексировано»;
- лог-файлы сервера показывают, что робот тратит непропорционально много запросов на разделы с низкой ценностью (фильтры, пагинация, служебные параметры).
Если ничего из этого не наблюдается — оптимизация бюджета не первоочередная задача, лучше сосредоточиться на качестве контента и технических ошибках.
Как не растрачивать бюджет впустую
1. Управляйте обходом через robots.txt
robots.txt запрещает роботу обходить указанные пути — это прямой способ не тратить бюджет на заведомо неважные разделы (служебные параметры, внутренний поиск, корзину). Важно не путать это с noindex: robots.txt не убирает страницу из индекса, если на неё уже есть ссылки, он просто не даёт роботу туда заходить. Проверить текущую конфигурацию можно через анализатор robots.txt.
2. Канонизируйте, а не блокируйте, там, где нужна индексация хотя бы одной версии
Для дублей, которые всё же должны быть доступны пользователю (например, страница с сортировкой), правильнее использовать rel=canonical, указывающий на основную версию, а не полную блокировку — так робот понимает, какая версия главная, но не обходит все вариации одинаково тщательно.
3. Подключите чистый, актуальный sitemap.xml
Sitemap — это подсказка роботу, что обходить в первую очередь. Если в нём лежат неактуальные, удалённые или некачественные URL — это сбивает приоритеты. Проверить структуру и актуальность своей карты сайта можно через генератор и валидатор sitemap.
4. Ускорьте ответ сервера
Чем быстрее сервер отвечает, тем больше страниц робот успевает обойти за то же время и тем меньше риск, что бюджет упрётся в технический лимит, а не в реальный спрос. Полный технический разбор скорости и инфраструктуры — в аудите сайта.
5. Не плодите страницы без пользы
Если фича автоматически создаёт индексируемые страницы (отчёты, профили, результаты поиска) — закладывайте порог ценности с самого начала: индексируется не всё подряд, а то, что прошло минимальный критерий вовлечённости или полезности. Дешевле спроектировать это сразу, чем разгребать тысячи мусорных URL через год.
Чек-лист
- Проверить в Search Console / Яндекс.Вебмастере долю страниц «обнаружено, не проиндексировано»
- Найти разделы с фасетной навигацией и параметрами URL — закрыть лишние комбинации в robots.txt
- Настроить canonical для дублирующихся, но нужных пользователю вариаций страниц
- Обновить sitemap.xml, убрать из него неактуальные и некачественные URL
- Проверить сайт на битые внутренние ссылки и цепочки редиректов
- Замерить скорость ответа сервера — узкое место может быть чисто техническим
- Если есть автогенерируемые страницы — ввести критерий ценности для индексации, а не индексировать все подряд
Заключение
Краулинговый бюджет — это не абстрактная метрика для гигантов рынка, а вполне измеримая вещь: соотношение полезных страниц к общему количеству URL, которые видит робот. Для большинства сайтов достаточно один раз навести порядок в параметрах, дублях и автогенерируемых разделах, чтобы бюджет переставал быть проблемой. Начать стоит с технического аудита — он покажет текущее состояние индексации, robots.txt и sitemap, и даст понятную точку отсчёта для дальнейшей работы.