Сайт стабильно рос, страниц в индексе становилось всё больше — а потом трафик начал проседать без видимой причины. Ни ручных санкций в Search Console, ни явных технических ошибок. Знакомая ситуация для проектов, которые в какой-то момент начали программно генерировать страницы в больших объёмах: карточки тегов, страницы фильтров, автоматические отчёты, лендинги под каждый город или товар.
Это называется scaled content abuse — официальная категория в политике Google против спама, обновлённая в марте 2024 года. Разберём, что это, почему туда легко попасть случайно, даже не используя «чёрные» методы, и как выйти — на примере того, как мы исправили эту проблему на собственном сайте.
Что такое scaled content abuse
Google определяет scaled content abuse как генерацию большого количества страниц, основная цель которых — манипулировать позициями в поиске, а не приносить пользу пользователям. Важный нюанс формулировки: дело не в том, как создан контент (вручную, шаблоном или нейросетью), а в том, зачем он создан и какую ценность несёт.
Это значит, что под действие политики попадают не только классические «дорвеи» прошлого десятилетия (страницы-пустышки с переспамленным текстом под конкретный запрос), но и вполне современные паттерны:
- автоматически генерируемые страницы по шаблону под каждую комбинацию параметров (город × услуга, бренд × модель);
- программные «отчёты» или «карточки», которые создаются для любого введённого пользователем значения без модерации;
- AI-текст, вставленный в шаблон ради формальной уникальности, без реальной редакционной ценности;
- страницы фильтров и тегов, индексируемые без разбора, хотя содержат пересекающийся контент.
Объединяет их одно: отношение проиндексированных страниц к страницам, реально приносящим трафик и вовлечённость, стремится к нулю. Алгоритм видит это не как «много полезного контента», а как шум.
Почему это страшнее, чем кажется
Главная опасность не в том, что плохие страницы не ранжируются — это полбеды. Проблема в том, что такие паттерны:
- Размывают crawl budget. Поисковый робот тратит ресурсы на обход тысяч малоценных страниц вместо того, чтобы чаще переобходить действительно важный контент.
- Снижают доверие ко всему домену. Алгоритмы оценки качества работают не постранично, а с учётом паттернов по сайту в целом. Если 95% страниц определённого раздела — шаблонный мусор, это может задеть восприятие домена целиком, включая страницы, которые сами по себе нормальные.
- Срабатывают накопительно. Один десяток слабых страниц никто не заметит. Несколько тысяч — это уже статистически значимый паттерн, который алгоритм распознаёт автоматически, без участия модератора.
Реальный пример: как мы наступили на эти грабли
На reChecker.ru есть фича: после любой проверки сайта через наш аудит результат сохраняется на публичной странице вида /report/домен — чтобы можно было поделиться отчётом или сослаться на него. Удобно, но в какой-то момент мы обнаружили, что эта механика стала ровно тем самым scaled content abuse:
- 10 737 опубликованных страниц за неполные три месяца;
- 97,6% (10 478) проверены ровно один раз — кто-то ввёл домен, посмотрел результат и ушёл, страница осталась в индексе навсегда;
- среди них — вспомогательный скрипт, который раз в 20 минут проверял «случайные» домены, переходя по исходящим ссылкам с уже проверенных сайтов. В результате в индексе оказались страницы вида «Аудит сайта pinterest.com» и даже «Аудит сайта mvd.ru» — для доменов, не имеющих к нам никакого отношения и без какого-либо запроса на такую проверку.
Налицо все признаки: шаблонная страница, автогенерация без модерации, нулевая вовлечённость у подавляющего большинства, плюс репутационный риск — публичная «оценка» чужих доменов без их ведома.
Как мы это нашли
Не по «чуйке», а по метрикам:
- Посчитали отношение общего числа проиндексированных страниц раздела к числу страниц с признаками реального интереса (в нашем случае — повторные проверки одного домена);
- Выгрузили случайную выборку доменов и посмотрели на неё глазами стороннего человека — список оказался красноречивее любых цифр;
- Проверили, что генерирует эти страницы — нашли автоматический cron-скрипт, который вообще не должен был ничего публиковать в индексируемом виде.
Как починили
Важный принцип: не удалять, а ограничить индексацию. Удаление страниц, на которые уже могли быть прямые ссылки или закладки, — лишний риск 404. Вместо этого:
- Отключили источник проблемы — автоматическую генерацию страниц для доменов без явного запроса пользователя;
- Добавили
noindex, followдля страниц без признаков вовлечённости — они остаются доступны по прямой ссылке, но не претендуют на место в индексе; - Обновили sitemap.xml так, чтобы туда попадали только страницы, прошедшие порог полезности — итоговый список сократился с 10 737 до 260 URL;
- Проверили, что эта логика не «отменится» автоматически — у нас она случайно прописывалась заново при каждом деплое, такое тоже стоит перепроверить.
Как проверить свой сайт
Прежде чем что-то чистить, нужно понять масштаб проблемы. Чек-лист:
- Сравните число страниц в sitemap.xml с числом страниц, которые реально получают трафик из Search Console / Яндекс.Вебмастера за последние 3 месяца;
- Найдите разделы сайта, где страницы генерируются автоматически (фильтры, теги, карточки, отчёты, комбинации параметров) — проверьте robots.txt и sitemap на предмет того, что туда вообще попадает;
- Возьмите случайную выборку из 20–30 страниц такого раздела и честно оцените: дал бы кто-то на это естественную ссылку? Принёс бы кто-то закладку?
- Проверьте долю дублирующегося/шаблонного текста между такими страницами — большая текстовая разница в шаблоне ничего не значит, если структура и логика страницы идентичны;
- Если используете canonical — убедитесь, что он не «прячет» проблему, а действительно указывает на основную версию контента;
- Проверьте, не генерирует ли какой-то фоновый процесс (cron, воркер, интеграция) страницы без модерации — как было в нашем случае.
Что делать, если масштаб уже большой
Если страниц действительно много и руками не пересмотреть — не нужно. Работайте с порогами, а не со списками:
- определите измеримый критерий ценности (трафик за период, вовлечённость, наличие обратных ссылок, повторные посещения — что подходит для вашего типа страниц);
- автоматизируйте применение
noindexпо этому критерию, а не вручную для каждой страницы; - регулярно — раз в месяц-два — пересчитывайте критерий и обновляйте индексируемый набор, потому что страницы могут «дозревать» до ценности со временем.
Главное — не пытаться решить это разовой чисткой. Если механизм генерации малоценных страниц продолжает работать, проблема вернётся через несколько месяцев в том же объёме.
Если не уверены, есть ли у вас такая проблема — лучше сразу прогнать сайт через технический аудит и посмотреть на структуру индексации целиком, чем гадать по отдельным симптомам.