ГлавнаяБлогДублированный контент

Дублированный контент на сайте: как найти и убрать

5 августа 202612 минТехническое SEO

Дубли на сайте появляются сами: фильтр, сортировка, utm-метка, слеш на конце — и вот у одной страницы уже восемь адресов. Ниже разбираю, какие дубли реально мешают, а какие можно не трогать, как их найти в Вебмастере, Search Console и краулере, и чем склеивать в каждом случае. С конкретными ограничениями инструментов и сроками, через которые ждать эффект.

Коротко
  • Часть дублей на сайте нормальна: Google прямо пишет, что это не нарушение спам-политик. Санкции есть только за копирование чужого контента (раздел Scraping).
  • Краулинговый бюджет — проблема сайтов от 1 млн страниц с недельным обновлением или от 10 000 с ежедневным. Магазину на 800 карточек дубли ломают релевантность, до проблем с обходом там далеко.
  • Сила сигналов у Google: редирект и rel=canonical — strong, URL в sitemap.xml — weak. robots.txt и удаление URL как способ канонизации запрещены.
  • Инструмент «Параметры URL» в Search Console отключён 28 апреля 2022 года. У Яндекса с 12 декабря 2025 работает «Настройка GET-параметров» плюс Clean-param в robots.txt.
  • Эффект не мгновенный: Google держит страницы в кластере дублей до двух недель после правки, Яндекс исключает страницу в течение трёх недель после визита робота.
  • Оператор site: для подсчёта дублей не годится — в разобранном Мюллером случае из 180 проиндексированных URL он показал 28. Оператор cache: отключён с сентября 2024.

Какие бывают дубли и откуда они берутся

Дублем страницу назначает поисковик. Вы можете считать две карточки разными, робот сведёт их в одну группу, выберет главную и покажет в выдаче только её. Остальные уедут в исключённые с пометкой «Дубль».

Само по себе это не диагноз. Google в документации по канонизации формулирует спокойно.

«Some duplicate content on a site is normal and it's not a violation of Google's spam policies» — часть дублирующегося контента на сайте нормальна и не нарушает спам-политики Google. Документ обновлён 10 июля 2026 года.

Беда начинается, когда дубли размножаются механически. Каждый новый фильтр в каталоге рождает семейство URL, каждая рассылка добавляет метки, каждая сортировка удваивает набор. На аудитах картина повторяется: 900 страниц в поиске и 38 тысяч в исключённых, причём владелец сайта уверен, что у него «около тысячи страниц».

Виды дублей и чем каждый лечится
URL в примерах условные
ВидКак выглядитОткуда берётсяЧем закрывают
Зеркалаhttp://www.site.ru/ и https://site.ru/не настроены редиректы после переезда на HTTPS301 на всех зеркалах
Слеш и его отсутствие/catalog/shoes и /catalog/shoes/сервер отдаёт 200 на обоих вариантах301 на выбранный формат
Индексный файл/ и /index.phpповедение CMS по умолчанию301
Метки трекинга/catalog/?utm_source=vk&utm_campaign=mayреклама, рассылки, партнёрские ссылкиcanonical на чистый URL, Clean-param для Яндекса
Фильтры и сортировки/catalog/?color=red&sort=priceфасетная навигацияrobots.txt или фильтры на фрагментах URL
Пагинация/blog/page/2/, /blog/page/3/любая лентаcanonical каждой страницы на саму себя
Товар в нескольких категориях/obuv/krossovki/model-x/ и /sale/model-x/структура каталогаcanonical на основной адрес
Версия для печати/article/print/шаблон CMScanonical на основную версию
Внутренний поиск/search/?q=кроссовкиформа поиска попала в индексDisallow в robots.txt
Тестовые копииdev.site.ru, staging.site.ruразработчики забыли закрытьHTTP-авторизация на уровне сервера
Частичные текстовые дубликарточки размеров, региональные подстраницышаблонный текстобъединение или переписывание
Таблица прокручивается вбок на узком экране.

Первые десять строк закрываются один раз настройками и больше не возвращаются. Последняя строка — работа руками, и именно она обычно тормозит, потому что требует решений по структуре. Технические дубли имеет смысл разбирать в связке с общим разбором сайта: как это устроено, я описывал в материале про технический аудит.

Чем дубли вредят на самом деле

Про краулинговый бюджет пугают чаще всего, и почти всегда мимо. У Google пороги прописаны цифрами: думать о бюджете имеет смысл от 1 млн уникальных страниц с обновлением примерно раз в неделю либо от 10 000 уникальных страниц с ежедневным обновлением. Сайту на 400 страниц дубли обход не ломают.

Второй механизм работает на сайтах любого размера. Внешние ссылки, внутренние переходы и поведенческие сигналы делятся между копиями. Одна страница набирает половину сигналов, вторая — вторую половину, в топ не идёт ни одна.

Третий — каннибализация. Две похожие страницы конкурируют по одному запросу, поисковик перевыбирает между ними, позиция скачет: сегодня 12, через неделю 28, потом снова 14. Владелец сайта в этот момент обычно ищет причину в ссылках или в апдейте, хотя причина внутри.

Три вида ущерба и где их видно
Что происходитКогда реально проявляетсяГде проверить
Обход тратится на копииот 1 млн страниц с недельным обновлением или от 10 000 с ежедневным«Статистика сканирования» в Search Console, логи сервера
Сигналы размываются между копиямина сайтах любого размера, если на дубли ведут внешние ссылкисверка объявленного и выбранного Google каноникала
Каннибализация по запросукогда две страницы отвечают на один интентотчёт «Эффективность» → фильтр по запросу → вкладка «Страницы»
Индекс забит мусоромрост исключённых при стабильном числе страниц в поискеВебмастер: Индексирование → Страницы в поиске → Исключённые
Правки не дают эффекта сразупервые две недели после исправленияповторная проверка URL в обеих панелях
Таблица прокручивается вбок на узком экране.
noindex не экономит краулинговый бюджет. Робот сначала скачивает страницу и только потом видит директиву в коде. По документации Google смысл склейки в том, чтобы обход тратился на уникальный контент вместо уникальных URL, и noindex эту задачу не решает.

Где искать дубли: Вебмастер и Search Console

В Яндекс Вебмастере путь один: Индексирование → Страницы в поиске → Исключённые страницы, фильтр по статусу «Удалено: Дубль». В выгрузке архива этот статус приходит как DUPLICATE, так что список удобно обрабатывать скриптом. После визита робота страница исключается из поиска в течение трёх недель — до этого срока паниковать рано.

Важное ограничение Яндекса: дублями признаются страницы внутри одного сайта. Копию вашего текста на чужом домене этот отчёт не покажет никогда.

В Search Console дубли рассыпаны по четырём статусам отчёта «Индексирование страниц»: «Страница является копией. Канонический вариант не выбран пользователем», «Страница является копией. Канонические версии страницы, выбранные Google и пользователем, не совпадают», «Вариант страницы с тегом canonical» и «Страница с переадресацией». Первые два — проблемные, вторые два — нормальная работа склейки.

Схема отчёта индексирования Search Console с четырьмя статусами дублей и числами страниц
Красным — то, что разбирают в первую очередь. Два нижних статуса означают, что склейка отработала штатно.

Таблица примеров показывает максимум 1000 URL на статус, поэтому на крупном сайте она даёт только выборку. Массово сверять «объявленный пользователем canonical» с «каноническим URL, выбранным Google» приходится через URL Inspection API: квота — 2000 запросов в сутки и 600 в минуту на один ресурс Search Console. Тысяча URL в день — рабочий темп, за неделю закрывается средний магазин. Про настройку доступа и остальные отчёты панели у меня есть отдельный разбор Search Console.

Оператор site: для подсчёта дублей не годится. Джон Мюллер публично разбирал случай, где из 180 проиндексированных URL оператор показал 28, и объяснял, что выдача по site: не даёт полной коллекции страниц и для диагностики не предназначена. Оператор cache: тоже мёртв: ссылки на кэш убрали из выдачи в начале 2024 года, 11 сентября 2024 их заменили на Internet Archive, а к 24 сентября оператор перестал работать и исчез из документации. Проверить проиндексированную версию страницы теперь можно только инструментом проверки URL на своём ресурсе.

Краулер: как достать почти-дубли

Панели показывают то, что робот уже решил. Краулер показывает то, что робот увидит завтра, и находит частичные совпадения, которых в панелях нет вообще. Здесь есть одна засада, на которую попадаются почти все.

1
Включите Near DuplicatesConfig → Content → Duplicates. По умолчанию поиск почти-дублей выключен, и обход без этой галки покажет только точные копии по MD5-хэшу полного HTML. Именно поэтому многие уверены, что у них «дублей нет».
2
Уберите шаблон из анализаШапка и подвал исключаются автоматически. Меню категорий, сайдбар, блок «похожие товары» и хлебные крошки — руками, по тегу, классу или id. Иначе у вас сойдутся по 92% страницы с разным содержанием.
3
Опустите порог схожестиАлгоритм — minhash, порог по умолчанию 90%. Для карточек товара с вариациями цвета и размера его имеет смысл опустить до 80–85%, иначе половина совпадений не попадёт в отчёт.
4
Запустите Crawl AnalysisОтчёт по почти-дублям заполняется после завершения обхода, на отдельном этапе анализа. До него колонка выглядит пустой, и это нормально.
5
Сверьте выгрузку с индексомЭкспорт Duplicates сопоставьте со списком исключённых из Вебмастера. Совпадения — приоритет на исправление, остальное — фон.
Чем искать дубли: возможности и цены на 2026 год
ИнструментБесплатноПлатноЧто даёт по дублям
Screaming Frog SEO Spider500 URL за обход£199 за лицензию в год; от 5 лицензий £189, от 10 — £179, от 20 — £169Точные дубли по MD5-хэшу HTML, почти-дубли по minhash с настраиваемым порогом, исключение шапки, подвала и произвольных тегов, классов, id
Netpeak Spider500 URL и 5 потоков$20 в месяц, $193 в год, $496 пожизненно; триал 3 дня, возврат 14 днейОтчёты по дублирующимся Title, Description, H1 и тексту, интерфейс на русском
URL Inspection APIвходит в Search ConsoleСверка объявленного каноникала с выбранным Google; 2000 запросов в сутки и 600 в минуту на ресурс
Таблица прокручивается вбок на узком экране.

Для сайта на 300–400 страниц бесплатных 500 URL хватает с запасом, покупать лицензию под разовую задачу смысла нет. Лимит начинает жать на магазинах: там фильтры генерируют десятки тысяч адресов, и обход упирается в потолок на первой же категории.

Что выбрать для склейки в каждом случае

Google ранжирует сигналы канонизации по силе: редирект — strong signal, rel=canonical — strong signal, включение URL в sitemap.xml — weak signal. Из этого следует практический вывод: класть дубль в карту сайта и надеяться на склейку бессмысленно, карта только подсказывает.

Ситуация → метод склейки
СитуацияМетодПочему так
www / без www, http / https301 на всех зеркалахДирективу Host Яндекс отменил 12 марта 2018 года и просто игнорирует; других способов нет
Слеш и его отсутствие, /index.php301Страница-дубль пользователю не нужна, доступной её держать незачем
Товар в нескольких категорияхrel=canonical на основной URLОбе страницы должны оставаться доступными для покупателя
UTM и метки трекингаcanonical на чистый URL плюс Clean-param для ЯндексаСсылку из рассылки нельзя редиректить, она потеряет метку
Фильтры фасетной навигацииrobots.txt или фильтры на фрагментах URLGoogle называет эти способы «generally more effective in the long term», про canonical пишет, что он «may decrease crawl volume over time»
Пустая комбинация фильтров404Прямая рекомендация документации по фасетной навигации
Сортировки внутри категорииnoindex или robots.txtРекомендация из документа Google про пагинацию
Пагинацияcanonical каждой страницы на саму себяGoogle не использует rel=next/prev и запрещает канонизировать серию на первую страницу
Версия для печатиcanonical на основную версиюКонтент совпадает, страница нужна пользователю
Внутренний поискDisallow в robots.txtБесконечная генерация URL, индексировать нечего
Тестовый поддоменHTTP-авторизацияЗакрытие в robots.txt не мешает попасть в индекс по внешней ссылке
Синдикация на партнёрском сайтепартнёр ставит noindexДля межсайтовых случаев Google рекомендует именно так; canonical между доменами Яндекс игнорирует
Таблица прокручивается вбок на узком экране.
Блок-схема выбора между 301, canonical, robots.txt и noindex при склейке дублей
Правый блок — четыре прямых запрета из документации Google по консолидации URL.

Отдельно про noindex внутри одного сайта. Google пишет прямым текстом: «We don't recommend using noindex to prevent selection of a canonical page within a single site, because it will completely block the page from Search». Страница выпадет из поиска целиком, вместе со своими сигналами. Для межсайтовой синдикации рекомендация обратная — там noindex у партнёра как раз правильное решение. Про то, какие директивы что делают, я подробно разбирал в материале о закрытии сайта от индексации.

Метки, фильтры и пагинация: три разных случая

Здесь Яндекс и Google разошлись сильнее всего, и универсального решения нет. Google закрыл инструмент «Параметры URL» в Search Console: правила перестали учитываться 26 апреля 2022 года, сам инструмент отключили 28 апреля. Причина в анонсе прямая — полезной оказалась примерно 1% заданных конфигураций. Замены не появилось, с тех пор Google разбирается с параметрами сам.

Яндекс пошёл в другую сторону. 12 декабря 2025 года в Вебмастере появилась «Настройка GET-параметров» (Индексирование → Настройка GET-параметров). Робот сам показывает найденные на сайте параметры, для каждого вы ставите «Да» или «Нет» в колонке «Учитывать параметр?». Изменения вступают в силу в течение недели.

Экран настройки GET-параметров в Яндекс Вебмастере с переключателями учёта параметров
Жёлтым — параметры, которые сознательно оставляют в учёте. Найденные роботом строки из списка не удаляются.
Работа с параметрами: Яндекс против Google
Что делаемЯндексGoogle
Инструмент в панели«Настройка GET-параметров» с 12.12.2025, эффект в течение недели«Параметры URL» отключены 28.04.2022, замены нет
Директива в robots.txtClean-param: до 500 символов на правило, регистр учитывается, работает только для робота ЯндексаClean-param не поддерживается, остаётся Disallow
Приоритет правилDisallow сильнее Clean-param; при конфликте панели и robots.txt побеждает запретDisallow в robots.txt
Метки utm и gclidcanonical на чистый URL плюс Clean-paramcanonical на чистый URL
Фильтры каталогаClean-param или Disallow по параметруrobots.txt или фрагменты URL; canonical работает медленнее
Пагинацияс 04.07.2019 может показать неканоническую страницу, если она релевантнееcanonical каждой страницы на себя, rel=next/prev не используется
Таблица прокручивается вбок на узком экране.

Про пагинацию стоит держать в голове ещё один нюанс. С 4 июля 2019 года Яндекс может показать в поиске неканоническую страницу, если её содержимое существенно отличается от канонической и она релевантнее запросу — в примерах самого Яндекса это страницы форумной темы и постраничные части литературного произведения. Приоритет у канонических страниц сохраняется, но рассчитывать на жёсткое склеивание серии не нужно.

Clean-param ломается о длину. Ограничение — 500 символов на правило, и на магазине с полутора десятками фильтров вы в него упираетесь быстрее, чем кажется. Разбивайте на несколько директив по разделам сайта и проверяйте, что нужные URL не попали заодно под Disallow: закрытый в Disallow адрес Clean-param уже не обработает. Как это уживается с остальным содержимым файла, разбирал в материале про robots.txt и sitemap.xml.

Частые ошибки склейки

Восемь из десяти проблем с дублями на аудитах — это не отсутствие склейки. Склейка стоит, она просто не работает, потому что нарушено одно из условий. Ниже то, что встречается чаще всего.

Что ломает склейку
ОшибкаЧто происходитКак правильно
canonical ведёт на страницу, закрытую в robots.txtЯндекс игнорирует указание: канонический адрес недоступен для роботаОткрыть целевую страницу для обхода
Цепочка canonical: 1 → 2, 2 → 3Яндекс игнорирует всю конструкциюВсе дубли указывают напрямую на конечный URL
canonical на другой домен или поддоменЯндекс межсайтовый canonical не поддерживает301 или noindex на стороне копии
Несколько canonical в коде одной страницыУказание игнорируется целикомОдин тег, проверять после правок шаблона и плагинов
Фрагмент в каноническом адресе: /page/#tab2Прямой запрет GoogleКанонический URL без якоря
Разные методы задают разные каноникалыПрямой запрет Google, сигналы конфликтуютОдин источник правды: тег, редирект и sitemap согласованы
canonical пагинации на первую страницуПрямой запрет Google для серийКаждая страница канонизируется на себя
noindex на странице, закрытой в robots.txtДирективу никто не прочитает: «For the noindex rule to be effective, the page or resource must not be blocked by a robots.txt file»Сначала открыть обход, потом ставить noindex
noindex ради выбора каноники внутри сайтаСтраница выпадает из поиска целикомrel=canonical или 301
robots.txt или удаление URL как способ канонизацииОба варианта в списке прямых запретов GoogleРедирект или canonical
Содержимое канонической страницы сильно отличаетсяЯндекс игнорирует указаниеСклеивать только реально совпадающие страницы
Таблица прокручивается вбок на узком экране.
Не ждите результата на следующий день. Google в обновлении документации от 10 июля 2026 года добавил срок: даже после исправления страницы могут оставаться в кластере дублей до двух недель, и разъединяются быстрее, если разница между ними явная и существенная. Яндекс исключает страницу из поиска в течение трёх недель после визита робота. Гарантированного срока выпадения по noindex у Google нет вообще — переобход зависит от важности страницы и может занять месяцы.

Отсюда практическое правило: контрольную проверку ставьте не раньше чем через три-четыре недели после внедрения. Всё, что вы увидите раньше, — промежуточная картина, по ней нельзя судить, сработало решение или нет. Ускорить переобход частично можно, про способы писал в материале про ускорение индексации.

Дубли текста между своими страницами

Технические дубли — это URL. Текстовые — это содержание, и панели их почти не ловят. Google и Яндекс могут держать обе страницы в индексе, при этом обе будут стоять плохо, потому что робот не понимает, какая из них отвечает на запрос.

Три типовых источника. Первый — карточки-вариации: одна модель кроссовок в шести размерах, у каждой свой URL и одинаковое описание на 400 знаков. Второй — региональные подстраницы, где меняется только название города в заголовке и первом абзаце. Третий — теги и категории, которые пересекаются по составу товаров и получают одинаковый SEO-текст внизу.

Порог 90% в краулере такие случаи пропускает, потому что города и размеры дают формальное различие. Опустите его до 80% и заодно исключите из анализа меню, сайдбар и блок рекомендаций — иначе отчёт утонет в шаблоне.

Дальше решение по каждой группе. Вариации собираются в одну карточку с выбором размера, лишние URL уходят на 301 или получают canonical. Региональные страницы либо наполняются реальной локальной фактурой — адреса, цены, кейсы, отзывы из этого города, — либо схлопываются в одну. Пересекающиеся теги проверяются на спрос: если под тег нет своего кластера запросов, страница закрывается. Как разводить интенты по посадочным, разбирал в материале про кластеризацию запросов.

Каннибализацию удобно ловить в отчёте «Эффективность» Search Console: фильтр по конкретному запросу, вкладка «Страницы». Если по одному запросу за квартал показывались два-три URL и все болтаются во второй-третьей десятке, вы нашли пару на объединение. Заголовки при этом тоже стоит развести — про это отдельный разбор по Title, Description и H1.

Процент уникальности из антиплагиата к дублям отношения не имеет. Это метрика приёмки текста у копирайтера. Поисковик сравнивает страницы своими алгоритмами и по своему набору блоков: 100% уникальности по сервису проверки спокойно уживается с двумя страницами в одном кластере дублей, если у них совпадают структура, заголовки и смысл.

Когда контент воруют у вас

Первое, что нужно знать: инструмент «Оригинальные тексты» в Яндекс Вебмастере больше не поддерживается. Застолбить авторство текста заранее через него нельзя. Вместо этого Яндекс рекомендует сообщать о новом контенте через «Переобход страниц» или «Обход по счётчикам Метрики».

Логика простая: выигрывает тот, чью страницу робот увидел первой. Поэтому рабочая защита — скорость индексации собственных публикаций. У «Переобхода страниц» суточный лимит выделяется на основной домен и все поддомены вместе, актуальное значение показано в интерфейсе рядом с полем ввода. Заявка обрабатывается не более трёх дней, данные в поиске обновляются в течение двух недель после визита робота. Для массовой отправки Яндекс отправляет к обходу по счётчикам Метрики.

У Google дублирование само по себе в спам-политиках не выделено. Там есть отдельный раздел про скрейпинг.

«Scraping refers to the practice of taking content from other sites, often through automated means, and hosting it with the purpose of manipulating search rankings». В примерах: перепубликация без собственных дополнений и указания источника, копирование с заменой слов синонимами, воспроизведение чужих фидов и встраивание чужого контента без существенной добавленной ценности. Раздел обновлён 15 мая 2026 года.

На практике реакция зависит от того, кто украл. Копия на слабом сайте обычно не двигается вообще и внимания не стоит. Копия на сильном домене, проиндексированная раньше вашей, — повод идти по процедуре жалобы правообладателя в поиске и параллельно писать хостеру. Доказывать первенство стало сложнее: оператор cache: отключён, посмотреть дату сохранённой копии чужой страницы в Google больше нельзя, остаются собственные логи, дата публикации в вашей CMS и записи в Вебмастере о первом обходе.

Если ваш контент забирают легально — партнёр публикует вашу статью у себя — договаривайтесь о noindex на его стороне. Именно это Google рекомендует для межсайтовой синдикации. Просить партнёра поставить canonical на ваш домен смысла мало: Яндекс межсайтовый canonical игнорирует полностью.

Порядок работ на реальном сайте

Собираю всё в последовательность, по которой сам иду на проектах. Она рассчитана на две-три недели работы с контрольной точкой в конце.

1
Снимите два счётчикаЧисло страниц в поиске и число исключённых со статусом «Удалено: Дубль» в Вебмастере плюс четыре дублевых статуса в Search Console. Это точка отсчёта, без неё вы через месяц не докажете, что стало лучше.
2
Проверьте зеркала рукамиОткройте шесть вариантов главной: http и https, с www и без, со слешом и без. Каждый должен отдавать 301 на один-единственный адрес. Пять минут работы, а ловит проблему, которая множит весь сайт на два.
3
Прогоните краулерС включённым Near Duplicates, исключённым шаблоном и порогом 80–85%. Выгрузите отчёты по точным дублям, почти-дублям и повторяющимся Title.
4
Разложите находки по причинамПараметры отдельно, фильтры отдельно, пагинация отдельно, текстовые совпадения отдельно. Одна причина — одно решение на всю группу, поштучно такие вещи не чинят.
5
Выберите метод по таблице301 там, где страница пользователю не нужна. canonical там, где нужна. robots.txt для фасетов. noindex только для межсайтовых случаев и сортировок.
6
Настройте параметры в панеляхClean-param в robots.txt с оглядкой на лимит 500 символов и «Настройка GET-параметров» в Вебмастере. Проверьте, что настройки не спорят между собой: при конфликте побеждает запрет.
7
Отправьте на переобходКлючевые канонические страницы — через «Переобход страниц», массово — через обход по счётчикам Метрики. В Search Console — проверка URL и запрос на индексирование для приоритетных адресов.
8
Вернитесь через три-четыре неделиСнимите те же два счётчика и сравните. Раньше смотреть бесполезно: Google держит страницы в кластере до двух недель, Яндекс исключает в течение трёх.

Если после месяца исключённых стало меньше, а страниц в поиске больше или столько же — работа сделана правильно. Если исключённые продолжают расти, ищите генератор: обычно это новый фильтр, скрипт сортировки или плагин, который начал плодить URL с параметрами. Проверять такие вещи удобно в связке с регулярным разбором технической части — что смотреть, я расписывал в экспресс-аудите.

Частые вопросы

Сколько дублей на сайте допустимо?
Формального лимита нет. Google в документации по канонизации пишет, что часть дублирующегося контента на сайте нормальна и не нарушает спам-политики. Смотреть надо на динамику: если исключённых со статусом «Дубль» в разы больше, чем страниц в поиске, и число растёт — где-то работает генератор URL.
Дубли — это фильтр или санкция?
Нет. В спам-политиках Google дублирование само по себе не выделено как нарушение, там есть только раздел про скрейпинг — копирование чужого контента ради манипуляции ранжированием. Свои дубли ухудшают ранжирование механически: сигналы делятся между копиями, релевантность размывается.
Через сколько дубли уйдут после исправления?
Google после правки может держать страницы в кластере дублей до двух недель, быстрее разъединяет при явной и существенной разнице. Яндекс исключает страницу из поиска в течение трёх недель после визита робота. По noindex гарантированного срока Google не даёт — переобход зависит от важности страницы и может занять месяцы.
Можно закрыть дубли в robots.txt?
Как способ канонизации — нельзя, это один из четырёх прямых запретов Google. Для фасетной навигации robots.txt наоборот рекомендован в первую очередь и назван более эффективным в долгую, чем canonical. И помните: noindex на странице, закрытой в robots.txt, не сработает, робот просто не прочитает директиву.
Что выбрать: 301 или rel=canonical?
Google считает оба сигнала сильными. Решает доступность страницы: если дубль пользователю не нужен — 301, если страница должна открываться (карточка в двух категориях, версия для печати, ссылка с меткой) — canonical. Смешивать методы на одной странице нельзя, разные каноникалы разными способами Google запрещает прямо.
Как посмотреть, какую страницу Google считает канонической?
Инструментом проверки URL в Search Console: он показывает «объявленный пользователем» и «выбранный Google» канонический адрес. Массово — через URL Inspection API с квотой 2000 запросов в сутки и 600 в минуту на ресурс. Оператор cache: для этого больше не годится, он отключён к 24 сентября 2024 года.
Помогает ли оператор site: искать дубли?
Нет. Джон Мюллер публично объяснял, что выдача по site: не даёт полной коллекции страниц сайта и для диагностики не предназначена: в разобранном случае из 180 проиндексированных URL оператор показал 28. Считать индекс нужно в Search Console и Яндекс Вебмастере.
Как убрать дубли с utm-метками?
Поставьте на страницу canonical с чистым адресом без параметров. Для Яндекса добавьте Clean-param в robots.txt (лимит 500 символов на правило, регистр учитывается) и выключите учёт меток в разделе «Настройка GET-параметров» Вебмастера — изменения вступают в силу в течение недели. У Google отдельного инструмента для параметров нет с апреля 2022 года.
Как правильно канонизировать пагинацию?
Каждая страница серии получает canonical на саму себя. Google не использует rel=next/prev и прямо запрещает указывать первую страницу серии канонической для остальных. Отсортированные и отфильтрованные варианты выдачи при этом закрывают noindex или robots.txt.
Почему rel=canonical не сработал?
Типовые причины: цепочка вида 1 → 2, 2 → 3, несколько тегов canonical в коде, фрагмент # в адресе, указание на другой домен (Яндекс межсайтовый canonical игнорирует), недоступность или закрытость целевой страницы от индексирования, слишком сильное различие содержимого. Проверьте страницу по этому списку до того, как менять метод.
Нужен ли платный краулер, чтобы найти дубли?
Для сайта до 500 страниц хватит бесплатных версий: Screaming Frog даёт 500 URL за обход, Netpeak Spider — 500 URL и 5 потоков. Платить приходится на магазинах, где фильтры генерируют десятки тысяч адресов: лицензия Screaming Frog стоит £199 в год, Netpeak Spider Pro — $20 в месяц или $193 в год.
Что делать, если мой текст скопировали?
Инструмент «Оригинальные тексты» в Яндекс Вебмастере больше не поддерживается, застолбить авторство заранее нельзя. Рабочая тактика — быстро индексировать свои публикации через «Переобход страниц» или обход по счётчикам Метрики. Если копия на сильном домене обгоняет вас в выдаче, идите по процедуре жалобы правообладателя и параллельно пишите хостеру.

Главное

Если коротко

Дубли — это не приговор и не санкция: Google сам пишет, что часть дублирующегося контента на сайте нормальна. Вред начинается там, где копии множатся механически и растаскивают сигналы между собой: ссылки, поведение и релевантность делятся на два, и в топ не идёт ни одна страница. Ищите их в Вебмастере по статусу «Удалено: Дубль» и в четырёх дублевых статусах Search Console, а частичные совпадения — краулером с включённым поиском почти-дублей и порогом ниже дефолтных 90%. Метод склейки выбирайте по доступности страницы: 301 для того, что пользователю не нужно, canonical для того, что должно открываться, robots.txt для фасетов, noindex только для сортировок и межсайтовой синдикации. Проверьте себя по списку запретов: цепочки canonical, межсайтовые указания, фрагменты в адресе, noindex под Disallow и robots.txt в роли канонизатора ломают склейку молча. И заложите время: до двух недель в кластере у Google, до трёх недель на исключение у Яндекса, поэтому контрольный замер ставьте через месяц после внедрения.

Веду проекты и считаю их экономику на живых цифрах, пишу об этом в Telegram. Нужен разбор вашего случая — напишите через бриф.

Больше разборов в Telegram — «Digital-трафик»

Читать дальше

Все статьи
Ссылка скопирована