Поисковый робот (краулер, паук) переходит по ссылкам, скачивает HTML и передаёт в индекс. Googlebot и Яндекс-бот — основные для рунета.
Управление роботом: robots.txt, meta robots, каноникал, sitemap. Анализ логов показывает, какие страницы робот реально обходит.
Робот ходит не подряд по сайту, а по очереди URL, которую формирует планировщик: новые и часто меняющиеся страницы он навещает чаще, «мёртвые» разделы — раз в недели. На этот ритм влияет краулинговый бюджет — если на сайте десятки тысяч мусорных URL (фильтры, сортировки, сессионные параметры), робот тратит обходы на них и не доходит до новых карточек. Поэтому закрывать дубли в robots.txt и склеивать через каноникал нужно чтобы перенаправить обход на важное.
Частая ошибка — путать запрет обхода и запрет индексации. Disallow в robots.txt не убирает страницу из выдачи: робот не скачивает её, но URL может попасть в индекс по внешним ссылкам с пустым сниппетом. Чтобы выкинуть страницу, нужен meta robots noindex или заголовок X-Robots-Tag — но тогда страницу нельзя закрывать в robots.txt, иначе робот не увидит сам тег. Проверять реальное поведение удобнее всего по логам сервера: там видно, какой бот, как часто и какие коды ответа получает.
Разрешает или запрещает скачивание URL, но не управляет попаданием в выдачу.
noindex убирает страницу из индекса — но только если робот может её скачать и прочитать тег.
Указывает роботу основной URL среди дублей, чтобы вес и сниппет шли на одну страницу.
Интернет-магазин на 4000 товаров генерил из фильтров около 120 000 URL вида /catalog/?color=red&size=42&sort=price. По логам Яндекс-бот тратил 70% обходов на эти комбинации, а свежие карточки попадали в индекс через 3-4 недели. Закрыли параметры через Clean-param и robots.txt — за месяц доля обходов товарных страниц выросла с 18% до 61%, среднее время индексации новинки упало до 2-3 дней.