ГлавнаяГлоссарийПоисковый робот

Поисковый робот

Search crawler, bot

Автоматическая программа, которая обходит сайты и собирает страницы для индекса.

Поисковый робот (краулер, паук) переходит по ссылкам, скачивает HTML и передаёт в индекс. Googlebot и Яндекс-бот — основные для рунета.

Управление роботом: robots.txt, meta robots, каноникал, sitemap. Анализ логов показывает, какие страницы робот реально обходит.

робот-краулер сайт Индекс поисковика pawetta.com/ ✓ pawetta.com/glossary/ ✓ pawetta.com/glossary/canonical/✓ pawetta.com/admin/ ✗ noindex pawetta.com/cart/ ✗ noindex
Поисковый робот (краулер) обходит сайт по ссылкам, проверяет правила robots.txt и meta, и формирует индекс поисковика

Робот ходит не подряд по сайту, а по очереди URL, которую формирует планировщик: новые и часто меняющиеся страницы он навещает чаще, «мёртвые» разделы — раз в недели. На этот ритм влияет краулинговый бюджет — если на сайте десятки тысяч мусорных URL (фильтры, сортировки, сессионные параметры), робот тратит обходы на них и не доходит до новых карточек. Поэтому закрывать дубли в robots.txt и склеивать через каноникал нужно чтобы перенаправить обход на важное.

Частая ошибка — путать запрет обхода и запрет индексации. Disallow в robots.txt не убирает страницу из выдачи: робот не скачивает её, но URL может попасть в индекс по внешним ссылкам с пустым сниппетом. Чтобы выкинуть страницу, нужен meta robots noindex или заголовок X-Robots-Tag — но тогда страницу нельзя закрывать в robots.txt, иначе робот не увидит сам тег. Проверять реальное поведение удобнее всего по логам сервера: там видно, какой бот, как часто и какие коды ответа получает.

Обход
robots.txt

Разрешает или запрещает скачивание URL, но не управляет попаданием в выдачу.

Индексация
meta robots / X-Robots-Tag

noindex убирает страницу из индекса — но только если робот может её скачать и прочитать тег.

Склейка
rel=canonical

Указывает роботу основной URL среди дублей, чтобы вес и сниппет шли на одну страницу.

Три способа управлять тем, что робот видит и кладёт в индекс.
Пример

Интернет-магазин на 4000 товаров генерил из фильтров около 120 000 URL вида /catalog/?color=red&size=42&sort=price. По логам Яндекс-бот тратил 70% обходов на эти комбинации, а свежие карточки попадали в индекс через 3-4 недели. Закрыли параметры через Clean-param и robots.txt — за месяц доля обходов товарных страниц выросла с 18% до 61%, среднее время индексации новинки упало до 2-3 дней.