Генератор robots.txt
Собирает корректный robots.txt для Яндекса и Google: правила Disallow/Allow, Sitemap, Host и Crawl-delay. Пресеты быстро закрывают служебные разделы.
Что умеет robots.txt и чего он не умеет
robots.txt — текстовый файл в корне сайта, который говорит поисковым роботам, куда ходить не нужно. Работает он на доверии: это рекомендация, соблюдать её никто не обязан. Добросовестные роботы её соблюдают, парсеры и сборщики контента игнорируют, поэтому закрывать через robots.txt что-то секретное бессмысленно.
Главное недоразумение вокруг файла — путать запрет обхода с запретом индексирования. Disallow говорит «не заходи на страницу»; про выдачу там нет ни слова. Если на закрытую страницу ведут ссылки, поисковик может показать её в результатах без описания. Чтобы страницы точно не было в выдаче, нужен метатег noindex — и тогда доступ к ней в robots.txt закрывать нельзя, иначе робот не увидит сам запрет.

| Директива | Что делает | Тонкость |
|---|---|---|
| User-agent | К кому обращена секция | Робот читает свою секцию и игнорирует остальные. |
| Disallow | Не обходить путь | Не гарантирует отсутствия в выдаче. |
| Allow | Исключение из запрета | Более длинное правило побеждает. |
| Sitemap | Адрес карты сайта | Действует для всех роботов сразу. |
| Clean-param | Склейка адресов с параметрами | Понимает только Яндекс. |
Файл читается сверху вниз, но приоритет у правил по длине: побеждает более конкретное, при конфликте Disallow и Allow побеждает более конкретное правило. Именно поэтому открыть один каталог внутри закрытого раздела можно, а вот запретить его обратно — только более длинным путём.
История: договорённость 1994 года и стандарт 2022-го
Стандарт родился из аварии. В 1994 году роботы, обходившие ранний веб, регулярно клали слабые серверы: обход одного сайта тысячами запросов подряд был обычным делом. Голландский инженер Мартин Костер предложил простое соглашение — файл в корне, куда владелец пишет, какие пути обходить не нужно. Никакого комитета и никакого утверждения: договорённость в почтовой рассылке разработчиков.
Так она и прожила почти тридцать лет — как обычай, который все соблюдают. Официальным документом протокол исключений стал только в 2022 году, когда его описали в RFC 9309. К тому времени накопились и расхождения: Crawl-delay понимают не все, Clean-param остался особенностью Яндекса, а поддержку директивы Noindex внутри robots.txt Google отключил в 2019 году.

Как собрать файл и что проверить
Соберите файл из готовых блоков и проверьте на своём сайте: закрытые разделы не должны мешать обходу нужных страниц. Обязательно укажите адрес карты сайта — это единственная директива, которая помогает роботу вместо того, чтобы запрещать.
После загрузки проверьте файл в панелях вебмастеров: они показывают, как правило применяется к конкретному адресу. Рядом полезны генератор sitemap и проверка микроразметки.
| Где лежит | в корне сайта |
| Статус | рекомендация, не запрет |
| Disallow | запрещает обход, но не выдачу |
| Приоритет | у более длинного правила |
| Автор идеи | Мартин Костер, 1994 |
| Стандарт | RFC 9309, 2022 год |
| Clean-param | только Яндекс |
| Noindex в файле | Google не поддерживает |
Частая ошибка — закрыть служебные каталоги вместе со скриптами и стилями. Робот тогда видит страницу без оформления и считает её сломанной на мобильных. Проверить это можно в инструментах вебмастера через просмотр страницы глазами робота: он покажет ровно то, что видит поисковик. Второй по частоте промах — закрыть весь сайт строкой Disallow: / на тестовом стенде и забыть открыть его при переезде на боевой домен. Проверять эту строку стоит первым делом при любом падении трафика.
Пример: вход → результат
Закрыть /admin/ и /cart/, указать sitemap
User-agent: * Disallow: /admin/ Disallow: /cart/ Sitemap: https://site.ru/sitemap.xml
Собирает корректный robots.txt по галочкам: что закрыть, для каких роботов, где лежит sitemap.
Когда пригодится
- Закрыть служебные разделы от индексации
- Сделать robots.txt для нового сайта
- Указать host и адрес карты сайта
Как пользоваться
- «Закрыть служебное» подставит типовые пути CMS, либо впишите свои в Disallow.
- Добавьте адрес карты сайта — поисковики найдут её быстрее.
- Готовый файл — ниже. Положите его в корень сайта.
Частые вопросы
Что обязательно в robots.txt?
Директива User-agent и хотя бы одно правило (Disallow/Allow). Крайне желательно указать Sitemap. Файл должен лежать в корне: site.ru/robots.txt.
Нужен ли Host?
Директива Host устарела (Яндекс отказался от неё) — оставлена для совместимости со старыми системами. Главный сигнал зеркала сейчас — 301-редирект и Sitemap.
Где этому учат
Похожие инструменты
Все ссылки со страницы по URL: внутренние и внешние отдельно, с анкорами, повторами и nofollow. Плюс коды ответа и выгрузка в CSV.
ОткрытьГенератор Open GraphГотовые og-теги и Twitter Card для страницы. С предпросмотром карточки, проверкой длин и подсказками по размеру картинки.
ОткрытьГенератор sitemap.xmlСоберёт ссылки прямо с вашего сайта по адресу или сделает карту из готового списка URL. lastmod, changefreq, priority.
ОткрытьПроверка микроразметкиURL → какая Schema.org найдена (JSON-LD и микроданные), сколько блоков, есть ли невалидные, плюс Open Graph и Twitter. Дополнение к генератору JSON-LD.
ОткрытьПроверка SSL-сертификатаДомен → срок действия и дата истечения, кем выдан, доверие, совпадение с доменом и список SAN. Чтобы HTTPS не «протух» внезапно.
ОткрытьСравнить с конкурентомДве страницы рядом: объём, дерево заголовков H1–H6, вхождения запроса по зонам, ссылки и мета-теги. Видно, каких подтем не хватает.
ОткрытьКак применять это в продвижении — в разборе robots.txt и sitemap.xml и других материалах блога. Как это работает — в статьях Как закрыть сайт от индексации и Почему сайт не индексируется.
Ещё инструменты для SEO и семантики
Кластеризация запросов и лемматизация, чистка по стоп-словам, генераторы sitemap.xml, robots.txt и редиректов, разметка Schema.org — в разделе 17 инструментов.