Robots.txt и sitemap.xml — два первых файла, которые проверяет поисковый робот, заходя на сайт. Криво настроенный robots может закрыть весь сайт от индексации. Без sitemap робот дольше находит страницы — особенно на большом сайте или при слабой перелинковке. Разберу с нуля: что это, как настроить, какие ошибки убивают позиции.
robots.txt — инструкция для поискового робота: куда можно ходить, а куда нет. sitemap.xml — карта сайта со списком всех важных страниц для быстрой индексации. Оба файла лежат в корне сайта, проверяются по адресам ваш-сайт.ru/robots.txt и ваш-сайт.ru/sitemap.xml. Без них SEO не работает. Шаблоны и инструкции — в этой статье.
Что такое robots.txt
robots.txt — это текстовый файл с инструкциями для поисковых роботов. Лежит в корне сайта, доступен по адресу https://ваш-сайт.ru/robots.txt.
Когда поисковый робот Яндекса или Google заходит на сайт, первое, что он делает — открывает robots.txt и читает, куда можно ходить, а куда нет. Если файла нет — робот считает, что можно везде. Если файл есть, но с ошибкой — может случайно закрыть весь сайт.
Robots.txt — это рекомендация, не запрет на 100%. «Хорошие» роботы (Яндекс, Google, Bing) её соблюдают. «Плохие» (парсеры, спам-боты) — игнорируют. Поэтому robots.txt не используют для защиты приватных данных — он только для управления индексацией.
Базовая логика проста: пишете директивы, что можно («Allow») и что нельзя («Disallow») для конкретных разделов сайта.
Как написать robots.txt — рабочие шаблоны
Минимальный рабочий robots.txt для большинства сайтов:
User-agent: *
Disallow: /admin
Disallow: /cart
Disallow: /search
Disallow: /*?utm_
Allow: /
Sitemap: https://ваш-сайт.ru/sitemap.xml
Что здесь:
- User-agent: * — правила для всех роботов;
- Disallow: /admin — закрываем админку;
- Disallow: /cart — корзину (нечего индексировать);
- Disallow: /search — внутренний поиск сайта;
- Disallow: /*?utm_ — страницы с UTM-метками (дубли);
- Allow: / — всё остальное можно индексировать;
- Sitemap: — ссылка на карту сайта.
Для интернет-магазина добавьте закрытие фасетной навигации с мусорными параметрами:
Disallow: /*sort=
Disallow: /*order=
Disallow: /*filter=
Пиши параметр без ? и & в начале (/*filter=, не /*?filter=): тогда правило ловит параметр на любой позиции в URL — и когда он первый (?filter=), и когда идёт после других (&filter=).
Для блога закройте служебные страницы:
Disallow: /author/
Disallow: /tag/
Disallow: /feed/
Раздельные правила для Яндекса и Google (если нужны):
User-agent: Yandex
Disallow: /admin
Crawl-delay: 2
User-agent: Googlebot
Disallow: /admin
Crawl-delay: 2 — пауза между запросами в секундах. Полезно, если сервер слабый. Google эту директиву игнорирует, Яндекс — соблюдает.
User-agent: * Disallow: /admin/ # служебное Disallow: /cart/ # корзина Disallow: /*sort= # сортировки-дубли на любой позиции Disallow: /search/ # внутренний поиск Sitemap: https://site.ru/sitemap.xml
Clean-param, Host и robots для CMS
Две директивы, о которых часто забывают. Clean-param велит Яндексу игнорировать GET-параметры (UTM-метки, сортировки, session id), чтобы один товар не плодил десятки дублей: Clean-param: utm_source&utm_medium /catalog/. Host раньше указывал главное зеркало — сейчас устарел, зеркала задаются 301-редиректом, и из robots его можно убрать.
У конструкторов и CMS свои нюансы. На Тильде robots правится в «Настройках сайта», в WordPress (вордпресс) файл отдаёт SEO-плагин Yoast или Rank Math, на Битрикс — модуль «Поиск». Google и Яндекс читают один и тот же файл, но Clean-param понимает только Яндекс; у гугла для параметров свои правила. Рядом появился llms.txt — отдельный файл-подсказка для AI-ботов, в robots.txt его не кладут, но ссылаются на него всё чаще.
Топ-7 ошибок в robots.txt
- 1
Disallow: / без условий
✗Disallow: /Закрывает весь сайт от индексации. Самая частая ошибка после тестового сервера или переноса — проверяйте robots.txt сразу после релиза.
- 2
Закрытие CSS и JS
✗Disallow: /css/✗Disallow: /js/Поисковики читают эти файлы, чтобы понять, как выглядит страница; без них сайт ранжируется хуже. Что ресурсы не закрыты по ошибке, проверяют через валидатор микроразметки или анализ кода страницы.
- 3
Закрытие важных разделов
✗Disallow: /catalog/И весь каталог выпадает из индекса. Перепроверяйте каждую строку Disallow — что именно вы закрываете.
- 4
Пробелы перед директивами
✗·Disallow:✓Disallow:С пробелом в начале строки директива не срабатывает. Пишите с первого символа, без отступа.
- 5
Скрытие секретов через robots.txt
✗Disallow: /admin/Файл публичный — его видят все, включая злоумышленников. Пути к админке и тестовым серверам туда не пишут: это готовая подсказка, куда стучаться. Закрывайте их авторизацией.
- 6
Нет ссылки на sitemap
✓Sitemap: https://site.ru/sitemap.xmlБез неё робот не знает, где карта сайта. Всегда добавляйте строку Sitemap: в конце файла.
- 7
Кириллица в URL без кодировки
✗Disallow: /категория✓Disallow: /kategoriyaКириллица в путях работает не везде. Используйте URL-encoded формат или сразу транслит — например, через генератор транслита и ЧПУ-адресов.
Что такое sitemap.xml
sitemap.xml — это карта сайта в формате XML, в которой перечислены все важные страницы. Лежит в корне сайта (https://ваш-сайт.ru/sitemap.xml) или указывается в robots.txt.
Зачем нужен sitemap, если робот и так может ходить по ссылкам:
- Ускоряет индексацию. Робот видит весь список страниц сразу — не нужно ходить по ссылкам, чтобы их найти. Особенно важно для новых сайтов и больших каталогов.
- Помогает найти страницы без внутренних ссылок. Если на страницу никто не ссылается, робот её не найдёт. Sitemap решает.
- Передаёт метаданные. Ориентируйтесь на спецификацию schema.org для правильной структуры метаданных в XML. Можно указать дату последнего изменения, приоритет, частоту обновлений.
Без sitemap сайт тоже будет индексироваться, но медленнее. Подробнее про ускорение индексации — в отдельной статье.
Как создать sitemap.xml
Три способа в зависимости от размера сайта.
1. Через CMS — большинство сайтов. WordPress, Bitrix, Tilda, OpenCart, Shopify умеют генерировать sitemap автоматически. В WordPress есть плагины Yoast SEO, RankMath. В Tilda — настройка в кабинете. Проверьте — обычно sitemap уже есть.
2. Через онлайн-сервисы — для статических и небольших сайтов. XML-Sitemaps.com (бесплатно до 500 URL), Screaming Frog (бесплатно до 500 URL). Генерируете один раз, загружаете в корень сайта, обновляете по необходимости.
3. Скриптом — для больших сайтов. Если у вас 50 000+ страниц, нужен скрипт, который автоматически обновляет sitemap при добавлении новых страниц. Программисты пишут это за пару часов.
Минимальный sitemap.xml выглядит так:
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://ваш-сайт.ru/</loc>
<lastmod>2026-06-07</lastmod>
<priority>1.0</priority>
</url>
<url>
<loc>https://ваш-сайт.ru/uslugi/</loc>
<lastmod>2026-06-07</lastmod>
<priority>0.9</priority>
</url>
</urlset>
После создания файла обязательно подайте его в Яндекс.Вебмастер (раздел «Индексирование → Файлы Sitemap») и Google Search Console.
Как прописать Sitemap в robots.txt
Чтобы поисковик быстрее нашёл карту сайта, ссылку на неё добавляют прямо в robots.txt отдельной директивой Sitemap. Это связывает два файла: робот открывает robots.txt и сразу видит, где лежит sitemap.xml. Синтаксис — одна строка с полным адресом карты:
Sitemap: https://site.ru/sitemap.xml
Правила директивы Sitemap:
- Только абсолютный URL — со схемой https:// и доменом. Относительный путь
/sitemap.xmlне сработает. - Место — любое. Директива Sitemap не привязана к User-agent, обычно её ставят в конце файла.
- Можно несколько. Если карт несколько (например, обычная и для видео), добавляют по строке
Sitemapна каждую. - Читают и Яндекс, и Google — обе системы понимают директиву одинаково.
Пример готового robots.txt, где sitemap прописан в конце:
User-agent: *
Allow: /
Disallow: /admin/
Sitemap: https://site.ru/sitemap.xml
Когда директиву добавили, проверьте её в Яндекс.Вебмастере — он покажет, видит ли робот карту. Директива в robots.txt не отменяет ручную подачу карты в Вебмастер и Search Console: делайте и то, и другое, чтобы sitemap точно нашли и переобошли. Как ускорить сам обход — в разборе про ускорение индексации.
Что должно быть в sitemap, а чего быть не должно
Должно быть:
- Все коммерческие посадочные страницы;
- Все статьи блога;
- Карточки товаров (для интернет-магазинов);
- Категории и подкатегории;
- Главная страница;
- Страницы услуг.
Чего быть не должно:
- Страницы, закрытые в robots.txt — иначе вы посылаете противоречивые сигналы;
- Страницы с canonical на другие URL — это дубли по сути;
- Страницы с noindex — зачем подавать в sitemap то, что не должно индексироваться;
- Битые ссылки (404);
- Страницы пагинации (page=2, page=3, etc) — индексируется первая, остальные через canonical;
- Внутренний поиск, корзина, фильтры с UTM-метками.
Если страниц очень много: Sitemap.xml ограничен 50 000 URL и 50 МБ. Для большего размера — несколько sitemap-файлов и общий sitemap-index, который их связывает. Это рутинная задача — все CMS делают автоматически.
Как проверить, что robots.txt и sitemap работают
Чек-лист после настройки:
- Откройте файлы в браузере: ваш-сайт.ru/robots.txt и ваш-сайт.ru/sitemap.xml. Оба должны открываться, отвечать кодом 200, показывать содержимое.
- Проверьте robots.txt в Я.Вебмастере. Раздел «Инструменты → Анализ robots.txt». Введите URL страницы — Вебмастер скажет, может робот по нему ходить или нет. Подробнее о Вебмастере — в отдельной статье.
- Подайте sitemap в Вебмастер. Раздел «Индексирование → Файлы Sitemap → Добавить файл Sitemap». Вставьте полный URL. Через 1–2 дня появится статистика обработки.
- Подайте sitemap в Google Search Console. Оба сервиса покажут подробную статистику по индексации и проблемам — Search Console для Google. Раздел «Индексирование → Файлы Sitemap».
- Проверьте через Screaming Frog или аналог. Сделайте crawl сайта — посмотрите, какие страницы доступны для робота. Если важные страницы помечены как «Disallowed» — что-то закрыто.
Если что-то сломано или robots закрывает важные страницы — заметите за 1–2 недели по падению трафика. Лучше один раз настроить правильно, чем потом долго восстанавливаться.
Главное
robots.txt — это инструкции роботу: куда можно, куда нельзя. Лежит в корне сайта. Минимум: User-agent: *, Disallow закрытых разделов, Allow: /, ссылка на sitemap.
sitemap.xml — карта всех важных страниц для быстрой индексации. Лежит в корне сайта. Большинство CMS генерируют автоматически. Обязательно подавайте в Я.Вебмастер и Search Console.
Топ-3 ошибки: Disallow: / без условий (закрывает весь сайт), закрытие CSS/JS, отсутствие ссылки на sitemap в robots.txt. Если не уверены, что у вас всё настроено — закажите SEO-аудит.
Частые вопросы
Что такое файл robots.txt простыми словами?
Это текстовый файл в корне сайта, в котором владелец указывает поисковым роботам, какие разделы сайта можно индексировать, а какие нет. Открывается по адресу ваш-сайт.ru/robots.txt. Без файла робот считает, что можно индексировать всё. С криво настроенным файлом можно случайно закрыть весь сайт.
Зачем нужен sitemap.xml?
Это карта сайта со списком всех важных страниц. Помогает поисковому роботу быстро найти все страницы, особенно если они не связаны между собой ссылками или сайт большой. Без sitemap робот находит новые страницы медленнее — особенно на большом сайте или при слабой перелинковке. Лежит в корне сайта (ваш-сайт.ru/sitemap.xml) и подаётся в Яндекс.Вебмастер и Google Search Console.
Можно ли сделать robots.txt и sitemap самому?
robots.txt — да, это простой текстовый файл. Создаёте в блокноте по шаблону из этой статьи, загружаете в корень сайта. Sitemap.xml для маленького сайта тоже создаётся вручную или через бесплатные сервисы вроде XML-Sitemaps. Для больших сайтов и интернет-магазинов лучше использовать CMS-плагины, которые обновляют sitemap автоматически.
Где должны лежать robots.txt и sitemap.xml?
Оба файла лежат в корне сайта. Robots.txt доступен по адресу ваш-сайт.ru/robots.txt (это стандарт, путь нельзя менять). Sitemap.xml можно класть в любое место, но традиционно — в корне (ваш-сайт.ru/sitemap.xml). Главное — указать путь к sitemap в robots.txt директивой Sitemap: https://...
Что закрывать в robots.txt?
Стандартный набор: админку (/admin), корзину (/cart), внутренний поиск (/search), страницы фильтров с UTM-метками, страницы пагинации (если не используете canonical). Для интернет-магазинов — мусорные комбинации фасетной навигации. Для блога — теги, авторы, RSS-фиды. Не закрывайте CSS/JS — поисковики используют их для анализа страницы.
Как проверить, правильно ли настроен robots.txt?
Самый надёжный способ — раздел «Инструменты → Анализ robots.txt» в Яндекс.Вебмастере. Вводите URL любой страницы, и Вебмастер скажет, может робот по нему ходить или нет. Также проверьте, что важные страницы (главная, услуги, статьи) НЕ помечены как «Disallowed». Через Screaming Frog можно сделать crawl и увидеть все заблокированные URL.
Под рукой: генератор robots.txt, генератор sitemap.xml и анализ карты сайта — собрать и проверить файлы за минуту.
