ГлавнаяБлогТехническое SEO

robots.txt и sitemap.xml: что это и как настроить

7 июня 202611 мин чтенияТехническое SEO

Robots.txt и sitemap.xml — два первых файла, которые проверяет поисковый робот, заходя на сайт. Криво настроенный robots может закрыть весь сайт от индексации. Без sitemap робот дольше находит страницы — особенно на большом сайте или при слабой перелинковке. Разберу с нуля: что это, как настроить, какие ошибки убивают позиции.

Кратко: что внутри

robots.txt — инструкция для поискового робота: куда можно ходить, а куда нет. sitemap.xml — карта сайта со списком всех важных страниц для быстрой индексации. Оба файла лежат в корне сайта, проверяются по адресам ваш-сайт.ru/robots.txt и ваш-сайт.ru/sitemap.xml. Без них SEO не работает. Шаблоны и инструкции — в этой статье.

Что такое robots.txt

robots.txt — это текстовый файл с инструкциями для поисковых роботов. Лежит в корне сайта, доступен по адресу https://ваш-сайт.ru/robots.txt.

Когда поисковый робот Яндекса или Google заходит на сайт, первое, что он делает — открывает robots.txt и читает, куда можно ходить, а куда нет. Если файла нет — робот считает, что можно везде. Если файл есть, но с ошибкой — может случайно закрыть весь сайт.

Robots.txt — это рекомендация, не запрет на 100%. «Хорошие» роботы (Яндекс, Google, Bing) её соблюдают. «Плохие» (парсеры, спам-боты) — игнорируют. Поэтому robots.txt не используют для защиты приватных данных — он только для управления индексацией.

Базовая логика проста: пишете директивы, что можно («Allow») и что нельзя («Disallow») для конкретных разделов сайта.

Как написать robots.txt — рабочие шаблоны

Минимальный рабочий robots.txt для большинства сайтов:

User-agent: *
Disallow: /admin
Disallow: /cart
Disallow: /search
Disallow: /*?utm_
Allow: /

Sitemap: https://ваш-сайт.ru/sitemap.xml

Что здесь:

  • User-agent: * — правила для всех роботов;
  • Disallow: /admin — закрываем админку;
  • Disallow: /cart — корзину (нечего индексировать);
  • Disallow: /search — внутренний поиск сайта;
  • Disallow: /*?utm_ — страницы с UTM-метками (дубли);
  • Allow: / — всё остальное можно индексировать;
  • Sitemap: — ссылка на карту сайта.

Для интернет-магазина добавьте закрытие фасетной навигации с мусорными параметрами:

Disallow: /*sort=
Disallow: /*order=
Disallow: /*filter=

Пиши параметр без ? и & в начале (/*filter=, не /*?filter=): тогда правило ловит параметр на любой позиции в URL — и когда он первый (?filter=), и когда идёт после других (&filter=).

Для блога закройте служебные страницы:

Disallow: /author/
Disallow: /tag/
Disallow: /feed/

Раздельные правила для Яндекса и Google (если нужны):

User-agent: Yandex
Disallow: /admin
Crawl-delay: 2

User-agent: Googlebot
Disallow: /admin

Crawl-delay: 2 — пауза между запросами в секундах. Полезно, если сервер слабый. Google эту директиву игнорирует, Яндекс — соблюдает.

Рабочий каркас robots.txt — закрываем мусор, открываем нужное:
User-agent: *
Disallow: /admin/        # служебное
Disallow: /cart/         # корзина
Disallow: /*sort=        # сортировки-дубли на любой позиции
Disallow: /search/       # внутренний поиск

Sitemap: https://site.ru/sitemap.xml
Закрывай служебное и дубли с параметрами, но не полезные страницы. Внизу обязательно — путь к актуальному sitemap.xml.

Clean-param, Host и robots для CMS

Две директивы, о которых часто забывают. Clean-param велит Яндексу игнорировать GET-параметры (UTM-метки, сортировки, session id), чтобы один товар не плодил десятки дублей: Clean-param: utm_source&utm_medium /catalog/. Host раньше указывал главное зеркало — сейчас устарел, зеркала задаются 301-редиректом, и из robots его можно убрать.

У конструкторов и CMS свои нюансы. На Тильде robots правится в «Настройках сайта», в WordPress (вордпресс) файл отдаёт SEO-плагин Yoast или Rank Math, на Битрикс — модуль «Поиск». Google и Яндекс читают один и тот же файл, но Clean-param понимает только Яндекс; у гугла для параметров свои правила. Рядом появился llms.txt — отдельный файл-подсказка для AI-ботов, в robots.txt его не кладут, но ссылаются на него всё чаще.

Топ-7 ошибок в robots.txt

  1. 1

    Disallow: / без условий

    Disallow: /

    Закрывает весь сайт от индексации. Самая частая ошибка после тестового сервера или переноса — проверяйте robots.txt сразу после релиза.

  2. 2

    Закрытие CSS и JS

    Disallow: /css/Disallow: /js/

    Поисковики читают эти файлы, чтобы понять, как выглядит страница; без них сайт ранжируется хуже. Что ресурсы не закрыты по ошибке, проверяют через валидатор микроразметки или анализ кода страницы.

  3. 3

    Закрытие важных разделов

    Disallow: /catalog/

    И весь каталог выпадает из индекса. Перепроверяйте каждую строку Disallow — что именно вы закрываете.

  4. 4

    Пробелы перед директивами

    ·Disallow:Disallow:

    С пробелом в начале строки директива не срабатывает. Пишите с первого символа, без отступа.

  5. 5

    Скрытие секретов через robots.txt

    Disallow: /admin/

    Файл публичный — его видят все, включая злоумышленников. Пути к админке и тестовым серверам туда не пишут: это готовая подсказка, куда стучаться. Закрывайте их авторизацией.

  6. 6

    Нет ссылки на sitemap

    Sitemap: https://site.ru/sitemap.xml

    Без неё робот не знает, где карта сайта. Всегда добавляйте строку Sitemap: в конце файла.

  7. 7

    Кириллица в URL без кодировки

    Disallow: /категорияDisallow: /kategoriya

    Кириллица в путях работает не везде. Используйте URL-encoded формат или сразу транслит — например, через генератор транслита и ЧПУ-адресов.

Закрывать эту страницу от индексации?
robots.txt не для всего: дубли — это canonical, не Disallow.

Что такое sitemap.xml

sitemap.xml — это карта сайта в формате XML, в которой перечислены все важные страницы. Лежит в корне сайта (https://ваш-сайт.ru/sitemap.xml) или указывается в robots.txt.

Зачем нужен sitemap, если робот и так может ходить по ссылкам:

  • Ускоряет индексацию. Робот видит весь список страниц сразу — не нужно ходить по ссылкам, чтобы их найти. Особенно важно для новых сайтов и больших каталогов.
  • Помогает найти страницы без внутренних ссылок. Если на страницу никто не ссылается, робот её не найдёт. Sitemap решает.
  • Передаёт метаданные. Ориентируйтесь на спецификацию schema.org для правильной структуры метаданных в XML. Можно указать дату последнего изменения, приоритет, частоту обновлений.

Без sitemap сайт тоже будет индексироваться, но медленнее. Подробнее про ускорение индексации — в отдельной статье.

Как создать sitemap.xml

Три способа в зависимости от размера сайта.

1. Через CMS — большинство сайтов. WordPress, Bitrix, Tilda, OpenCart, Shopify умеют генерировать sitemap автоматически. В WordPress есть плагины Yoast SEO, RankMath. В Tilda — настройка в кабинете. Проверьте — обычно sitemap уже есть.

2. Через онлайн-сервисы — для статических и небольших сайтов. XML-Sitemaps.com (бесплатно до 500 URL), Screaming Frog (бесплатно до 500 URL). Генерируете один раз, загружаете в корень сайта, обновляете по необходимости.

3. Скриптом — для больших сайтов. Если у вас 50 000+ страниц, нужен скрипт, который автоматически обновляет sitemap при добавлении новых страниц. Программисты пишут это за пару часов.

Минимальный sitemap.xml выглядит так:

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://ваш-сайт.ru/</loc>
    <lastmod>2026-06-07</lastmod>
    <priority>1.0</priority>
  </url>
  <url>
    <loc>https://ваш-сайт.ru/uslugi/</loc>
    <lastmod>2026-06-07</lastmod>
    <priority>0.9</priority>
  </url>
</urlset>

После создания файла обязательно подайте его в Яндекс.Вебмастер (раздел «Индексирование → Файлы Sitemap») и Google Search Console.

Как прописать Sitemap в robots.txt

Чтобы поисковик быстрее нашёл карту сайта, ссылку на неё добавляют прямо в robots.txt отдельной директивой Sitemap. Это связывает два файла: робот открывает robots.txt и сразу видит, где лежит sitemap.xml. Синтаксис — одна строка с полным адресом карты:

Sitemap: https://site.ru/sitemap.xml

Правила директивы Sitemap:

  • Только абсолютный URL — со схемой https:// и доменом. Относительный путь /sitemap.xml не сработает.
  • Место — любое. Директива Sitemap не привязана к User-agent, обычно её ставят в конце файла.
  • Можно несколько. Если карт несколько (например, обычная и для видео), добавляют по строке Sitemap на каждую.
  • Читают и Яндекс, и Google — обе системы понимают директиву одинаково.

Пример готового robots.txt, где sitemap прописан в конце:

User-agent: *
Allow: /
Disallow: /admin/

Sitemap: https://site.ru/sitemap.xml

Когда директиву добавили, проверьте её в Яндекс.Вебмастере — он покажет, видит ли робот карту. Директива в robots.txt не отменяет ручную подачу карты в Вебмастер и Search Console: делайте и то, и другое, чтобы sitemap точно нашли и переобошли. Как ускорить сам обход — в разборе про ускорение индексации.

Что должно быть в sitemap, а чего быть не должно

Должно быть:

  • Все коммерческие посадочные страницы;
  • Все статьи блога;
  • Карточки товаров (для интернет-магазинов);
  • Категории и подкатегории;
  • Главная страница;
  • Страницы услуг.

Чего быть не должно:

  • Страницы, закрытые в robots.txt — иначе вы посылаете противоречивые сигналы;
  • Страницы с canonical на другие URL — это дубли по сути;
  • Страницы с noindex — зачем подавать в sitemap то, что не должно индексироваться;
  • Битые ссылки (404);
  • Страницы пагинации (page=2, page=3, etc) — индексируется первая, остальные через canonical;
  • Внутренний поиск, корзина, фильтры с UTM-метками.

Если страниц очень много: Sitemap.xml ограничен 50 000 URL и 50 МБ. Для большего размера — несколько sitemap-файлов и общий sitemap-index, который их связывает. Это рутинная задача — все CMS делают автоматически.

Как проверить, что robots.txt и sitemap работают

Чек-лист после настройки:

  1. Откройте файлы в браузере: ваш-сайт.ru/robots.txt и ваш-сайт.ru/sitemap.xml. Оба должны открываться, отвечать кодом 200, показывать содержимое.
  2. Проверьте robots.txt в Я.Вебмастере. Раздел «Инструменты → Анализ robots.txt». Введите URL страницы — Вебмастер скажет, может робот по нему ходить или нет. Подробнее о Вебмастере — в отдельной статье.
  3. Подайте sitemap в Вебмастер. Раздел «Индексирование → Файлы Sitemap → Добавить файл Sitemap». Вставьте полный URL. Через 1–2 дня появится статистика обработки.
  4. Подайте sitemap в Google Search Console. Оба сервиса покажут подробную статистику по индексации и проблемам — Search Console для Google. Раздел «Индексирование → Файлы Sitemap».
  5. Проверьте через Screaming Frog или аналог. Сделайте crawl сайта — посмотрите, какие страницы доступны для робота. Если важные страницы помечены как «Disallowed» — что-то закрыто.

Если что-то сломано или robots закрывает важные страницы — заметите за 1–2 недели по падению трафика. Лучше один раз настроить правильно, чем потом долго восстанавливаться.

Главное

Если коротко

robots.txt — это инструкции роботу: куда можно, куда нельзя. Лежит в корне сайта. Минимум: User-agent: *, Disallow закрытых разделов, Allow: /, ссылка на sitemap.

sitemap.xml — карта всех важных страниц для быстрой индексации. Лежит в корне сайта. Большинство CMS генерируют автоматически. Обязательно подавайте в Я.Вебмастер и Search Console.

Топ-3 ошибки: Disallow: / без условий (закрывает весь сайт), закрытие CSS/JS, отсутствие ссылки на sitemap в robots.txt. Если не уверены, что у вас всё настроено — закажите SEO-аудит.

Частые вопросы

Что такое файл robots.txt простыми словами?

Это текстовый файл в корне сайта, в котором владелец указывает поисковым роботам, какие разделы сайта можно индексировать, а какие нет. Открывается по адресу ваш-сайт.ru/robots.txt. Без файла робот считает, что можно индексировать всё. С криво настроенным файлом можно случайно закрыть весь сайт.

Зачем нужен sitemap.xml?

Это карта сайта со списком всех важных страниц. Помогает поисковому роботу быстро найти все страницы, особенно если они не связаны между собой ссылками или сайт большой. Без sitemap робот находит новые страницы медленнее — особенно на большом сайте или при слабой перелинковке. Лежит в корне сайта (ваш-сайт.ru/sitemap.xml) и подаётся в Яндекс.Вебмастер и Google Search Console.

Можно ли сделать robots.txt и sitemap самому?

robots.txt — да, это простой текстовый файл. Создаёте в блокноте по шаблону из этой статьи, загружаете в корень сайта. Sitemap.xml для маленького сайта тоже создаётся вручную или через бесплатные сервисы вроде XML-Sitemaps. Для больших сайтов и интернет-магазинов лучше использовать CMS-плагины, которые обновляют sitemap автоматически.

Где должны лежать robots.txt и sitemap.xml?

Оба файла лежат в корне сайта. Robots.txt доступен по адресу ваш-сайт.ru/robots.txt (это стандарт, путь нельзя менять). Sitemap.xml можно класть в любое место, но традиционно — в корне (ваш-сайт.ru/sitemap.xml). Главное — указать путь к sitemap в robots.txt директивой Sitemap: https://...

Что закрывать в robots.txt?

Стандартный набор: админку (/admin), корзину (/cart), внутренний поиск (/search), страницы фильтров с UTM-метками, страницы пагинации (если не используете canonical). Для интернет-магазинов — мусорные комбинации фасетной навигации. Для блога — теги, авторы, RSS-фиды. Не закрывайте CSS/JS — поисковики используют их для анализа страницы.

Как проверить, правильно ли настроен robots.txt?

Самый надёжный способ — раздел «Инструменты → Анализ robots.txt» в Яндекс.Вебмастере. Вводите URL любой страницы, и Вебмастер скажет, может робот по нему ходить или нет. Также проверьте, что важные страницы (главная, услуги, статьи) НЕ помечены как «Disallowed». Через Screaming Frog можно сделать crawl и увидеть все заблокированные URL.

Под рукой: генератор robots.txt, генератор sitemap.xml и анализ карты сайта — собрать и проверить файлы за минуту.

Скриншот инструмента для robots.txt на pawetta.com
Живой скриншот нашего инструмента для robots.txt: собрать правила и увидеть, что реально закрыто от индексации.

Читать дальше

Все статьи