Генератор и валидатор llms.txt + robots.txt для AI-ботов
Соберите llms.txt — карту сайта для нейросетей: разделы, пояснения к ссылкам, блок Optional. Скачайте готовый файл и проверьте его валидатором.
Вставь содержимое своего llms.txt — проверю структуру: заголовок, описание, разделы, абсолютные ссылки, пояснения и типичные ошибки. Или нажми «Взять из генератора», чтобы проверить только что собранный файл.
Рядом — генератор robots.txt для AI-краулеров: решите, кого пускать к контенту. Всё считается в браузере, ничего не уходит на сервер.
| User-agent | Чей | Что делает | Что меняется от запрета |
|---|---|---|---|
| GPTBot | OpenAI | собирает тексты для обучения моделей | контент не попадает в обучающий набор |
| OAI-SearchBot | OpenAI | ищет страницы для ответов ChatGPT Search | сайт перестаёт цитироваться со ссылкой |
| ChatGPT-User | OpenAI | открывает страницу по просьбе человека в чате | страница не откроется по прямой ссылке в диалоге |
| ClaudeBot | Anthropic | собирает тексты для обучения Claude | контент не попадает в обучающий набор |
| PerplexityBot | Perplexity | ищет страницы для ответов со ссылками | пропадают ссылки на сайт в ответах |
| Google-Extended | разрешает или запрещает обучение Gemini | на обычную выдачу Google запрет не влияет | |
| YandexAdditional | Яндекс | работает на нейросетевые продукты Яндекса | на обычную выдачу Яндекса запрет не влияет |
robots.txt для AI-ботов: что важно понять
Три типа AI-ботов — и что с ними делать
Главная развилка понять, какой бот за что отвечает. От этого зависит, навредишь ты себе или нет.
| Тип бота | Примеры | Что делает | Закрывать? |
|---|---|---|---|
| Краулер обучения | GPTBot, Google-Extended, ClaudeBot, CCBot | собирает тексты в датасет для тренировки модели | можно — на SEO и выдачу не влияет |
| Поисковый краулер | OAI-SearchBot, PerplexityBot | подтягивает страницы в ответ и даёт ссылку на тебя | оставить, если нужна AI-видимость |
| Пользовательский фетчер | ChatGPT-User | заходит по прямому запросу человека в чате | обычно оставляют |
Вывод: блокировка обучающих ботов не вредит ни обычной выдаче, ни цитированию в ИИ — она лишь не даёт тренировать модель на твоём контенте. А блокировка поисковых ботов убивает шанс попасть в ответы ChatGPT Search, Perplexity и Яндекс Нейро.
Что делает каждый пресет
Готовый robots.txt: в ответы, но без обучения
Самый ходовой сценарий — открыть поисковых ботов и закрыть обучающих. Вот готовый блок (или собери его галочками в форме на этой странице):
# Закрываем обучение, оставляем цитирование User-agent: GPTBot Disallow: / User-agent: Google-Extended Disallow: / User-agent: CCBot Disallow: / # OAI-SearchBot и PerplexityBot не закрыты — пусть цитируют
robots.txt — это не защита
На деле robots.txt — вежливая просьба, которую боты выполняют по своей воле. Официальные боты (GPTBot, Google-Extended, ClaudeBot, PerplexityBot) её уважают. Но серые скраперы и парсеры игнорируют. Если контент нужно защитить жёстко, это уровень сервера: блокировка по User-agent или IP, WAF, Cloudflare с защитой от AI-ботов. robots.txt решает вопрос видимости в легальных ИИ; воровство контента им не закрыть.
llms.txt: карта сайта для нейросетей
llms.txt — предложенный стандарт: текстовый файл в корне сайта (site.ru/llms.txt), по аналогии с robots.txt, только для навигации нейросети по сайту. В нём ты простым языком описываешь, что за сайт и какие страницы главные — чтобы нейросеть быстрее поняла структуру и сама сослалась на нужный раздел, без угадывания.
Из чего состоит файл
# Название> о чём сайт## Услуги, ## Кейсы — группируют страницы по смыслу- [Название](url): о чём страница — по пояснению модель понимает смысл## Optional — второстепенное, его модель читает в последнюю очередьПример готового llms.txt
# Никита Вихров — SEO-специалист > SEO и GEO: вывод в топ Яндекса, Google и в ответы нейросетей. ## Услуги - [SEO-продвижение](https://pawetta.com/uslugi/): семантика, техничка, контент - [GEO — видимость в нейросетях](https://pawetta.com/uslugi/): попадание в ответы ИИ ## Кейсы - [Съём позиций в LLM](https://pawetta.com/cases/monitoring-pozicij-v-nejrosetyah/): мониторинг бренда в 5 нейросетях ## Optional - [Блог](https://pawetta.com/blog/): разборы по SEO и GEO
Этот файл собирается во втором блоке инструмента выше: впиши название, описание и страницы (строки ## Раздел группируют, после | идёт пояснение), забери готовый текст кнопкой «Скачать». Третий блок проверит готовый файл валидатором. llms.txt пока не обязателен и не гарантированно учитывается всеми моделями, но стоит почти ничего, а часть систем его уже читает — поставить на опережение разумно. Полный разбор — в гайде llms.txt: что это, пример и как создать.
Как положить файл в корень сайта
llms.txt и текстом в блоке HTML, либо отдача /llms.txt через Cloudflare-прокси. Разбор — в гайде по llms.txt.llms.txt в корень рядом с robots.txt.Проверка: открой site.ru/llms.txt в браузере — он должен отдаться как обычный текст.
Яндекс Нейро и robots.txt: YandexBot против YandexAdditional
Для русскоязычного сайта это отдельная и важная история. У Яндекса два разных бота, и путать их нельзя:
| Бот | За что отвечает | Можно закрывать? |
|---|---|---|
YandexBot | обычный поисковый робот Яндекса | нет — выпадешь из выдачи |
YandexAdditional | нейросетевые продукты Яндекса (Нейро, генеративные ответы) | да — на обычную выдачу не влияет |
Ключевое: закрытие YandexAdditional не вредит обычной выдаче. Если не хочешь, чтобы контент шёл в Нейро, но хочешь остаться в поиске Яндекса — закрывай только YandexAdditional, а YandexBot оставляй открытым. В инструменте выше это отдельная галочка.
# Закрыть только нейросети Яндекса, оставить поиск User-agent: YandexAdditional Disallow: /
Как роботы читают файл и почему группы не мешают друг другу
Файл robots.txt читают по группам: строка User-agent открывает группу, строки Disallow и Allow под ней говорят, куда этому роботу можно. Робот ищет группу со своим именем и подчиняется только ей; если своей нет, берёт группу со звёздочкой. Поэтому запрет для GPTBot ничего не меняет для Googlebot, и наоборот. При конфликте Allow и Disallow побеждает более длинное правило.
Генератор на странице собирает именно такие группы: по два строки на каждого отмеченного бота. Файл должен лежать в корне домена, поддомен читает свой собственный, а первые 500 килобайт — это всё, что Google согласен прочитать. Список ботов и их имена инструмент берёт из публичных описаний компаний: OpenAI, Anthropic, Google, Perplexity, Apple, ByteDance публикуют имена своих роботов и диапазоны адресов, по которым бота можно отличить от подделки.
Файл llms.txt устроен проще: это обычный текст с заголовком, описанием и списком ссылок с пояснениями. Валидатор проверяет структуру, абсолютные адреса и наличие пояснений, потому что без них файл превращается в дубль карты сайта.

| Правило | Как читается | Пример |
|---|---|---|
| User-agent: имя | открывает группу для одного робота | User-agent: GPTBot |
| Disallow: / | закрывает весь сайт для этой группы | Disallow: / |
| Allow: /путь | открывает часть внутри закрытого | Allow: /blog/ |
| Sitemap: адрес | указывает карту сайта, для всех | Sitemap: https://site.ru/sitemap.xml |
От договорённости 1994 года до роботов нейросетей
Стандарт robots.txt родился в июне 1994 года из переписки в списке рассылки, где собирались авторы первых поисковых роботов. Мартейн Костер предложил простой файл-договорённость после того, как чужой робот положил его сервер повторными запросами. Стандарт никто не утверждал: он держался на согласии сторон, и так продержался четверть века.
В 2019 году Google открыл исходный код своего разборщика robots.txt и внёс стандарт в IETF; в сентябре 2022 года он вышел как RFC 9309. Ровно тогда же началась вторая жизнь файла: в августе 2023 года OpenAI объявил имя GPTBot и пообещал уважать запреты, через месяц Google ввёл Google-Extended для управления обучением моделей, и за год каждая крупная нейросеть обзавелась своим роботом с именем.
Файл llms.txt предложил Джереми Ховард из Answer.AI в сентябре 2024 года как карту сайта для языковых моделей: короткий текст, который объясняет, что здесь главное. В 2024 году Cloudflare добавил блокировку нейросетевых роботов одной кнопкой, а в 2025-м включил её по умолчанию для новых доменов. Вопрос «пускать или нет» превратился из философии в настройку.


Логи, проверка и что не закрывать
Прежде чем закрывать, посмотрите логи сервера: строки с именами GPTBot, ClaudeBot, PerplexityBot, Bytespider покажут, кто и как часто ходит. Часто выясняется, что самый прожорливый робот — обычный скрапер с чужим именем в заголовке, и к нейросетям он отношения не имеет. Настоящих роботов сверяют по опубликованным диапазонам адресов, поддельных блокируют на сервере.
Правило одно на все случаи: сначала решите, нужна ли вам видимость в ответах, потом закрывайте только обучающих роботов. Закрытие поискового робота Яндекса или Google по ошибке — самая дорогая опечатка в этом файле, поэтому после правки проверьте файл в Вебмастере и в Search Console. Основной файл для обычных поисковиков собирает генератор robots.txt, а что сервер отдаёт по адресу файла, покажет проверка ответа сервера.
В llms.txt не сваливайте весь сайт: десять-тридцать главных страниц с пояснениями по одному предложению работают лучше сотни голых ссылок. Ставьте туда те же адреса, что есть в карте сайта, и обновляйте вместе с ней.
| Где лежит | в корне домена |
| Читается | по группам User-agent |
| Лимит чтения Google | 500 КБ |
| Ботов в форме | 11 |
| llms.txt | текст со ссылками |
| robots.txt | 1994 |
| RFC 9309 | 2022 |
| GPTBot | 2023 |
Как пользоваться
- В первом блоке отметьте, каких AI-краулеров закрыть. Пресеты помогут: «закрыть всех», «закрыть только обучение» (оставить ботов, что дают ссылки в ответах) или «открыть всех».
- Справа появится готовый блок с директивами Disallow. Добавьте его в свой robots.txt в корне сайта — обычные поисковые боты он не трогает.
- Во втором блоке впишите название, описание и ключевые страницы — получите llms.txt, который кладут в корень сайта как карту для нейросетей.
Частые вопросы
Что такое AI-краулеры и зачем ими управлять?
Это боты нейросетей: GPTBot и OAI-SearchBot у OpenAI, ClaudeBot у Anthropic, Google-Extended у Google, PerplexityBot у Perplexity и другие. Одни собирают тексты для обучения моделей, другие подтягивают страницы в момент ответа пользователю. robots.txt позволяет решить, кого пускать: закрыть контент от обучения, но оставить доступ ботам, которые дают ссылку на вас в ответе.
Закрывать AI-ботов или открывать?
Зависит от стратегии. Контентному и услуговому сайту обычно выгоднее открыть доступ ботам, которые цитируют источники (OAI-SearchBot, PerplexityBot, ChatGPT-User) — это шанс попасть в ответы ИИ и получить AI-видимость. Закрывают чаще от обучения (GPTBot, Google-Extended, CCBot), если не хотят, чтобы контент ушёл в датасеты без отдачи. Пресет «закрыть обучение» делает ровно это.
Что такое llms.txt и обязателен ли он?
llms.txt — предложенный стандарт: текстовый файл в корне сайта (по аналогии с robots.txt), где простым языком описаны сайт и список главных страниц. Он помогает нейросетям быстрее понять, что у вас есть, и сослаться на нужные разделы. Это не обязательный и пока не гарантированно учитываемый файл, но его уже поддерживают и он почти ничего не стоит.
Точно ли боты слушаются robots.txt?
Крупные официальные AI-краулеры (GPTBot, Google-Extended, ClaudeBot, PerplexityBot, Applebot) заявляют, что уважают robots.txt. Но файл — это просьба уровня договорённости, без технической блокировки: «серые» парсеры могут её игнорировать. Для жёсткого запрета нужна блокировка на уровне сервера по User-agent или IP.
Если закрыть GPTBot, выпаду ли из ChatGPT?
GPTBot отвечает за обучение модели; за поиск отвечает другой бот. Закрыв его, ты не попадёшь в обучающий датасет, но цитирование в ChatGPT Search идёт через другого бота — OAI-SearchBot. Не закрывай его, и ссылки на тебя в ответах ChatGPT останутся.
Как добавить llms.txt на Тильде?
Собери файл во втором блоке инструмента. Тильда штатно не кладёт произвольные файлы в корень, поэтому путей два: быстрый — создать отдельную страницу с адресом llms.txt и вставить текст в блок с HTML внутри тега pre; правильный — если сайт стоит за Cloudflare или похожим прокси, отдавать /llms.txt статическим ответом через правила прокси. Проверь, что файл открывается по адресу site.ru/llms.txt как текст.
Защищает ли robots.txt от обучения ИИ?
Только от ботов, которые его уважают — официальные GPTBot, Google-Extended, ClaudeBot. Серые парсеры robots.txt игнорируют. Для жёсткой защиты контента нужна блокировка на уровне сервера по User-agent или IP, либо WAF.
Чем YandexAdditional отличается от YandexBot?
YandexBot — обычный поисковый робот, закрывать его нельзя, иначе выпадешь из выдачи. YandexAdditional — бот нейросетей Яндекса. Закрыв только YandexAdditional, ты убираешь контент из Нейро, но остаёшься в обычном поиске Яндекса.
Как выглядит готовый llms.txt?
Это короткий текстовый файл: заголовок с названием сайта, строка-описание и список главных страниц со ссылками в формате markdown. Готовый пример есть в разделе про llms.txt выше на этой странице.
Как проверить llms.txt на ошибки?
Вставь содержимое файла в блок «Проверка llms.txt» на этой странице и нажми «Проверить». Валидатор смотрит структуру: есть ли заголовок #, строка описания и разделы ##, все ли ссылки абсолютные (с https://), есть ли у ссылок пояснения и не свалены ли в файл все страницы сайта вместо выжимки. Дополнительно открой site.ru/llms.txt в браузере и убедись, что отдаётся чистый текст в UTF-8.
Что такое llms-full.txt и нужен ли он?
llms-full.txt — расширенная версия, где вместо ссылок лежит полный текст ключевых страниц одним документом. Он нужен большим сайтам с документацией, чтобы модель взяла содержание целиком. Для обычного сайта, блога или лендинга хватает базового llms.txt со ссылками и описаниями, а llms-full.txt избыточен и тяжёл в поддержке.
Где этому учат
Похожие инструменты
Собирает robots.txt: Disallow/Allow, Sitemap, Host, Crawl-delay. Пресеты «открыть/закрыть сайт» и «закрыть служебное CMS».
ОткрытьОтвет сервера (HTTP-коды)Список URL → коды ответа 200/301/404, цепочки редиректов, финальный адрес и время ответа. Для аудита и чистки битых ссылок. До 30 адресов за раз.
ОткрытьГенератор sitemap.xmlСоберёт ссылки прямо с вашего сайта по адресу или сделает карту из готового списка URL. lastmod, changefreq, priority.
ОткрытьPunycode конвертерКириллический домен в запись xn-- и обратно. Полные адреса и списки, проверка предела в 63 знака на метку.
ОткрытьСтоимость SEO для вашего проектаОриентир по бюджету и срокам под ваш тип бизнеса, размер сайта, конкуренцию и регион. Формула на 11 годах работы — за 2 минуты.
ОткрытьКластеризация запросовГруппирует семантическое ядро по общим словам с учётом морфологии: один кластер ≈ одна посадочная. Быстрый черновик структуры сайта.
ОткрытьКак применять это в продвижении — в разборе Данные для AI-поиска и других материалах блога.
Ещё инструменты для SEO и семантики
Кластеризация запросов и лемматизация, чистка по стоп-словам, генераторы sitemap.xml, robots.txt и редиректов, разметка Schema.org — в разделе 17 инструментов.
Сервисы, о которых здесь речь
Что это за инструменты, кому подходят и что доступно без оплаты — в карточках каталога.
Весь раздел: Защита сайта и антифрод.