У каждой большой нейросети свой бот. GPTBot и OAI-SearchBot принадлежат OpenAI, ClaudeBot — Anthropic, есть боты у Google и Яндекса. Одни собирают тексты для обучения моделей, другие подтягивают свежие страницы прямо в момент ответа пользователю. По сути это новое поколение поисковых роботов.
Управляют ими через robots.txt — тот же файл, что и для обычных краулеров. Можно закрыть сайт от обучения, но оставить доступ ботам, которые дают ссылки в ответах: тогда контент не уйдёт в датасет, но останется шанс на цитирование. Решение зависит от стратегии: для контентного проекта видимость важнее, для закрытой базы — приватность. Что показать ботам в первую очередь — задаёт файл llms.txt, карта важных страниц для нейросетей.
Боты для обучения и боты для живых ответов.
Разрешаете или закрываете доступ по имени бота.
Закрыли всё — потеряли шанс попасть в ответы ИИ.
Строка User-agent: GPTBot и Disallow: / в robots.txt закрывает сайт от обучения OpenAI, но 3 другим ИИ-ботам доступ можно оставить открытым.
Полностью закрыться от ИИ-ботов через robots.txt не всегда получается: GPTBot и ClaudeBot директивы уважают, но часть менее известных краулеров их игнорирует, а некоторые сервисы тянут контент через сторонние прокси и парсеры без объявленного User-agent. Поэтому robots.txt — это про вежливых ботов; для жёсткой блокировки нужен фильтр на уровне сервера или CDN по IP и User-agent (Cloudflare, например, даёт готовый тумблер «Block AI bots»).
Проверять, кто реально ходит на сайт, удобнее по серверным логам, чем по обычным отчётам: грепаешь access.log по строкам GPTBot, ClaudeBot, PerplexityBot, Amazonbot и смотришь частоту и нагрузку. Важная деталь — Яндекс и Google разделяют обучающие и поисковые краулеры: закрыв Googlebot, ты выпадешь из выдачи, а закрыв Google-Extended, лишь запретишь обучение Gemini, оставшись в поиске. Путать эти директивы — типичная ошибка, которая стоит трафика.
Решение о доступе принимают по двум вопросам: приводит ли бот людей и что он делает с текстом. Боты поисковых режимов подтягивают страницу в момент вопроса пользователя и показывают ссылку в ответе, то есть работают как канал трафика. Боты обучения забирают текст в модель без обратной ссылки, и для сайтов с платным доступом это прямая потеря.
Настраивается доступ в файле для роботов отдельными блоками под каждого бота, а проверяется по логам сервера: там видно, кто заходил, сколько страниц забрал и какие коды ответа получил. Запрет в правилах уважают не все: часть ботов подгрузки ресурсов ходит независимо от него, и такие случаи закрывают на стороне сервера.
Частые вопросы
Стоит ли пускать ботов нейросетей?
Тех, что приводят людей со ссылкой в ответе, обычно стоит. Тех, что собирают тексты для обучения без обратной ссылки, закрывают сайты с платным доступом и уникальными базами. Для контентного проекта, живущего на трафике, запрет означает уход из ответов.
Как закрыть доступ конкретному боту?
Отдельным блоком в файле для роботов с указанием имени бота и запретом нужных разделов. Проверить результат можно по логам сервера: обращения должны прекратиться в течение нескольких дней после обновления файла.
Как узнать, какие боты ходят по сайту?
По логам веб-сервера: в строке запроса видно имя бота, адрес страницы и код ответа. Сводка по именам за неделю сразу показывает, кто тратит обход и на какие разделы.
Влияют ли такие боты на нагрузку?
Могут: активный бот забирает тысячи страниц в сутки. Если нагрузка заметна, ограничивают скорость обхода на стороне сервера и закрывают тяжёлые разделы вроде фильтров и служебных адресов.