У каждой большой нейросети свой бот. GPTBot и OAI-SearchBot принадлежат OpenAI, ClaudeBot — Anthropic, есть боты у Google и Яндекса. Одни собирают тексты для обучения моделей, другие подтягивают свежие страницы прямо в момент ответа пользователю. По сути это новое поколение поисковых роботов.
Управляют ими через robots.txt — тот же файл, что и для обычных краулеров. Можно закрыть сайт от обучения, но оставить доступ ботам, которые дают ссылки в ответах: тогда контент не уйдёт в датасет, но останется шанс на цитирование. Решение зависит от стратегии: для контентного проекта видимость важнее, для закрытой базы — приватность.
Боты для обучения и боты для живых ответов.
Разрешаете или закрываете доступ по имени бота.
Закрыли всё — потеряли шанс попасть в ответы ИИ.
Строка User-agent: GPTBot и Disallow: / в robots.txt закрывает сайт от обучения OpenAI, но 3 другим ИИ-ботам доступ можно оставить открытым.
Полностью закрыться от ИИ-ботов через robots.txt не всегда получается: GPTBot и ClaudeBot директивы уважают, но часть менее известных краулеров их игнорирует, а некоторые сервисы тянут контент через сторонние прокси и парсеры без объявленного User-agent. Поэтому robots.txt — это про вежливых ботов; для жёсткой блокировки нужен фильтр на уровне сервера или CDN по IP и User-agent (Cloudflare, например, даёт готовый тумблер «Block AI bots»).
Проверять, кто реально ходит на сайт, удобнее по серверным логам, а не по обычным отчётам: грепаешь access.log по строкам GPTBot, ClaudeBot, PerplexityBot, Amazonbot и смотришь частоту и нагрузку. Важная деталь — Яндекс и Google разделяют обучающие и поисковые краулеры: закрыв Googlebot, ты выпадешь из выдачи, а закрыв Google-Extended, лишь запретишь обучение Gemini, оставшись в поиске. Путать эти директивы — типичная ошибка, которая стоит трафика.