Кто из них может читать ваш сайт?
Введите домен в нашу бесплатную проверку robots.txt и увидьте, бот за ботом, какие из этих краулеров разрешены или заблокированы, – и протестируйте любой URL по вашим правилам.
Проверить сайт бесплатноОбучающие, поисковые и краулеры по требованию
Не все AI-краулеры делают одно и то же, и каждый можно разрешить или заблокировать отдельно:
Обучающие краулеры (GPTBot, ClaudeBot, Google-Extended, CCBot, Bytespider) массово собирают контент для обучения моделей. AI-поисковые краулеры (YandexBot, OAI-SearchBot, PerplexityBot, Bingbot) строят индекс, чтобы ваши страницы можно было цитировать в ответах нейросетей, – именно они важнее всего для рекомендаций. Загрузчики по требованию (ChatGPT-User, Claude-User, Perplexity-User) заходят на страницу, только когда её требует запрос пользователя.
Как заблокировать все AI-краулеры
Добавьте правило Disallow для каждого user-agent в robots.txt. Например:
User-agent: GPTBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: Google-Extended Disallow: / User-agent: CCBot Disallow: /
Учтите: большинство краулеров соблюдают эти правила, но некоторые – в частности Bytespider и загрузчик Perplexity по требованию – по сообщениям игнорируют robots.txt. Чтобы надёжно их заблокировать, нужен файрвол или правило WAF, а не только robots.txt.
Как разрешить AI-краулеры (чтобы попасть в цитаты)
Если вы хотите, чтобы ChatGPT, YandexGPT и GigaChat вас рекомендовали, краулеры должны суметь вас прочитать – движок не процитирует страницу, которую ему не дали загрузить. Убедитесь, что ничто их не запрещает, и явно обозначьте намерение:
User-agent: GPTBot Allow: / User-agent: OAI-SearchBot Allow: / User-agent: PerplexityBot Allow: / User-agent: Google-Extended Allow: /
Затем пойдите дальше: добавьте файл llms.txt, который размечает ваши ключевые страницы, и проверьте всё Проверкой robots.txt.
Частые вопросы
Что такое AI-краулер?
AI-краулер – это автоматический бот, который загружает веб-страницы для ИИ-продукта: чтобы обучить на них модель, проиндексировать, чтобы их можно было цитировать в ответах нейросетей, или прочитать страницу вживую, когда пользователь задаёт вопрос. GPTBot, YandexBot и PerplexityBot – частые примеры.
Какие основные user-agent AI-краулеров?
Самые частые – YandexBot (Яндекс); GPTBot, OAI-SearchBot и ChatGPT-User (OpenAI); Google-Extended и Googlebot (Google); PerplexityBot и Perplexity-User (Perplexity); ClaudeBot и Claude-User (Anthropic); Bingbot (Microsoft Copilot); плюс Applebot-Extended, Amazonbot, Meta-ExternalAgent, Bytespider и CCBot.
Как заблокировать все AI-краулеры?
Добавьте правило Disallow для каждого ИИ-user-agent в robots.txt (например, User-agent: GPTBot / Disallow: /). Учтите, что большинство краулеров соблюдают robots.txt, но некоторые, вроде Bytespider, по сообщениям его игнорируют – для них нужен файрвол или правило WAF.
Как разрешить AI-краулеры, чтобы бренд попадал в цитаты?
Убедитесь, что robots.txt их не запрещает, и в идеале добавьте явные правила Allow для нужных краулеров. Движок не процитирует страницу, которую ему не дали прочитать, так что разрешить YandexBot, GPTBot, PerplexityBot и Google-Extended – базовый минимум для видимости в нейросетях.
Соблюдают ли AI-краулеры robots.txt?
Большинство крупных операторов (Яндекс, OpenAI, Google, индексный бот Perplexity, Anthropic, Apple, Amazon, Common Crawl) заявляют, что их краулеры соблюдают robots.txt. Некоторые – в частности Bytespider и загрузчик Perplexity по требованию – по сообщениям его игнорируют, так что один robots.txt не гарантия против каждого бота.
Чем обучающий краулер отличается от загрузчика по требованию?
Обучающий или поисковый краулер обходит ваш сайт массово, чтобы собрать датасет или индекс. Загрузчик по требованию (вроде ChatGPT-User или Perplexity-User) загружает конкретную страницу, только когда её требует запрос пользователя. Каждый можно разрешить или заблокировать отдельно в robots.txt.
User-agent сверены с knownagents.com (ранее Dark Visitors) и собственной документацией операторов, июль 2026. Операторы со временем добавляют и переименовывают краулеры – всегда сверяйтесь с актуальной документацией оператора, прежде чем полагаться на одно правило.