GeoDash
Справочник

Список AI-краулеров: все user-agent ИИ-ботов

AI-краулеры, которые читают веб для ChatGPT, YandexGPT, GigaChat, Gemini, Perplexity и других, – что делает каждый user-agent, соблюдает ли robots.txt и как его разрешить или заблокировать. 29 краулеров, поддерживается в актуальном виде.

Обновлено: июль 2026 · 29 краулеров

Яндекс · YandexGPT / Алиса

User-agentЧто делаетТипrobots.txt
YandexBot Поисковый краулер Яндекса – питает Поиск, а также YandexGPT и Алису. AI-поиск Соблюдает
YandexAdditional Дополнительный краулер Яндекса для сбора контента под ИИ-функции. Обучение Соблюдает

Сбер · GigaChat

User-agentЧто делаетТипrobots.txt
GigaChat Загружает страницы для ответов GigaChat, когда их требует запрос пользователя. По требованию По запросу

OpenAI · ChatGPT

User-agentЧто делаетТипrobots.txt
GPTBot Обходит веб, чтобы обучать и улучшать модели OpenAI. Обучение Соблюдает
OAI-SearchBot Индексирует страницы, чтобы они появлялись в поиске ChatGPT. AI-поиск Соблюдает
ChatGPT-User Загружает страницу вживую, когда её требует запрос пользователя ChatGPT. По требованию Соблюдает

Google · Gemini

User-agentЧто делаетТипrobots.txt
Google-Extended Токен отказа от использования вашего контента в Gemini и Vertex AI. Обучение Соблюдает
Googlebot Поисковый краулер Google – также питает AI-обзоры. AI-поиск Соблюдает

Perplexity

User-agentЧто делаетТипrobots.txt
PerplexityBot Индексирует страницы, чтобы Perplexity мог цитировать их в ответах. AI-поиск Соблюдает
Perplexity-User Загружает страницу вживую под запрос пользователя; сообщают, что обходит robots.txt. По требованию Спорно

Anthropic · Claude

User-agentЧто делаетТипrobots.txt
ClaudeBot Обходит веб, чтобы обучать и подкреплять Claude. Обучение Соблюдает
anthropic-ai Контентный краулер Anthropic (старый user-agent). Обучение Соблюдает
Claude-User Загружает страницу вживую во время сессии Claude в ответ на пользователя. По требованию Соблюдает

Microsoft · Copilot

User-agentЧто делаетТипrobots.txt
Bingbot Индекс Bing – источник опоры для Microsoft Copilot. AI-поиск Соблюдает

Apple

User-agentЧто делаетТипrobots.txt
Applebot-Extended Токен отказа от использования вашего контента в Apple Intelligence. Обучение Соблюдает

Amazon

User-agentЧто делаетТипrobots.txt
Amazonbot Обходит контент, используемый Alexa и ИИ Amazon. Обучение Соблюдает

Meta

User-agentЧто делаетТипrobots.txt
Meta-ExternalAgent Обходит веб, чтобы обучать ИИ Meta (Llama). Обучение Соблюдает
meta-externalfetcher Загружает ссылки вживую для функций ассистента Meta AI. По требованию По запросу

ByteDance

User-agentЧто делаетТипrobots.txt
Bytespider Обучает ИИ ByteDance / TikTok (Doubao); широко сообщают, что игнорирует robots.txt. Обучение Спорно

Common Crawl

User-agentЧто делаетТипrobots.txt
CCBot Собирает открытый датасет Common Crawl, на котором обучаются многие модели. Обучение Соблюдает

Другие AI-краулеры

User-agentЧто делаетТипrobots.txt
cohere-ai Контентный краулер Cohere. Обучение Соблюдает
AI2Bot Краулер датасетов Allen Institute for AI (AI2). Обучение Соблюдает
DuckAssistBot Загрузчик ИИ-ассиста DuckDuckGo. По требованию Соблюдает
YouBot Поисковый и ИИ-краулер You.com. AI-поиск Соблюдает
PetalBot Поисковый и ИИ-краулер Huawei (Petal / Celia). AI-поиск Соблюдает
Diffbot Строит граф знаний Diffbot, используемый для ИИ. Обучение Соблюдает
ImagesiftBot Краулер Hive для датасетов изображений / ИИ. Обучение Соблюдает
Timpibot Краулер децентрализованного датасета Timpi. Обучение Соблюдает
Omgilibot Краулер данных Webz.io, перепродаваемых для обучения ИИ. Обучение Соблюдает

Кто из них может читать ваш сайт?

Введите домен в нашу бесплатную проверку robots.txt и увидьте, бот за ботом, какие из этих краулеров разрешены или заблокированы, – и протестируйте любой URL по вашим правилам.

Проверить сайт бесплатно

Обучающие, поисковые и краулеры по требованию

Не все AI-краулеры делают одно и то же, и каждый можно разрешить или заблокировать отдельно:

Обучающие краулеры (GPTBot, ClaudeBot, Google-Extended, CCBot, Bytespider) массово собирают контент для обучения моделей. AI-поисковые краулеры (YandexBot, OAI-SearchBot, PerplexityBot, Bingbot) строят индекс, чтобы ваши страницы можно было цитировать в ответах нейросетей, – именно они важнее всего для рекомендаций. Загрузчики по требованию (ChatGPT-User, Claude-User, Perplexity-User) заходят на страницу, только когда её требует запрос пользователя.

Как заблокировать все AI-краулеры

Добавьте правило Disallow для каждого user-agent в robots.txt. Например:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

Учтите: большинство краулеров соблюдают эти правила, но некоторые – в частности Bytespider и загрузчик Perplexity по требованию – по сообщениям игнорируют robots.txt. Чтобы надёжно их заблокировать, нужен файрвол или правило WAF, а не только robots.txt.

Как разрешить AI-краулеры (чтобы попасть в цитаты)

Если вы хотите, чтобы ChatGPT, YandexGPT и GigaChat вас рекомендовали, краулеры должны суметь вас прочитать – движок не процитирует страницу, которую ему не дали загрузить. Убедитесь, что ничто их не запрещает, и явно обозначьте намерение:

User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Allow: /

Затем пойдите дальше: добавьте файл llms.txt, который размечает ваши ключевые страницы, и проверьте всё Проверкой robots.txt.

Частые вопросы

Что такое AI-краулер?

AI-краулер – это автоматический бот, который загружает веб-страницы для ИИ-продукта: чтобы обучить на них модель, проиндексировать, чтобы их можно было цитировать в ответах нейросетей, или прочитать страницу вживую, когда пользователь задаёт вопрос. GPTBot, YandexBot и PerplexityBot – частые примеры.

Какие основные user-agent AI-краулеров?

Самые частые – YandexBot (Яндекс); GPTBot, OAI-SearchBot и ChatGPT-User (OpenAI); Google-Extended и Googlebot (Google); PerplexityBot и Perplexity-User (Perplexity); ClaudeBot и Claude-User (Anthropic); Bingbot (Microsoft Copilot); плюс Applebot-Extended, Amazonbot, Meta-ExternalAgent, Bytespider и CCBot.

Как заблокировать все AI-краулеры?

Добавьте правило Disallow для каждого ИИ-user-agent в robots.txt (например, User-agent: GPTBot / Disallow: /). Учтите, что большинство краулеров соблюдают robots.txt, но некоторые, вроде Bytespider, по сообщениям его игнорируют – для них нужен файрвол или правило WAF.

Как разрешить AI-краулеры, чтобы бренд попадал в цитаты?

Убедитесь, что robots.txt их не запрещает, и в идеале добавьте явные правила Allow для нужных краулеров. Движок не процитирует страницу, которую ему не дали прочитать, так что разрешить YandexBot, GPTBot, PerplexityBot и Google-Extended – базовый минимум для видимости в нейросетях.

Соблюдают ли AI-краулеры robots.txt?

Большинство крупных операторов (Яндекс, OpenAI, Google, индексный бот Perplexity, Anthropic, Apple, Amazon, Common Crawl) заявляют, что их краулеры соблюдают robots.txt. Некоторые – в частности Bytespider и загрузчик Perplexity по требованию – по сообщениям его игнорируют, так что один robots.txt не гарантия против каждого бота.

Чем обучающий краулер отличается от загрузчика по требованию?

Обучающий или поисковый краулер обходит ваш сайт массово, чтобы собрать датасет или индекс. Загрузчик по требованию (вроде ChatGPT-User или Perplexity-User) загружает конкретную страницу, только когда её требует запрос пользователя. Каждый можно разрешить или заблокировать отдельно в robots.txt.

User-agent сверены с knownagents.com (ранее Dark Visitors) и собственной документацией операторов, июль 2026. Операторы со временем добавляют и переименовывают краулеры – всегда сверяйтесь с актуальной документацией оператора, прежде чем полагаться на одно правило.

Доступ – это первый шаг. Узнайте, рекомендуют ли вас нейросети на деле.

Запустить бесплатную проверку
Анализируем...