GeoDash
Бесплатный инструмент

Проверка robots.txt и доступности для обхода

Посмотрите свой robots.txt и проверьте, могут ли поисковые и AI-краулеры реально читать ваш сайт. Проверьте YandexBot, Googlebot, GPTBot, PerplexityBot и 10+ других бот за ботом, протестируйте любой URL по правилам и поймайте проблемы доступности и индексируемости – noindex, JavaScript, HTTP-статус, – из-за которых вас нет в выдаче.

Мы загружаем ваш robots.txt и страницу как краулер. Ничего не хранится.
Загружаем страницу как краулер…

Как пользоваться этой проверкой robots.txt

Введите домен, и инструмент делает три вещи, которые должна делать хорошая проверка robots.txt. Первое: загружает и показывает ваш живой robots.txt, чтобы вы прочитали реальные правила. Второе: проверяет по ним каждый крупный краулер – YandexBot, Googlebot и Bingbot для поиска, плюс GPTBot, PerplexityBot, ClaudeBot и другие ИИ-боты – и помечает каждый как Разрешён или Заблокирован. Третье: можно ввести любой путь URL и выбрать user-agent, чтобы проверить, доступна ли именно эта страница. Помимо robots.txt, он проверяет и остальное, что мешает индексации, – HTTP-статус, зависимость от JavaScript, noindex, canonical и sitemap.

Что такое доступность для обхода?

Доступность для обхода – это способность ботов загрузить, прочитать и проиндексировать ваши страницы. Она всегда была важна для SEO – если Googlebot не может обойти страницу, она не ранжируется, – но нейросети подняли ставки: ассистенты вроде ChatGPT, YandexGPT, GigaChat и ответов Google могут рекомендовать только тот контент, который смогли прочитать их краулеры. Этот инструмент запускает живой тест доступности на любом URL и показывает, что именно мешает нейросетям и поиску его прочитать, – те же проблемы доступности, что вредят SEO, делают вас невидимым и для нейросетей.

Что проверяет этот тест доступности

Введите URL, и инструмент загрузит его так, как это делает краулер, – без выполнения JavaScript – и сообщит:

HTTP-статус
Отдаёт ли страница 200 или редиректит / ошибается до того, как бот успеет её прочитать?
Зависимость от JavaScript
Сколько контента в исходном HTML. Большинство AI-краулеров не выполняют JS – если контенту он нужен, они видят пустую страницу.
Индексируемость
Не говорит ли мета-тег noindex или заголовок X-Robots-Tag движкам исключить страницу.
robots.txt
Разрешены ли GPTBot, PerplexityBot, YandexBot, Google-Extended и ещё несколько AI-краулеров – бот за ботом.
Canonical и sitemap
Указываете ли вы движкам правильный URL и помогаете ли им находить ваши страницы.
llms.txt
Даёте ли вы нейросетям выверенную карту ключевых страниц.

По сути это взгляд на вашу страницу глазами бота: он не выполняет JavaScript, так что отчёт близок к тому, что реально получает GPTBot или не-рендерящий краулер.

Какие AI-краулеры проверяет этот инструмент

Единого «ИИ-бота» нет – у каждого крупного ИИ-продукта свой краулер со своим user-agent, и каждый можно разрешить или заблокировать отдельно. Эта проверка читает ваш robots.txt и сообщает статус тех, что важнее всего сегодня:

User-agent
На кого работает / что питает
GPTBot
OpenAI – обучает и улучшает модели ChatGPT.
OAI-SearchBot
OpenAI – индексирует страницы для результатов поиска ChatGPT.
ChatGPT-User
OpenAI – загружает страницу вживую, когда её требует запрос пользователя ChatGPT.
YandexBot
Яндекс – обходит и индексирует страницы для Поиска и YandexGPT / Алисы.
PerplexityBot
Perplexity – индексирует страницы, чтобы их можно было цитировать в ответах.
Perplexity-User
Perplexity – живая загрузка под конкретный запрос пользователя.
Google-Extended
Google – управляет использованием вашего контента в Gemini и Vertex AI.
ClaudeBot
Anthropic – собирает контент, используемый Claude.
CCBot
Common Crawl – открытый датасет, на котором обучаются многие ИИ-модели.
Applebot-Extended
Apple – управляет использованием в Apple Intelligence.
Bytespider
ByteDance – краулер для её ИИ-продуктов.

Нужны все user-agent, не только эти? Смотрите полный список AI-краулеров – 25+ ботов с описанием, что каждый делает и соблюдает ли robots.txt.

Как проверить, блокирует ли ваш сайт нейросети

Почти вся блокировка AI-краулеров живёт в одном файле: robots.txt, по адресу вашдомен.ru/robots.txt. Можно открыть его самому и поискать правила Disallow под перечисленными user-agent – но формат капризный, и одно правило с маской способно заблокировать всё. Проверка выше делает это за вас: введите домен, и она прочитает живой robots.txt, разрешит правила для каждого бота и пометит каждый краулер как Разрешён или Заблокирован. Крупные AI-краулеры публично заявляют, что соблюдают robots.txt, так что что в файле – то они и делают, и именно поэтому его стоит настроить верно.

Блокировать или разрешать AI-краулеры?

Это реальное бизнес-решение, а не дефолт. Если вы издатель, чей продукт – ваш контент, блокировка AI-краулеров защищает его от использования без компенсации – законный выбор. Но если вы хотите, чтобы нейросети рекомендовали ваш бренд, продукт или услугу, блокировать краулеры – стрелять себе в ногу: движок не процитирует страницу, которую ему не дали прочитать. Большинству бизнесов, которым нужно, чтобы их находили, стоит разрешить краулеры поиска и живой загрузки. Можно и разрешить одни, а заблокировать другие – например, пустить поисковые боты и живую загрузку, но закрыть чисто обучающие краулеры.

Как разрешить или заблокировать конкретный краулер

Чтобы разрешить нужные AI-краулеры, убедитесь, что robots.txt их не запрещает. Явные правила allow – самый ясный способ обозначить намерение:

User-agent: GPTBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Allow: /

Чтобы наоборот заблокировать конкретный краулер – скажем, не пускать GPTBot – запретите его по имени:

User-agent: GPTBot
Disallow: /

Когда краулеры могут вас прочитать, следующий шаг – помочь им вас понять. Файл llms.txt даёт нейросетям выверенную карту важнейших страниц – подробнее о том, как стать читаемым для нейросетей.

Частые вопросы

Что такое проверка robots.txt?

Проверка robots.txt загружает файл robots.txt вашего сайта и показывает, разрешены или заблокированы конкретные краулеры – поисковые вроде YandexBot и Googlebot и ИИ-боты вроде GPTBot. Эта также даёт протестировать любой URL по правилам и отмечает проблемы доступности за пределами robots.txt.

Как проверить свой robots.txt?

Введите домен выше. Инструмент читает ваш живой robots.txt, показывает исходный файл и сообщает, какие поисковые и ИИ-краулеры имеют доступ. Можно также ввести любой путь URL и выбрать user-agent, чтобы проверить, разрешена ли именно эта страница.

Что такое AI-краулер?

AI-краулер – это автоматический бот, который загружает ваши страницы для ИИ-продукта: чтобы обучить модель, проиндексировать страницы для поиска или прочитать страницу вживую, когда пользователь задаёт вопрос. GPTBot, PerplexityBot и YandexBot – примеры.

Соблюдает ли ChatGPT robots.txt?

Да. Краулеры OpenAI (GPTBot, OAI-SearchBot, ChatGPT-User) публично заявляют, что следуют правилам robots.txt, как и Perplexity, Anthropic и краулеры Яндекса и Google. Так что правило Disallow в robots.txt действительно их не пускает – поэтому случайная блокировка тихо стоит вам видимости в нейросетях.

Как узнать, блокирует ли мой сайт нейросети?

Введите домен в проверке выше. Она читает ваш живой robots.txt и показывает, бот за ботом, разрешён или заблокирован каждый крупный AI-краулер, плюс есть ли у вас llms.txt.

Стоит ли блокировать AI-краулеры?

Только если защита контента от нейросетей для вас важнее, чем быть ими рекомендованным. Если вы хотите, чтобы ChatGPT, YandexGPT или GigaChat упоминали ваш бренд, нужно разрешить их краулеры – они не могут процитировать то, что не могут прочитать.

Чем отличаются robots.txt и llms.txt?

robots.txt говорит краулерам, к чему им разрешён доступ. llms.txt говорит нейросетям, что за сайт перед ними и какие страницы важнее всего, в чистом машиночитаемом формате. robots.txt управляет доступом; llms.txt улучшает понимание. Нужны оба, настроенные верно.

Как разрешить GPTBot или PerplexityBot?

Убедитесь, что в robots.txt нет правила Disallow для них, и в идеале добавьте явный блок User-agent: GPTBot / Allow: /. Смотрите примеры robots.txt выше.

Читают ли AI-краулеры JavaScript?

В основном нет. В отличие от Googlebot, крупные AI-краулеры (GPTBot, PerplexityBot, YandexBot и другие) обычно загружают исходный HTML без выполнения JavaScript. Если основной контент рисуется на клиенте, они видят почти пустую страницу – поэтому инструмент отмечает зависимость от JavaScript как проблему доступности.

Из-за чего страница не индексируется?

Чаще всего причины – директива noindex (в мета-теге robots или заголовке X-Robots-Tag), HTTP-статус не 200, блокировка в robots.txt или контент, который появляется только после выполнения JavaScript. Инструмент проверяет всё это за один проход.

Как увидеть страницу глазами краулера?

Введите URL выше. Инструмент загружает страницу без выполнения JavaScript – близко к тому, что получает не-рендерящий бот вроде GPTBot, – и показывает статус, сколько текста в исходном HTML и любые препятствия к индексации.

Доступность – это первый шаг. Узнайте, рекомендуют ли вас нейросети на деле.

Запустить бесплатную проверку
Анализируем...