Как пользоваться этой проверкой robots.txt
Введите домен, и инструмент делает три вещи, которые должна делать хорошая проверка robots.txt. Первое: загружает и показывает ваш живой robots.txt, чтобы вы прочитали реальные правила. Второе: проверяет по ним каждый крупный краулер – YandexBot, Googlebot и Bingbot для поиска, плюс GPTBot, PerplexityBot, ClaudeBot и другие ИИ-боты – и помечает каждый как Разрешён или Заблокирован. Третье: можно ввести любой путь URL и выбрать user-agent, чтобы проверить, доступна ли именно эта страница. Помимо robots.txt, он проверяет и остальное, что мешает индексации, – HTTP-статус, зависимость от JavaScript, noindex, canonical и sitemap.
Что такое доступность для обхода?
Доступность для обхода – это способность ботов загрузить, прочитать и проиндексировать ваши страницы. Она всегда была важна для SEO – если Googlebot не может обойти страницу, она не ранжируется, – но нейросети подняли ставки: ассистенты вроде ChatGPT, YandexGPT, GigaChat и ответов Google могут рекомендовать только тот контент, который смогли прочитать их краулеры. Этот инструмент запускает живой тест доступности на любом URL и показывает, что именно мешает нейросетям и поиску его прочитать, – те же проблемы доступности, что вредят SEO, делают вас невидимым и для нейросетей.
Что проверяет этот тест доступности
Введите URL, и инструмент загрузит его так, как это делает краулер, – без выполнения JavaScript – и сообщит:
noindex или заголовок X-Robots-Tag движкам исключить страницу.По сути это взгляд на вашу страницу глазами бота: он не выполняет JavaScript, так что отчёт близок к тому, что реально получает GPTBot или не-рендерящий краулер.
Какие AI-краулеры проверяет этот инструмент
Единого «ИИ-бота» нет – у каждого крупного ИИ-продукта свой краулер со своим user-agent, и каждый можно разрешить или заблокировать отдельно. Эта проверка читает ваш robots.txt и сообщает статус тех, что важнее всего сегодня:
Нужны все user-agent, не только эти? Смотрите полный список AI-краулеров – 25+ ботов с описанием, что каждый делает и соблюдает ли robots.txt.
Как проверить, блокирует ли ваш сайт нейросети
Почти вся блокировка AI-краулеров живёт в одном файле: robots.txt, по адресу вашдомен.ru/robots.txt. Можно открыть его самому и поискать правила Disallow под перечисленными user-agent – но формат капризный, и одно правило с маской способно заблокировать всё. Проверка выше делает это за вас: введите домен, и она прочитает живой robots.txt, разрешит правила для каждого бота и пометит каждый краулер как Разрешён или Заблокирован. Крупные AI-краулеры публично заявляют, что соблюдают robots.txt, так что что в файле – то они и делают, и именно поэтому его стоит настроить верно.
Блокировать или разрешать AI-краулеры?
Это реальное бизнес-решение, а не дефолт. Если вы издатель, чей продукт – ваш контент, блокировка AI-краулеров защищает его от использования без компенсации – законный выбор. Но если вы хотите, чтобы нейросети рекомендовали ваш бренд, продукт или услугу, блокировать краулеры – стрелять себе в ногу: движок не процитирует страницу, которую ему не дали прочитать. Большинству бизнесов, которым нужно, чтобы их находили, стоит разрешить краулеры поиска и живой загрузки. Можно и разрешить одни, а заблокировать другие – например, пустить поисковые боты и живую загрузку, но закрыть чисто обучающие краулеры.
Как разрешить или заблокировать конкретный краулер
Чтобы разрешить нужные AI-краулеры, убедитесь, что robots.txt их не запрещает. Явные правила allow – самый ясный способ обозначить намерение:
User-agent: GPTBot Allow: / User-agent: PerplexityBot Allow: / User-agent: Google-Extended Allow: /
Чтобы наоборот заблокировать конкретный краулер – скажем, не пускать GPTBot – запретите его по имени:
User-agent: GPTBot Disallow: /
Когда краулеры могут вас прочитать, следующий шаг – помочь им вас понять. Файл llms.txt даёт нейросетям выверенную карту важнейших страниц – подробнее о том, как стать читаемым для нейросетей.
Частые вопросы
Что такое проверка robots.txt?
Проверка robots.txt загружает файл robots.txt вашего сайта и показывает, разрешены или заблокированы конкретные краулеры – поисковые вроде YandexBot и Googlebot и ИИ-боты вроде GPTBot. Эта также даёт протестировать любой URL по правилам и отмечает проблемы доступности за пределами robots.txt.
Как проверить свой robots.txt?
Введите домен выше. Инструмент читает ваш живой robots.txt, показывает исходный файл и сообщает, какие поисковые и ИИ-краулеры имеют доступ. Можно также ввести любой путь URL и выбрать user-agent, чтобы проверить, разрешена ли именно эта страница.
Что такое AI-краулер?
AI-краулер – это автоматический бот, который загружает ваши страницы для ИИ-продукта: чтобы обучить модель, проиндексировать страницы для поиска или прочитать страницу вживую, когда пользователь задаёт вопрос. GPTBot, PerplexityBot и YandexBot – примеры.
Соблюдает ли ChatGPT robots.txt?
Да. Краулеры OpenAI (GPTBot, OAI-SearchBot, ChatGPT-User) публично заявляют, что следуют правилам robots.txt, как и Perplexity, Anthropic и краулеры Яндекса и Google. Так что правило Disallow в robots.txt действительно их не пускает – поэтому случайная блокировка тихо стоит вам видимости в нейросетях.
Как узнать, блокирует ли мой сайт нейросети?
Введите домен в проверке выше. Она читает ваш живой robots.txt и показывает, бот за ботом, разрешён или заблокирован каждый крупный AI-краулер, плюс есть ли у вас llms.txt.
Стоит ли блокировать AI-краулеры?
Только если защита контента от нейросетей для вас важнее, чем быть ими рекомендованным. Если вы хотите, чтобы ChatGPT, YandexGPT или GigaChat упоминали ваш бренд, нужно разрешить их краулеры – они не могут процитировать то, что не могут прочитать.
Чем отличаются robots.txt и llms.txt?
robots.txt говорит краулерам, к чему им разрешён доступ. llms.txt говорит нейросетям, что за сайт перед ними и какие страницы важнее всего, в чистом машиночитаемом формате. robots.txt управляет доступом; llms.txt улучшает понимание. Нужны оба, настроенные верно.
Как разрешить GPTBot или PerplexityBot?
Убедитесь, что в robots.txt нет правила Disallow для них, и в идеале добавьте явный блок User-agent: GPTBot / Allow: /. Смотрите примеры robots.txt выше.
Читают ли AI-краулеры JavaScript?
В основном нет. В отличие от Googlebot, крупные AI-краулеры (GPTBot, PerplexityBot, YandexBot и другие) обычно загружают исходный HTML без выполнения JavaScript. Если основной контент рисуется на клиенте, они видят почти пустую страницу – поэтому инструмент отмечает зависимость от JavaScript как проблему доступности.
Из-за чего страница не индексируется?
Чаще всего причины – директива noindex (в мета-теге robots или заголовке X-Robots-Tag), HTTP-статус не 200, блокировка в robots.txt или контент, который появляется только после выполнения JavaScript. Инструмент проверяет всё это за один проход.
Как увидеть страницу глазами краулера?
Введите URL выше. Инструмент загружает страницу без выполнения JavaScript – близко к тому, что получает не-рендерящий бот вроде GPTBot, – и показывает статус, сколько текста в исходном HTML и любые препятствия к индексации.