Архив рубрики ~Лента новостей~

AI-краулеры в 2026: кого пускать в robots.txt, чтобы попадать в ответы ИИ

AI-краулеры в 2026: кого пускать в robots.txt, чтобы попадать в ответы ИИ
AI-краулеры в 2026: кого пускать в robots.txt, чтобы попадать в ответы ИИ

Полгода назад ко мне постучался один из будущих клиентов с вопросом, почему ChatGPT не знает про его компанию, хотя сайт в топ-3 Google по нужному запросу. Индексация была нормальной, ссылки — тоже. Проблема нашлась за пять минут в логах: в robots.txt висел Disallow: / для всех user-agent, кроме Googlebot и YandexBot. GPTBot, ClaudeBot, PerplexityBot получали 403 ещё на первом запросе. Полгода сайт был невидим для трёх из четырёх крупных AI-поисковиков, и никто об этом не знал — в Search Console и Вебмастере всё выглядело зелёным.

Случай типовой. Проверка индексации показывает, видит ли сайт поисковик. Попадёт ли страница в ответ модели, которая формирует его вместо поисковой выдачи, — вопрос отдельный. Это две разные аудитории ботов, и вторая почти никогда не попадает в стандартный SEO-чеклист.

Почему классический доступ ≠ доступ для ИИ

GoogleBot и YandexBot строят индекс для ранжирования: заходят регулярно, кэшируют страницу. AI-краулеры делятся на два типа с разной механикой.

Первый тип — это краулеры для обучения моделей: GPTBot у OpenAI, ClaudeBot у Anthropic, CCBot у Common Crawl. Собирают массив текста на будущее, заходят реже, результат не виден сразу.

Второй тип краулеров — это краулеры реального времени: OAI-SearchBot, PerplexityBot, ChatGPT-User. Заходят на страницу в момент, когда пользователь задаёт вопрос модели, забирают контент и отдают его для формирования ответа здесь и сейчас. Нет доступа у такого бота — модель либо не найдёт страницу, либо процитирует конкурента с открытым доступом.

Кстати, robots.txt чаще всего правят один раз при запуске сайта. Список актуальных AI-ботов за два года вырос в разы, а старый файл этого не знает.

Кого пускать: список ботов 2026

Мой личный набор + то, что настраиваю своим клиентам

Рабочий список на конец июля 2026 года, чтобы попадать в ответы ИИ:

  • GPTBot (OpenAI) — сбор данных для обучения моделей.

  • ChatGPT-User — заходит по прямому запросу пользователя внутри диалога с ChatGPT.

  • OAI-SearchBot (OpenAI) — краулер поискового режима ChatGPT, реальное время.

  • ClaudeBot и anthropic-ai (Anthropic) — сбор и обучение моделей Claude.

  • PerplexityBot — основной краулер Perplexity, реальное время.

  • Google-Extended — отдельная директива для использования контента в Gemini и AI Overviews; не путать с обычным GoogleBot.

  • YandexBot и YandexAI — классический индексатор Яндекса и отдельный бот для ответов Алисы AI.

  • GigaChat — краулер Гигачата от Сбера.

  • Applebot-Extended — расширение Applebot для Apple Intelligence.

  • CCBot (Common Crawl) — датасет, на котором обучается часть моделей, включая открытые LLM.

Полные и обновляемые правила по каждому боту публикуют сами компании: OpenAI — GPTBot, Anthropic — ClaudeBot, Google — Google-Extended. Их стоит перепроверять раз в квартал: новые user-agent выходят без громких анонсов.

Запросы простые:

User-agent: GPTBot Allow: / User-agent: PerplexityBot Allow: / User-agent: ClaudeBot Allow: /0ea8c71290631c6cdcdd57091e4e7a62

Блокировать имеет смысл точечно — закрытые разделы вроде личного кабинета или черновиков. Общий Disallow: / ловит AI-ботов заодно с парсерами-агрегаторами.

Почему Robots.txt — только первый слой

Доступ теряется ещё в трёх местах, и там его теряют чаще, потому что о них не думают в контексте AI
Доступ теряется ещё в трёх местах, и там его теряют чаще, потому что о них не думают в контексте AI

Content-Security-Policy. Слишком широкие блокировки fetch/connect-src на уровне прокси или CDN задевают легитимных ботов. Файл robots.txt может разрешать бота, а WAF — резать его по IP или user-agent отдельным правилом.

JS-рендер без SSR. Часть ботов реального времени не исполняет JavaScript как браузер. Perplexity-User и OAI-SearchBot забирают HTML первого ответа сервера. Если контент подгружается клиентским JS после этого, модель видит пустую страницу или обрезанный каркас — даже при полностью открытом robots.txt.

Бесконечный скролл без прогрессивной загрузки. Карточки, которые подгружаются только по прокрутке через intersection observer и не лежат в исходном HTML или на постраничных URL, бот не увидит дальше первого экрана.

Комбинация этих трёх факторов и создаёт ситуацию из начала статьи: сайт в индексе Google и Яндекса (эти боты умеют рендерить JS, терпеливее к CSP), но невидим для более простых ботов реального времени.

Переименование, которое легко пропустить

В 2026 году Google переименовала user-agent NotebookLM в Google-GeminiNotebook — об этом писал Search Engine Land в разборе изменений списка краулеров Google. У кого правила в robots.txt, WAF или аналитике по user-agent жёстко зашиты под старое имя NotebookLM, строки перестали срабатывать: правило существует в файле, но адресовано боту, которого больше нет под этим именем.

Если такое упоминание есть в вашем robots.txt или конфиге фаервола, строку нужно продублировать или переписать на Google-GeminiNotebook до конца лета 2026 года.

Как проверить свой сайт

Логи сервера по user-agent. grep по access-логам за две недели даёт список ботов, которые реально заходили, и коды ответов. 403 или редирект на страницу логина — сигнал проблемы:

grep -E «GPTBot|ClaudeBot|PerplexityBot|OAI-SearchBot» access.log | awk ‘{print $9}’ | sort | uniq -c

Тестовый запрос с нужным user-agent. curl с подменой заголовка покажет, что реально отдаёт сервер:

curl -A «GPTBot» -I https://example.com/page curl -A «PerplexityBot» https://example.com/page | head -50

Пустой div с классом root без текста в ответе — контент рендерится клиентским JS, это тот самый случай без SSR.

Яндекс.Вебмастер — для YandexBot и YandexAI: показывает, что конкретно видит краулер, включая генеративный контур Алисы. Для остальных ботов встроенного инструмента у площадок нет — только логи и curl.

Три проблемы, с которыми чаще всего стакливаются

  1. Готовый шаблон robots.txt из старого проекта. Скопировали файл двухлетней давности, где прописаны боты 2024 года. OAI-SearchBot и Google-Extended вышли позже и в список исключений не попали автоматически.

  2. CDN с собственной защитой от ботов. Некоторые CDN по умолчанию включают защиту от парсеров по эвристике на user-agent, и туда попадают легитимные AI-краулеры вместе со спамом. Правило живёт на уровне CDN, а не в robots.txt, поэтому его никто не проверяет при обычном SEO-аудите.

  3. Ну раз сайт индексируется, значит, всё в порядке. Индексация в Яндексе и Google ничего не говорит про доступ для GPTBot или PerplexityBot. Это разные проверки, и делать их нужно отдельно.

Проверка robots.txt на актуальный список AI-ботов должна попасть в тот же регулярный аудит, где сейчас лежат проверка индексации и Core Web Vitals. Раз в квартал достаточно. Правка в том случае с сайтом заняла пятнадцать минут — пять строк Allow для основных AI-краулеров, — а динамика цитирований в ChatGPT и Perplexity пошла вверх уже в следующем цикле замера, с лагом в пару недель на переобход.

Источник: habr.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Коротко из Telegram~ Сэм Альтман заявил, что мы уже живём в сингулярности. В… Архив рубрики ~Полезное~ OpenAI добавила голосовой режим в Codex. Теперь можно вслух ставить… Архив рубрики ~Коротко из Telegram~ Anthropic выпустила Claude Opus 5 Новая модель почти догнала Fable… Архив рубрики ~Коротко из Telegram~ Любую картинку теперь можно разобрать на промпт. Расширение PromptCard анализирует изображения… Архив рубрики ~Коротко из Telegram~ У Seedance появился новый конкурент — FLUX 3. Black Forest… Архив рубрики ~Коротко из Telegram~ Создатель Twitter Джек Дорси запустил локальное пространство для совместной работы… Архив рубрики ~Коротко из Telegram~ Для ChatGPT и Codex собрали библиотеку полезных сценариев. На сайте… Архив рубрики ~Коротко из Telegram~ Первая скрепка уже звенит «Проблема скрепок» – это мысленный эксперимент о… Архив рубрики ~Коротко из Telegram~ Китайцы выкатили нового убийцу Nano Banana — Qwen-Image-3.0 . Новая модель… Архив рубрики ~Коротко из Telegram~ Зои Хитциг, которая ушла из OpenAI в феврале, опубликовала в… Архив рубрики ~Коротко из Telegram~ В Higgsfield появился Pinterest для нейровидео. В разделе Community собрали работы других… Архив рубрики ~Коротко из Telegram~ 🤖 Пока весь мир обсуждает новые ИИ-модели, появляется и другая… Архив рубрики ~Коротко из Telegram~ Neuralink — ПАРАЛИЗОВАННЫЕ ПАЦИЕНТЫ УПРАВЛЯЮТ ИНВАЛИДНЫМИ КАЛЯСКАМИ СИЛОЙ МЫСЛИ 🧠♿️… Архив рубрики ~Коротко из Telegram~ Fable 5 — мощный. Но дорогой. Opus 4.8 — дешевле…. Архив рубрики ~Коротко из Telegram~ Сэм Альтман заявил, что мы уже живём в сингулярности. В… Архив рубрики ~Полезное~ OpenAI добавила голосовой режим в Codex. Теперь можно вслух ставить… Архив рубрики ~Коротко из Telegram~ Anthropic выпустила Claude Opus 5 Новая модель почти догнала Fable… Архив рубрики ~Коротко из Telegram~ Любую картинку теперь можно разобрать на промпт. Расширение PromptCard анализирует изображения… Архив рубрики ~Коротко из Telegram~ У Seedance появился новый конкурент — FLUX 3. Black Forest… Архив рубрики ~Коротко из Telegram~ Создатель Twitter Джек Дорси запустил локальное пространство для совместной работы… Архив рубрики ~Коротко из Telegram~ Для ChatGPT и Codex собрали библиотеку полезных сценариев. На сайте… Архив рубрики ~Коротко из Telegram~ Первая скрепка уже звенит «Проблема скрепок» – это мысленный эксперимент о… Архив рубрики ~Коротко из Telegram~ Китайцы выкатили нового убийцу Nano Banana — Qwen-Image-3.0 . Новая модель… Архив рубрики ~Коротко из Telegram~ Зои Хитциг, которая ушла из OpenAI в феврале, опубликовала в… Архив рубрики ~Коротко из Telegram~ В Higgsfield появился Pinterest для нейровидео. В разделе Community собрали работы других… Архив рубрики ~Коротко из Telegram~ 🤖 Пока весь мир обсуждает новые ИИ-модели, появляется и другая… Архив рубрики ~Коротко из Telegram~ Neuralink — ПАРАЛИЗОВАННЫЕ ПАЦИЕНТЫ УПРАВЛЯЮТ ИНВАЛИДНЫМИ КАЛЯСКАМИ СИЛОЙ МЫСЛИ 🧠♿️… Архив рубрики ~Коротко из Telegram~ Fable 5 — мощный. Но дорогой. Opus 4.8 — дешевле….

Оставить комментарий