Роботы нейросетей: кто приходит на сайт

Справочник роботов ИИ по задачам — обучение, поиск, заход по запросу пользователя: что даёт открытие каждого, как отличить настоящего робота от подделки и кого пускать.

Содержание страницы

Три задачи роботов

Роботы нейросетей приходят на сайт за разным. От задачи зависит, что вы теряете, закрывая робота в robots.txt.

ЗадачаЧто делает роботЕсли открытьЕсли закрыть
Обучение моделейСобирает тексты для обучения будущих версийБренд со временем попадает в «память» новых моделейБудущие версии знают о вас меньше; уже обученные модели ничего не забудут
Поиск для ответовИндексирует страницы, чтобы находить их, когда пользователь спрашиваетСтраница может попасть в цитаты ответаСайт выпадает из ответов с поиском, даже если он лучший источник
Заход по запросуОткрывает страницу, когда пользователь дал ссылку или модель решила прочитать её прямо сейчасМодель читает актуальную версию страницыМодель не откроет страницу даже по просьбе пользователя
Главный вывод

Закрыть роботов обучения и оставить поисковых — законный выбор. Закрывать поисковых роботов ради «защиты контента» — значит добровольно выпасть из ответов.

Кто есть кто

Имя в robots.txtЧейЗадача
GPTBotOpenAIОбучение моделей
OAI-SearchBotOpenAIПоиск для ответов
ChatGPT-UserOpenAIЗаход по запросу пользователя
ClaudeBotAnthropicОбучение моделей
Claude-UserAnthropicЗаход по запросу пользователя
anthropic-aiAnthropicУстаревшее имя, встречается в старых robots.txt
PerplexityBotPerplexityПоиск для ответов
Perplexity-UserPerplexityЗаход по запросу пользователя
Google-ExtendedGoogleНе отдельный робот, а метка: можно ли использовать страницы, собранные поиском Google, для моделей Gemini. На сам поиск Google не влияет
Applebot-ExtendedAppleНе отдельный робот, а метка: можно ли использовать страницы, собранные роботом Apple, для обучения моделей
BytespiderByteDanceСбор данных для моделей
CCBotCommon CrawlОткрытый архив веба, на котором обучают многие модели
AmazonbotAmazonСбор данных для сервисов и моделей компании
meta-externalagentMeta*Сбор данных для моделей
YandexBotЯндексОсновной поисковый робот
YandexAdditionalЯндексДополнительный робот для ответов нейросетей
BingbotMicrosoftПоисковый робот Bing

Список сверен в сентябре 2026 года и совпадает с тем, что проверяет платформа. Компании добавляют и переименовывают роботов — перед правкой robots.txt сверяйтесь с документацией владельца робота.

* Компания Meta Platforms признана экстремистской организацией, её деятельность запрещена в России.

Как это записать в robots.txt

Строки в robots.txtЧто они значат
User-agent: GPTBot, под ним Disallow: /Робот обучения OpenAI не читает сайт
User-agent: OAI-SearchBot, под ним Allow: /Поисковый робот OpenAI читает все страницы
User-agent: *, под ним Disallow: /accountОстальные роботы не заходят в личный кабинет
  • Раздел с именем робота полностью заменяет для него общий раздел «User-agent: *»: правила общего раздела на него уже не действуют, нужные запреты повторяют в именном.
  • Разделы отделяются пустой строкой.
  • Раздел «User-agent: Yandex» действует сразу на все роботы Яндекса.
  • Запрет в robots.txt — просьба, а не замок: честные роботы её выполняют, сборщики контента — нет.

Настоящий робот или подделка

Имя робота в запросе может подставить кто угодно. «GPTBot» в логах сервера с незнакомого адреса — скорее всего сборщик контента, который прикрывается чужим именем.

  1. Обратный DNS

    Адрес запроса переводят в имя хоста и проверяют, что оно в домене компании, а затем переводят имя обратно и сверяют с исходным адресом. Так проверяют роботов поисковых систем.

  2. Опубликованные списки адресов

    Часть компаний публикует диапазоны адресов своих роботов. Запрос с адреса вне списка — не их робот.

  3. Ограничивать по адресу, а не по имени

    Если сайт страдает от нагрузки, ограничивайте конкретные адреса. Запрет по имени в robots.txt отсечёт честного робота и не остановит подделку.

Как решить, кого пускать

  1. Поиск и заходы по запросу — пускать

    Если бренду важно появляться в ответах нейросетей, эти роботы должны видеть публичные страницы.

  2. Обучение — решение бизнеса

    Закрытие не убирает вас из ответов с поиском, но будущие версии моделей будут знать о вас меньше. Бренду, которому нужна узнаваемость, открытость обычно выгоднее.

  3. Служебные разделы — закрыть для всех

    Личный кабинет, корзина, поиск по сайту и страницы с персональными данными роботам не нужны.

  4. Проверить результат

    После правки robots.txt посмотрите блок «Доступность сайта для краулеров ИИ» в разделе «Источники»: он покажет, какие роботы теперь пускаются.