Роботы нейросетей: кто приходит на сайт
Справочник роботов ИИ по задачам — обучение, поиск, заход по запросу пользователя: что даёт открытие каждого, как отличить настоящего робота от подделки и кого пускать.
Содержание страницы
Три задачи роботов
Роботы нейросетей приходят на сайт за разным. От задачи зависит, что вы теряете, закрывая робота в robots.txt.
| Задача | Что делает робот | Если открыть | Если закрыть |
|---|---|---|---|
| Обучение моделей | Собирает тексты для обучения будущих версий | Бренд со временем попадает в «память» новых моделей | Будущие версии знают о вас меньше; уже обученные модели ничего не забудут |
| Поиск для ответов | Индексирует страницы, чтобы находить их, когда пользователь спрашивает | Страница может попасть в цитаты ответа | Сайт выпадает из ответов с поиском, даже если он лучший источник |
| Заход по запросу | Открывает страницу, когда пользователь дал ссылку или модель решила прочитать её прямо сейчас | Модель читает актуальную версию страницы | Модель не откроет страницу даже по просьбе пользователя |
Закрыть роботов обучения и оставить поисковых — законный выбор. Закрывать поисковых роботов ради «защиты контента» — значит добровольно выпасть из ответов.
Кто есть кто
| Имя в robots.txt | Чей | Задача |
|---|---|---|
| GPTBot | OpenAI | Обучение моделей |
| OAI-SearchBot | OpenAI | Поиск для ответов |
| ChatGPT-User | OpenAI | Заход по запросу пользователя |
| ClaudeBot | Anthropic | Обучение моделей |
| Claude-User | Anthropic | Заход по запросу пользователя |
| anthropic-ai | Anthropic | Устаревшее имя, встречается в старых robots.txt |
| PerplexityBot | Perplexity | Поиск для ответов |
| Perplexity-User | Perplexity | Заход по запросу пользователя |
| Google-Extended | Не отдельный робот, а метка: можно ли использовать страницы, собранные поиском Google, для моделей Gemini. На сам поиск Google не влияет | |
| Applebot-Extended | Apple | Не отдельный робот, а метка: можно ли использовать страницы, собранные роботом Apple, для обучения моделей |
| Bytespider | ByteDance | Сбор данных для моделей |
| CCBot | Common Crawl | Открытый архив веба, на котором обучают многие модели |
| Amazonbot | Amazon | Сбор данных для сервисов и моделей компании |
| meta-externalagent | Meta* | Сбор данных для моделей |
| YandexBot | Яндекс | Основной поисковый робот |
| YandexAdditional | Яндекс | Дополнительный робот для ответов нейросетей |
| Bingbot | Microsoft | Поисковый робот Bing |
Список сверен в сентябре 2026 года и совпадает с тем, что проверяет платформа. Компании добавляют и переименовывают роботов — перед правкой robots.txt сверяйтесь с документацией владельца робота.
* Компания Meta Platforms признана экстремистской организацией, её деятельность запрещена в России.
Как это записать в robots.txt
| Строки в robots.txt | Что они значат |
|---|---|
| User-agent: GPTBot, под ним Disallow: / | Робот обучения OpenAI не читает сайт |
| User-agent: OAI-SearchBot, под ним Allow: / | Поисковый робот OpenAI читает все страницы |
| User-agent: *, под ним Disallow: /account | Остальные роботы не заходят в личный кабинет |
- Раздел с именем робота полностью заменяет для него общий раздел «User-agent: *»: правила общего раздела на него уже не действуют, нужные запреты повторяют в именном.
- Разделы отделяются пустой строкой.
- Раздел «User-agent: Yandex» действует сразу на все роботы Яндекса.
- Запрет в robots.txt — просьба, а не замок: честные роботы её выполняют, сборщики контента — нет.
Настоящий робот или подделка
Имя робота в запросе может подставить кто угодно. «GPTBot» в логах сервера с незнакомого адреса — скорее всего сборщик контента, который прикрывается чужим именем.
- Обратный DNS
Адрес запроса переводят в имя хоста и проверяют, что оно в домене компании, а затем переводят имя обратно и сверяют с исходным адресом. Так проверяют роботов поисковых систем.
- Опубликованные списки адресов
Часть компаний публикует диапазоны адресов своих роботов. Запрос с адреса вне списка — не их робот.
- Ограничивать по адресу, а не по имени
Если сайт страдает от нагрузки, ограничивайте конкретные адреса. Запрет по имени в robots.txt отсечёт честного робота и не остановит подделку.
Как решить, кого пускать
- Поиск и заходы по запросу — пускать
Если бренду важно появляться в ответах нейросетей, эти роботы должны видеть публичные страницы.
- Обучение — решение бизнеса
Закрытие не убирает вас из ответов с поиском, но будущие версии моделей будут знать о вас меньше. Бренду, которому нужна узнаваемость, открытость обычно выгоднее.
- Служебные разделы — закрыть для всех
Личный кабинет, корзина, поиск по сайту и страницы с персональными данными роботам не нужны.
- Проверить результат
После правки robots.txt посмотрите блок «Доступность сайта для краулеров ИИ» в разделе «Источники»: он покажет, какие роботы теперь пускаются.