Сайт, который нейросеть может прочитать

Чек-лист доступности сайта для ИИ: robots.txt, карта сайта, текст без скриптов, микроразметка, llms.txt — и граница между пререндером и клоакингом.

Содержание страницы

Зачем это проверять

Нейросеть с веб-поиском цитирует страницы, которые смогла прочитать. Если робот не пускается на сайт или получает пустую страницу, сайт выпадает из источников, каким бы хорошим ни был текст.

Проверка сайта — база, а не весь план. На общие вопросы о категории модели чаще цитируют сторонние площадки; свой сайт работает на вопросы о самом бренде и на точность фактов. Про площадки — страница «Где размещать информацию о бренде».

Базовая проверка

Сайт готов к чтению нейросетями, если
  • robots.txt не закрывает поисковых роботов нейросетей — поимённо, см. «Роботы нейросетей».
  • Карта сайта существует и указана в robots.txt.
  • Основной текст страницы виден без выполнения скриптов.
  • У каждой страницы свой осмысленный заголовок и один H1.
  • Есть микроразметка Schema.org для организации, товаров или услуг и вопросов-ответов.
  • Цены, адреса, состав и условия написаны текстом, а не только на картинках.
  • На частые вопросы клиентов есть страницы с прямыми ответами.

Текст без скриптов

Многие роботы нейросетей не выполняют JavaScript. Если сайт собирает текст в браузере, такой робот видит пустой шаблон страницы.

  1. Откройте код страницы

    В браузере: правый клик по странице и пункт «Просмотр кода страницы». Это то, что сервер отдаёт до выполнения скриптов.

  2. Найдите фразу из текста

    Поиском по коду найдите пару предложений из основного текста. Нашлись — робот их видит.

  3. Не нашлись — задача разработчику

    Нужен серверный рендеринг или пререндер: сервер сразу отдаёт готовый HTML с текстом.

Пререндер и граница клоакинга

Пререндер — когда роботу отдаётся заранее собранный HTML той же страницы. Это нормальная техника, пока робот и человек получают одинаковое содержание.

  • Можно: отдать роботу готовый HTML, который браузер показывает после выполнения скриптов.
  • Нельзя: другой текст, дополнительные ключевые слова или скрытые блоки только для роботов.
  • Опасно: устаревшая копия из кэша с прошлыми ценами и наличием. Намерения обмануть нет, но для поисковой системы это выглядит так же.
Почему это важно для GEO

Поисковые системы наказывают сайты за разное содержание для роботов и людей. А поисковый индекс — один из главных источников, откуда нейросети берут страницы для ответов.

Файл llms.txt

llms.txt — текстовое досье сайта для ИИ: кто вы, что на сайте главное, где ключевые страницы. Это черновик соглашения, и крупные разработчики моделей не подтверждали, что используют его.

Сделать файл недорого, но это гигиена, а не рычаг: он не заменяет ни один пункт из проверки выше.

Что проверяет платформа

Блок «Доступность сайта для краулеров ИИ» в разделе «Источники» проверяет сайт проекта: правила robots.txt для каждого робота, наличие llms.txt и карты сайта, что получает робот на живых страницах по сравнению с браузером и остаётся ли текст без скриптов. Рядом — заголовок, H1 и микроразметка страниц. Доступность блока зависит от тарифа.