Сайт, который нейросеть может прочитать
Чек-лист доступности сайта для ИИ: robots.txt, карта сайта, текст без скриптов, микроразметка, llms.txt — и граница между пререндером и клоакингом.
Содержание страницы
Зачем это проверять
Нейросеть с веб-поиском цитирует страницы, которые смогла прочитать. Если робот не пускается на сайт или получает пустую страницу, сайт выпадает из источников, каким бы хорошим ни был текст.
Проверка сайта — база, а не весь план. На общие вопросы о категории модели чаще цитируют сторонние площадки; свой сайт работает на вопросы о самом бренде и на точность фактов. Про площадки — страница «Где размещать информацию о бренде».
Базовая проверка
- robots.txt не закрывает поисковых роботов нейросетей — поимённо, см. «Роботы нейросетей».
- Карта сайта существует и указана в robots.txt.
- Основной текст страницы виден без выполнения скриптов.
- У каждой страницы свой осмысленный заголовок и один H1.
- Есть микроразметка Schema.org для организации, товаров или услуг и вопросов-ответов.
- Цены, адреса, состав и условия написаны текстом, а не только на картинках.
- На частые вопросы клиентов есть страницы с прямыми ответами.
Текст без скриптов
Многие роботы нейросетей не выполняют JavaScript. Если сайт собирает текст в браузере, такой робот видит пустой шаблон страницы.
- Откройте код страницы
В браузере: правый клик по странице и пункт «Просмотр кода страницы». Это то, что сервер отдаёт до выполнения скриптов.
- Найдите фразу из текста
Поиском по коду найдите пару предложений из основного текста. Нашлись — робот их видит.
- Не нашлись — задача разработчику
Нужен серверный рендеринг или пререндер: сервер сразу отдаёт готовый HTML с текстом.
Пререндер и граница клоакинга
Пререндер — когда роботу отдаётся заранее собранный HTML той же страницы. Это нормальная техника, пока робот и человек получают одинаковое содержание.
- Можно: отдать роботу готовый HTML, который браузер показывает после выполнения скриптов.
- Нельзя: другой текст, дополнительные ключевые слова или скрытые блоки только для роботов.
- Опасно: устаревшая копия из кэша с прошлыми ценами и наличием. Намерения обмануть нет, но для поисковой системы это выглядит так же.
Поисковые системы наказывают сайты за разное содержание для роботов и людей. А поисковый индекс — один из главных источников, откуда нейросети берут страницы для ответов.
Файл llms.txt
llms.txt — текстовое досье сайта для ИИ: кто вы, что на сайте главное, где ключевые страницы. Это черновик соглашения, и крупные разработчики моделей не подтверждали, что используют его.
Сделать файл недорого, но это гигиена, а не рычаг: он не заменяет ни один пункт из проверки выше.
Что проверяет платформа
Блок «Доступность сайта для краулеров ИИ» в разделе «Источники» проверяет сайт проекта: правила robots.txt для каждого робота, наличие llms.txt и карты сайта, что получает робот на живых страницах по сравнению с браузером и остаётся ли текст без скриптов. Рядом — заголовок, H1 и микроразметка страниц. Доступность блока зависит от тарифа.