AEO и GEO под капотом: как ИИ вообще читает ваш сайт

Это пятая часть. В прошлой мы возились со Schema.org – учили машину понимать страницу. Теперь полезем ещё глубже: посмотрим, как именно ИИ добирается до вашего контента, и почему сайт, который отлично открывается в браузере, для нейросети может оказаться невидимым.

Потому что «поисковик» и «нейросеть с доступом в интернет» – это разные звери. И ходят они по сайту по-разному.

Кто вообще приходит на сайт ради ИИ

Кроме привычного Googlebot и Яндекса, на сайт теперь ломится целый зоопарк ИИ-ботов. Вот основные:

  • GPTBot – от OpenAI, ходит по сайтам для обучения моделей.
  • OAI-SearchBot – тоже OpenAI, но для поиска в ChatGPT (именно он тянет источники в ответы).
  • ClaudeBot и anthropic-ai – от Anthropic (Claude).
  • PerplexityBot – от Perplexity, кстати, один из самых «цитирующих».
  • Google-Extended – отдельный токен для того, чтобы разрешить или запретить Google использовать контент для обучения и AI Overviews.
  • CCBot – Common Crawl, из него потом учатся многие модели.
  • Bytespider – от ByteDance.

И вот тут есть подвох. Многие владельцы сайтов радостно закрывают этих ботов в robots.txt – мол, «пусть не жрут мой контент для своих нейросетей». А потом удивляются, почему их нет в ответах ChatGPT и Perplexity. Логика простая: не пустили краулер – не попали в индекс – не попали в ответ. Это, конечно, ваш выбор, но выбор с последствиями.

robots.txt: что разрешать, а что нет

По умолчанию, если вы ничего не писали, – боты ходят свободно. Чтобы явно разрешить GPTBot и Perplexity, достаточно ничего им не запрещать. Но многие любят перебдеть и ставят звёздочку где не надо.

Пример разумного robots.txt, где мы явно разрешаем основных ИИ-ботов:

User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: *
Disallow: /wp-admin/

Главное – не закрыть случайно всё через User-agent: * с Disallow: /. Я видел такое: человек хотел запретить индексацию папки, а запретил весь сайт. И долго не мог понять, куда делся трафик.

Как работает RAG, или почему важны «кусочки»

Когда вы спрашиваете ChatGPT с поиском или Perplexity, происходит примерно следующее. Ваш запрос превращается в вектор, по этому вектору в индексе ищутся самые подходящие куски страниц, потом эти куски подсовываются модели, и модель генерирует ответ, расставляя ссылки на источники. Это и есть RAG – retrieval-augmented generation, генерация с подгрузкой.

Из этого следует важное: модель работает не с целой страницей, а с кусками. Поэтому самодостаточные, чёткие фрагменты цитируются лучше. Тот самый «прямой ответ в начале», про который мы говорили во второй части, – это ровно про то, чтобы нужный кусок легко вырезался.

JavaScript: тот случай, когда красота вредит

Браузер исполняет JavaScript, достраивает страницу – и вы видите весь контент. Проблема в том, что большинство ИИ-краулеров JavaScript не исполняют или исполняют плохо. Если ваш текст или ваши цены подгружаются скриптом после загрузки, для нейросети их может просто не существовать.

Поэтому правило простое: важный контент должен быть в серверном HTML, а не рождаться скриптом на лету. Про современную верстку я уже писал отдельно – там та же идея: делать так, чтобы страница работала сама по себе, без лишних костылей.

Техническая гигиена, без которой ничего не взлетит

Всё, что помогает обычному поиску, помогает и ИИ. Коротко:

  • сервер отдаёт реальные 200 на живых страницах и честные 404 на мёртвых;
  • есть sitemap.xml, и он не врёт;
  • каноникалы расставлены правильно, дублей нет;
  • страница открывается быстро – медленный сайт краулер просто бросит, про метрики скорости я тоже писал;
  • нет случайного noindex на важных страницах.

Это та самая скучная гигиена, про которую я писал в материале про HTTPS и бэкапы. Скучна она ровно до момента, пока не выясняется, что половина страниц не доиндексировалась.

llms.txt: модно, но не обязательно

Отдельно скажу про llms.txt – это такой экспериментальный файл в корне сайта, где человек коротко описывает проект для моделей, чуть-чуть как robots.txt, только текстовый. Звучит заманчиво, но это пока не стандарт, поддерживается далеко не всеми, и магии сам по себе не делает. Если хочется – положите, вреда не будет. Но рассчитывать на него как на «теперь меня точно будут цитировать» не стоит.

Итого

Чтобы нейросеть вас цитировала, она должна вас сначала прочитать. А для этого её надо пустить на сайт, отдать контент серверным HTML, разложить его на понятные куски и не сломать базовую гигиену. Никакой магии – просто внимательность к тому, как машина ходит по вашим страницам.

В следующей, шестой части разберёмся, как модели понимают смысл текста, и наконец-то ответим на популярный вопрос: при чём тут LSI и нужны ли вообще «LSI-ключи».