Это пятая часть. В прошлой мы возились со Schema.org – учили машину понимать страницу. Теперь полезем ещё глубже: посмотрим, как именно ИИ добирается до вашего контента, и почему сайт, который отлично открывается в браузере, для нейросети может оказаться невидимым.
Потому что «поисковик» и «нейросеть с доступом в интернет» – это разные звери. И ходят они по сайту по-разному.
Кто вообще приходит на сайт ради ИИ
Кроме привычного Googlebot и Яндекса, на сайт теперь ломится целый зоопарк ИИ-ботов. Вот основные:
- GPTBot – от OpenAI, ходит по сайтам для обучения моделей.
- OAI-SearchBot – тоже OpenAI, но для поиска в ChatGPT (именно он тянет источники в ответы).
- ClaudeBot и anthropic-ai – от Anthropic (Claude).
- PerplexityBot – от Perplexity, кстати, один из самых «цитирующих».
- Google-Extended – отдельный токен для того, чтобы разрешить или запретить Google использовать контент для обучения и AI Overviews.
- CCBot – Common Crawl, из него потом учатся многие модели.
- Bytespider – от ByteDance.
И вот тут есть подвох. Многие владельцы сайтов радостно закрывают этих ботов в robots.txt – мол, «пусть не жрут мой контент для своих нейросетей». А потом удивляются, почему их нет в ответах ChatGPT и Perplexity. Логика простая: не пустили краулер – не попали в индекс – не попали в ответ. Это, конечно, ваш выбор, но выбор с последствиями.
robots.txt: что разрешать, а что нет
По умолчанию, если вы ничего не писали, – боты ходят свободно. Чтобы явно разрешить GPTBot и Perplexity, достаточно ничего им не запрещать. Но многие любят перебдеть и ставят звёздочку где не надо.
Пример разумного robots.txt, где мы явно разрешаем основных ИИ-ботов:
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: *
Disallow: /wp-admin/
Главное – не закрыть случайно всё через User-agent: * с Disallow: /. Я видел такое: человек хотел запретить индексацию папки, а запретил весь сайт. И долго не мог понять, куда делся трафик.
Как работает RAG, или почему важны «кусочки»
Когда вы спрашиваете ChatGPT с поиском или Perplexity, происходит примерно следующее. Ваш запрос превращается в вектор, по этому вектору в индексе ищутся самые подходящие куски страниц, потом эти куски подсовываются модели, и модель генерирует ответ, расставляя ссылки на источники. Это и есть RAG – retrieval-augmented generation, генерация с подгрузкой.
Из этого следует важное: модель работает не с целой страницей, а с кусками. Поэтому самодостаточные, чёткие фрагменты цитируются лучше. Тот самый «прямой ответ в начале», про который мы говорили во второй части, – это ровно про то, чтобы нужный кусок легко вырезался.
JavaScript: тот случай, когда красота вредит
Браузер исполняет JavaScript, достраивает страницу – и вы видите весь контент. Проблема в том, что большинство ИИ-краулеров JavaScript не исполняют или исполняют плохо. Если ваш текст или ваши цены подгружаются скриптом после загрузки, для нейросети их может просто не существовать.
Поэтому правило простое: важный контент должен быть в серверном HTML, а не рождаться скриптом на лету. Про современную верстку я уже писал отдельно – там та же идея: делать так, чтобы страница работала сама по себе, без лишних костылей.
Техническая гигиена, без которой ничего не взлетит
Всё, что помогает обычному поиску, помогает и ИИ. Коротко:
- сервер отдаёт реальные 200 на живых страницах и честные 404 на мёртвых;
- есть sitemap.xml, и он не врёт;
- каноникалы расставлены правильно, дублей нет;
- страница открывается быстро – медленный сайт краулер просто бросит, про метрики скорости я тоже писал;
- нет случайного
noindexна важных страницах.
Это та самая скучная гигиена, про которую я писал в материале про HTTPS и бэкапы. Скучна она ровно до момента, пока не выясняется, что половина страниц не доиндексировалась.
llms.txt: модно, но не обязательно
Отдельно скажу про llms.txt – это такой экспериментальный файл в корне сайта, где человек коротко описывает проект для моделей, чуть-чуть как robots.txt, только текстовый. Звучит заманчиво, но это пока не стандарт, поддерживается далеко не всеми, и магии сам по себе не делает. Если хочется – положите, вреда не будет. Но рассчитывать на него как на «теперь меня точно будут цитировать» не стоит.
Итого
Чтобы нейросеть вас цитировала, она должна вас сначала прочитать. А для этого её надо пустить на сайт, отдать контент серверным HTML, разложить его на понятные куски и не сломать базовую гигиену. Никакой магии – просто внимательность к тому, как машина ходит по вашим страницам.
В следующей, шестой части разберёмся, как модели понимают смысл текста, и наконец-то ответим на популярный вопрос: при чём тут LSI и нужны ли вообще «LSI-ключи».