ChatGPT решает, кого процитировать, ещё до того, как открывает браузер. Независимые исследования сетевого трафика модели показывают: бренды, которых модель называет сама, в своём собственном первом поисковом запросе, цитируются в 68,9% случаев. Бренды, найденные только через последующий поиск — в 2,1%. Разница в 33 раза решается не в момент поиска, а раньше — в весах модели. Вот что с этим делать.
О том, что ChatGPT физически не видит цены за JavaScript и вместо этого цитирует G2, я уже писал в разборе «ChatGPT уже был на вашем сайте. И ушёл цитировать конкурента». Тот текст — про доступность контента в момент, когда модель уже ищет. Этот — про то, что происходит раньше: как бренд вообще попадает в поле зрения модели, до того как она откроет хоть одну вкладку.
Два этапа: сначала шорт-лист, потом фильтр
Два следующих исследования того же автора, Suganthan Mohanadasan, включая отдельную работу о том, что ChatGPT решает до поиска, вскрывают механизм в деталях. Он двухступенчатый.
Сначала модель формирует конкурентный шорт-лист — прямо в первом поисковом запросе, ещё не открыв ни одной страницы. В 21 из 27 протестированных диалогов первый запрос ChatGPT уже содержал названия продуктов, которые пользователь не упоминал. Спросите «лучшее приложение для заметок с ИИ» — и в JSON-трафике окажется запрос вида «Granola Notion AI Otter Fireflies Fathom Mem Limitless», собранный моделью самостоятельно, из того, что она уже «знает» о категории.
Дальше — жёсткий позиционный фильтр. Даже из предвыбранных источников цитируются немногие: 1-я позиция в выдаче даёт 5,2% шанс на цитирование, 2-я — 4,6%, 6-я и ниже — 0,3%. Из 3554 страниц, которые модель реально загрузила в одном из замеров, в финальный ответ попали только 110 — 3,1%.
Отсюда и три шага ниже. Первые два работают на попадание в шорт-лист — то, что решается ещё до поиска. Третий — на то, чтобы пройти фильтр, когда модель всё-таки проверяет вас вживую.
Шаг 1. Плотная семантическая привязка сущности
Контекстное соседство. Шорт-лист ChatGPT — не случайность, а слепок того, что модель видела в обучающих текстах рядом друг с другом. Если бренд регулярно упоминается в одном предложении или абзаце с конкурентами и категорией — на Reddit, GitHub, Hacker News, в Викиданных, в отраслевых медиа — модель выучивает эту связь и подтягивает бренд в шорт-лист по умолчанию, ещё не заглядывая в интернет.
Единый синтаксис позиционирования. Сформулируйте сущность одной фразой: «[Бренд] — это [категория] для [аудитория]» — и используйте её без вариаций везде, от пресс-релизов до профиля фаундера в LinkedIn. Разнобой в формулировках размывает co-occurrence; повторение одной и той же связки его укрепляет.
Шаг 2. Доминирование на первичных датасетах обучения
LLM обучаются не на всём вебе подряд, а на отфильтрованных, качественных срезах — Common Crawl, C4, корпуса технической документации. Присутствие именно там решает больше, чем позиция в Google.
- Агрегаторы и листинги. Полный, актуальный профиль на G2, Capterra, Product Hunt, Trustpilot, Crunchbase — это не просто лиды, это тексты, которые с высокой вероятностью попадают в обучающие датасеты именно в связке с названием категории.
- Open source и tech-экосистема. Репозитории на GitHub, документация, интеграции с популярными API и фреймворками — код и техтексты — один из самых чистых и часто используемых корпусов при обучении.
- Мультимодальные следы. Транскрипты YouTube-обзоров, подкасты на Spotify и Apple Podcasts. Модели всё активнее обучаются на текстовых расшифровках аудио и видео — обзор, который никто не «зацитирует» напрямую, всё равно оставляет текстовый след в датасете.
Шаг 3. Инфраструктура сайта для «Site-Probe»
Даже если модель занесла бренд в шорт-лист, финальную проверку она всё равно делает вживую — тем самым запросом вида site:yourbrand.com pricing features 2026. Сайт должен пройти этот пробник, иначе цитирование не случится, сколько бы co-occurrence вы ни накопили.
- Прозрачная структура URL. Чёткие, предсказуемые адреса: /pricing, /features, /integrations, /vs-competitor.
- Машиночитаемый формат. Цены и тарифы — обычным HTML-текстом или таблицей, а не за формой лидогенерации или динамическим скриптом. Тот же вывод, что и в первой части этого разбора: JS-загруженные цены модель просто не видит.
- llms.txt и разметка Schema.org. Краткий machine-readable файл со структурой продукта плюс SoftwareApplication, Product, Offer — прямая подсказка модели вместо догадок.
- Открытость для краулеров. Ни один из шагов выше не сработает, если GPTBot, PerplexityBot, ClaudeBot или Bingbot физически не может достучаться до страницы — из-за правила в robots.txt или JS-челленджа Cloudflare.
Последний пункт — единственный, который можно проверить не через полгода работы над контентом, а прямо сейчас. Я собрал бесплатный инструмент, который делает ровно это: читает ваш robots.txt и одновременно шлёт живой запрос под каждым из основных ИИ-краулеров — GPTBot, ChatGPT-User, ClaudeBot, PerplexityBot, Bingbot — и показывает, кого из них сайт реально пускает, а кого блокирует, даже если robots.txt формально разрешает доступ.
Проверить доступность сайта для ИИ-ботов →
Что делать сегодня
Все три шага решают одну задачу — не подняться в выдаче, а закрепиться в весах модели ещё до того, как пользователь задал вопрос. Ранжирование в классическом поиске — это соревнование за клик здесь и сейчас. Место в шорт-листе LLM — это то, что решает исход соревнования ещё до его начала.
С чего начать сегодня: прогнать сайт через проверку доступности для ИИ-ботов — это займёт секунды и либо подтвердит, что технического барьера нет, либо укажет на конкретный блок, который стоит устранить в первую очередь. Дальше — Шаг 1 и Шаг 2, которые не решаются за секунды, но и не требуют бюджета крупного бренда: последовательное, повторяющееся упоминание в правильном контексте почти всегда доступнее, чем кажется.
Maxim Safianov
0 комментариев
Комментариев пока нет — будьте первым.
Войдите, чтобы комментарий опубликовался сразу:
…или оставьте комментарий как гость — гостевые комментарии появляются после модерации.