← ко всем постам

68,9% против 2,1%: как закрепиться в весах LLM

68,9% против 2,1%: как закрепиться в весах LLM

ChatGPT решает, кого процитировать, ещё до того, как открывает браузер. Независимые исследования сетевого трафика модели показывают: бренды, которых модель называет сама, в своём собственном первом поисковом запросе, цитируются в 68,9% случаев. Бренды, найденные только через последующий поиск — в 2,1%. Разница в 33 раза решается не в момент поиска, а раньше — в весах модели. Вот что с этим делать.

О том, что ChatGPT физически не видит цены за JavaScript и вместо этого цитирует G2, я уже писал в разборе «ChatGPT уже был на вашем сайте. И ушёл цитировать конкурента». Тот текст — про доступность контента в момент, когда модель уже ищет. Этот — про то, что происходит раньше: как бренд вообще попадает в поле зрения модели, до того как она откроет хоть одну вкладку.

Два этапа: сначала шорт-лист, потом фильтр

Два следующих исследования того же автора, Suganthan Mohanadasan, включая отдельную работу о том, что ChatGPT решает до поиска, вскрывают механизм в деталях. Он двухступенчатый.

Сначала модель формирует конкурентный шорт-лист — прямо в первом поисковом запросе, ещё не открыв ни одной страницы. В 21 из 27 протестированных диалогов первый запрос ChatGPT уже содержал названия продуктов, которые пользователь не упоминал. Спросите «лучшее приложение для заметок с ИИ» — и в JSON-трафике окажется запрос вида «Granola Notion AI Otter Fireflies Fathom Mem Limitless», собранный моделью самостоятельно, из того, что она уже «знает» о категории.

Дальше — жёсткий позиционный фильтр. Даже из предвыбранных источников цитируются немногие: 1-я позиция в выдаче даёт 5,2% шанс на цитирование, 2-я — 4,6%, 6-я и ниже — 0,3%. Из 3554 страниц, которые модель реально загрузила в одном из замеров, в финальный ответ попали только 110 — 3,1%.

Отсюда и три шага ниже. Первые два работают на попадание в шорт-лист — то, что решается ещё до поиска. Третий — на то, чтобы пройти фильтр, когда модель всё-таки проверяет вас вживую.

Шаг 1. Плотная семантическая привязка сущности

Контекстное соседство. Шорт-лист ChatGPT — не случайность, а слепок того, что модель видела в обучающих текстах рядом друг с другом. Если бренд регулярно упоминается в одном предложении или абзаце с конкурентами и категорией — на Reddit, GitHub, Hacker News, в Викиданных, в отраслевых медиа — модель выучивает эту связь и подтягивает бренд в шорт-лист по умолчанию, ещё не заглядывая в интернет.

Единый синтаксис позиционирования. Сформулируйте сущность одной фразой: «[Бренд] — это [категория] для [аудитория]» — и используйте её без вариаций везде, от пресс-релизов до профиля фаундера в LinkedIn. Разнобой в формулировках размывает co-occurrence; повторение одной и той же связки его укрепляет.

Шаг 2. Доминирование на первичных датасетах обучения

LLM обучаются не на всём вебе подряд, а на отфильтрованных, качественных срезах — Common Crawl, C4, корпуса технической документации. Присутствие именно там решает больше, чем позиция в Google.

Шаг 3. Инфраструктура сайта для «Site-Probe»

Даже если модель занесла бренд в шорт-лист, финальную проверку она всё равно делает вживую — тем самым запросом вида site:yourbrand.com pricing features 2026. Сайт должен пройти этот пробник, иначе цитирование не случится, сколько бы co-occurrence вы ни накопили.

Последний пункт — единственный, который можно проверить не через полгода работы над контентом, а прямо сейчас. Я собрал бесплатный инструмент, который делает ровно это: читает ваш robots.txt и одновременно шлёт живой запрос под каждым из основных ИИ-краулеров — GPTBot, ChatGPT-User, ClaudeBot, PerplexityBot, Bingbot — и показывает, кого из них сайт реально пускает, а кого блокирует, даже если robots.txt формально разрешает доступ.

Проверить доступность сайта для ИИ-ботов →

Что делать сегодня

Все три шага решают одну задачу — не подняться в выдаче, а закрепиться в весах модели ещё до того, как пользователь задал вопрос. Ранжирование в классическом поиске — это соревнование за клик здесь и сейчас. Место в шорт-листе LLM — это то, что решает исход соревнования ещё до его начала.

С чего начать сегодня: прогнать сайт через проверку доступности для ИИ-ботов — это займёт секунды и либо подтвердит, что технического барьера нет, либо укажет на конкретный блок, который стоит устранить в первую очередь. Дальше — Шаг 1 и Шаг 2, которые не решаются за секунды, но и не требуют бюджета крупного бренда: последовательное, повторяющееся упоминание в правильном контексте почти всегда доступнее, чем кажется.

Maxim Safianov
Maxim Safianov

Я работаю на стыке технического SEO и разработки: помогаю сайтам оставаться видимыми и для классического поиска, и для AI-ответов — и пишу инструменты на Python, которые это автоматизируют.

Сколько времени нужно, чтобы попасть в шорт-лист ChatGPT?
По-разному для разных шагов. Шаг 3 (доступность сайта для краулеров) можно исправить за день — и это отразится на первой же живой проверке модели. Шаги 1 и 2 (co-occurrence и присутствие в датасетах) быстрее не станут: они зависят от того, когда ваш новый контент будет прокраулен и попадёт в следующий цикл обучения модели — это месяцы, а не недели, и никаким бюджетом это не ускорить.
Значит ли это, что классическое SEO и обратные ссылки больше не важны?
Нет. Классическое ранжирование по-прежнему решает, кто получает клики из самого Google-поиска — по объёму это всё ещё главный канал. Три шага из статьи — не замена, а отдельный трек для другого канала: цитирования в ChatGPT живут по своим правилам (присутствие в обучающих данных), не по правилам ссылочного авторитета.
Есть ли шанс у небольшого бренда, или это работает только для известных компаний?
Шанс есть, и часто выше, чем кажется. Механизм вознаграждает не размер бренда, а чёткость и узость категории: небольшой продукт, который громче и последовательнее всех говорит о себе в узкой нише, может доминировать в co-occurrence именно этой ниши. Сложнее в широких, переполненных категориях с давно закрепившимися игроками — там масштаб уже сыграл свою роль в обучающих данных.
Насколько надёжны цифры 68,9% и 2,1% — можно ли на них опираться?
Это данные одного исследователя с одного аккаунта за ограниченный период — выборка небольшая и не претендует на универсальность. Опираться стоит не на точное значение процента, а на сам механизм, который она вскрывает: попадание в шорт-лист модели решает цитирование сильнее, чем всё, что происходит после начала поиска. Это направление, а не коэффициент для точного прогноза.

Комментариев пока нет — будьте первым.