Что такое «источник» в ответах ChatGPT
Когда ChatGPT отвечает на вопрос, рядом с текстом часто появляется блок ссылок, которые выглядят как список использованных материалов. Однако за этим блоком стоит не просто перечень URL, а сложная система привязки цитат к конкретным фрагментам сгенерированного ответа. В отличие от простого поискового движка, который выдаёт список страниц по релевантности, ChatGPT формирует ответ как связный текст, а источники добавляет как вспомогательные аннотации.
В сетевом обмене веб-клиента ChatGPT источники передаются в массиве annotations[], где каждый объект содержит поля url, title, start_ix и end_ix. Последние два поля — это смещения в тексте ответа, которые указывают, к какому именно фрагменту привязан источник. Это принципиальное отличие: цитата не относится ко всему ответу целиком, а только к конкретному предложению или абзацу. Например, если модель пишет «Согласно исследованию Принстона, GEO — это...», то ссылка на arXiv будет привязана именно к этому предложению, а не к соседним.
Такая механика означает, что для попадания в источники ChatGPT недостаточно просто иметь авторитетный сайт — нужно, чтобы модель использовала ваш контент при генерации конкретного фрагмента. Это сближает работу ChatGPT с академическим цитированием, где каждая ссылка должна подтверждать конкретное утверждение.
Техническая механика: как клиент обменивается данными с сервером
Чтобы понять, как формируются источники, полезно разобрать сетевой обмен веб-клиента ChatGPT. Когда вы отправляете сообщение, браузер делает POST-запрос с JSON-данными на адрес вида /conversation, а ответ приходит потоком через Server-Sent Events (SSE). Это технология, при которой сервер отправляет данные порциями, а клиент обрабатывает их по мере поступления.
Перед основным запросом клиент выполняет подготовительный шаг: получает специальный токен (в исследовательских материалах его называют conduit_token), который привязан к сессии. Этот токен — своего рода доказательство работы, без которого основной запрос не будет принят. В некоторых случаях дополнительно требуется токен Cloudflare Turnstile, что делает защиту от ботов двухуровневой.
Ответ в формате SSE состоит из нескольких типов сообщений: служебные, фрагменты текста и закрывающее сообщение. Источники приходят в составе аннотаций, которые могут быть привязаны к уже сгенерированным фрагментам. Интересно, что смещения start_ix и end_ix почти наверняка используют кодовые единицы UTF-16, как в JavaScript. Это важно для разработчиков, которые хотят программно извлекать цитаты: если считать смещения в байтах или кодовых точках, цитаты «съедут» для текстов с эмодзи или китайскими иероглифами.
Как ChatGPT выбирает источники: результаты эксперимента
Исследователи из RankCaster AI провели эксперимент: они задали четырём англоязычным B2B-запросам один и тот же набор вопросов в ChatGPT, Gemini и DeepSeek, повторив каждый запрос по 10 раз. Цель была — понять, какие источники реально цитируют нейросети и совпадают ли они с топом поисковых систем.
Результаты оказались показательными. Для ChatGPT пересечение с SEO-топом Google и Bing составило ноль процентов: ни один URL из топ-10 поисковиков не попал в источники нейросети. При этом на концептуальном запросе «What is GEO?» ChatGPT во всех 10 прогонах цитировал научную статью arXiv 2311.09735, где впервые был введён термин GEO. Это говорит о том, что модель отдаёт предпочтение академическим и энциклопедическим источникам, а не маркетинговым блогам, даже если последние хорошо ранжируются в поиске.
Стабильность цитирования измерялась через APR (Answer Presence Rate) — процент прогонов, в которых источник появился в ответе. Для научной статьи APR составил 100%, что делает её самым надёжным источником в выборке. В целом ChatGPT предпочитает Wikipedia, научные публикации и узкоспециализированные блоги, игнорируя коммерческие страницы, которые обычно занимают верхние позиции в Google.
Сравнение с Gemini и DeepSeek: разные модели цитирования
Каждая нейросеть реализует цитирование по-своему, и это влияет на то, какие источники попадают в ответы. Gemini от Google использует внутренний JavaScript-каркас Wiz и отправляет данные через batchexecute в формате JSPB/PBLite, где поля сообщений Protobuf определяются позициями в массиве, а не именами. Источники в Gemini сопровождаются набором скрытых полей, которые, по предположениям исследователей, включают оценку надёжности домена (rs), дату последнего обращения (ls) и сам процитированный фрагмент (y6).
Gemini систематически поднимает крупные маркетинговые и SaaS-домены (Semrush, HubSpot, Zapier), а также продукты своей же категории. Любопытно, что в его источниках не оказалось ни одного ресурса самого Google. При этом именно Gemini показал точечные совпадения с SEO-топом Bing, но не с Google.
DeepSeek устроен прозрачнее: он возвращает массив search_results[], привязанный к под-запросам, на которые разбивает исходный вопрос. Его любимые источники — новостные ресурсы и пресс-релизы (TMCnet, GlobeNewswire), а также китайские сайты. Из трёх систем DeepSeek единственный стабильно цитировал документацию и инструментальные сайты, которые не встречаются ни в SEO-топах, ни у других нейросетей.
Почему SEO-оптимизация не гарантирует попадание в источники ChatGPT
Многие маркетологи предполагают, что если сайт занимает высокие позиции в Google или Bing, то нейросеть автоматически будет его цитировать. Эксперимент показал, что это не так: пересечение URL между SEO-топом и источниками ChatGPT составило всего 3,3% (4 совпадения из 120 позиций), причём все совпадения пришлись на Bing, а на стороне Google — ноль.
Причина в том, что ChatGPT не использует традиционную поисковую выдачу как основу для цитирования. Вместо этого модель генерирует ответ на основе своих внутренних знаний, а затем, если включён веб-поиск, подтягивает источники, которые подтверждают конкретные утверждения. Это означает, что даже идеально оптимизированная страница может не попасть в ответ, если модель не сочтёт её контент релевантным для конкретного фрагмента.
Для практиков это важный вывод: стратегия «оптимизируй под Google — и нейросеть подтянется» не работает. Нужно думать о том, как сделать контент привлекательным для самой модели: использовать чёткие формулировки, факты, которые можно процитировать, и структурировать информацию так, чтобы она была полезна для генерации ответа.
Практические советы: как повысить шансы попасть в источники ChatGPT
Хотя точные алгоритмы выбора источников в ChatGPT не раскрываются, эксперименты дают несколько практических рекомендаций.
Во-первых, сосредоточьтесь на создании контента, который модель захочет использовать в конкретном фрагменте ответа. Это значит, что ваши статьи должны содержать чёткие определения, статистику, цитаты экспертов и уникальные данные, которые можно вставить в ответ. Например, если вы пишете о термине, дайте его точное определение и укажите источник — это повышает шанс, что ChatGPT процитирует именно вашу страницу.
Во-вторых, учитывайте, что ChatGPT предпочитает академические и энциклопедические источники. Публикация в научном журнале или на платформе типа Wikipedia может быть более эффективной, чем десятки SEO-статей. Однако это не значит, что блоги бесполезны: в эксперименте ChatGPT цитировал и нишевые блоги, если они содержали уникальную информацию.
В-третьих, следите за стабильностью: источники с высоким APR (например, 100%) — это те, которые модель использует постоянно. Чтобы добиться такого эффекта, ваш контент должен быть не только релевантным, но и надёжным с точки зрения модели. Это достигается за счёт ссылок на авторитетные домены, отсутствия ошибок и чёткой структуры.
Ограничения и оговорки: почему результаты могут отличаться
Важно понимать, что эксперимент, описанный выше, имеет ограничения. Во-первых, все четыре запроса были из одной продуктовой категории (мониторинг упоминаний в нейросетях), что создаёт смещение выборки. Во-вторых, формулировки запросов составляли сами исследователи, а не брали из внешнего реестра, что могло повлиять на результаты.
В-третьих, N=10 прогонов даёт доверительный интервал порядка ±15–20 процентных пунктов для каждой точки, поэтому точечные значения APR следует интерпретировать осторожно. В-четвёртых, замеры проводились в один день, а веб-клиенты всех трёх систем постоянно обновляются, так что конкретные имена полей и адресов — это снимок, а не канон.
Кроме того, сами исследователи отмечают, что ни одна из систем не публикует внутренние схемы ответов, поэтому все расшифровки полей — это гипотезы, основанные на наблюдениях за сетевым обменом. Например, поле rs в Gemini может означать как reliability_score, так и ranking_signal или retrieval_score. Тем не менее качественные выводы (например, о привязке цитат к фрагментам) не зависят от точности расшифровок.
Будущее цитирования в нейросетях: что это значит для контент-маркетинга
Различия в подходах к цитированию между ChatGPT, Gemini и DeepSeek показывают, что единого стандарта для «источников» в ответах нейросетей пока нет. Каждая система использует свои механизмы, и это создаёт вызовы для специалистов по контенту и SEO.
Для ChatGPT ключевым фактором является привязка цитаты к фрагменту текста, что делает «общую известность бренда» бесполезной. Вместо этого нужно, чтобы модель использовала ваш контент при генерации конкретного утверждения. Это требует глубокого понимания того, как модель строит ответы, и создания материалов, которые легко встраиваются в такие ответы.
Для Gemini, судя по всему, важна внутренняя оценка доменов: если гипотеза о reliability_score верна, то домен с историей доверия будет цитироваться чаще, чем отдельная удачная статья. Это означает, что долгосрочная репутация домена важнее разовых публикаций.
Для DeepSeek канал распространения — пресс-релизы и новостные сетки — играет решающую роль. Это контрастирует с традиционным SEO, где такие каналы часто считаются мусорными. Если ваша целевая аудитория использует DeepSeek, стоит рассмотреть публикацию пресс-релизов.
В целом, по мере развития нейросетей и увеличения их роли в поиске информации, понимание механизмов цитирования станет важным конкурентным преимуществом. Пока же рекомендуется следить за обновлениями и адаптировать стратегии под каждую платформу отдельно.
Как проверить, какие источники цитирует ChatGPT для вашего запроса
Если вы хотите узнать, какие источники ChatGPT использует для конкретного запроса, можно провести собственный эксперимент. Для этого нужно открыть веб-версию ChatGPT (или мобильное приложение), включить веб-поиск и задать интересующий вопрос. В ответе обратите внимание на блок источников — он обычно отображается в виде ссылок под текстом.
Для более глубокого анализа можно использовать инструменты разработчика в браузере. Откройте вкладку «Сеть» (Network), отправьте запрос и изучите ответы SSE. В них вы найдёте JSON с массивом annotations[], где будут поля url, title, start_ix и end_ix. Эти данные позволят точно определить, к каким фрагментам привязаны источники.
Однако помните, что результаты могут меняться со временем, так как модель и её алгоритмы постоянно обновляются. Рекомендуется проводить замеры регулярно и использовать несколько запросов для получения более надёжной картины. Также полезно сравнивать результаты с другими нейросетями, чтобы понять, какие источники являются универсальными, а какие — специфичными для каждой системы.
Вопросы и ответы
Почему ChatGPT не цитирует сайты из топа Google?
ChatGPT не использует поисковую выдачу Google как основу для цитирования. Вместо этого модель генерирует ответ на основе своих внутренних знаний, а затем подтягивает источники, которые подтверждают конкретные утверждения. Эксперименты показали, что пересечение URL между SEO-топом и источниками ChatGPT составляет всего 3,3%, причём все совпадения пришлись на Bing, а на стороне Google — ноль. Это связано с тем, что модель отдаёт предпочтение академическим, энциклопедическим и нишевым источникам, а не коммерческим страницам, которые обычно ранжируются в поиске.
Как ChatGPT привязывает источники к тексту ответа?
В сетевом обмене ChatGPT источники передаются в массиве annotations[], где каждый объект содержит поля start_ix и end_ix — смещения в сгенерированном тексте. Эти смещения указывают на конкретный фрагмент ответа, к которому привязан источник. Например, если модель пишет «Согласно исследованию...», ссылка будет привязана именно к этому предложению. Смещения используют кодовые единицы UTF-16, что важно учитывать при программном извлечении цитат, особенно для текстов с эмодзи или не-латинскими символами.
Какие типы источников ChatGPT предпочитает?
В ходе эксперимента ChatGPT стабильно цитировал научные статьи (например, arXiv), Wikipedia и узкоспециализированные блоги. На концептуальном запросе «What is GEO?» научная статья была процитирована во всех 10 прогонах (APR 100%). При этом маркетинговые блоги и коммерческие страницы, которые хорошо ранжируются в поиске, почти не попадали в источники. Это говорит о том, что модель отдаёт предпочтение авторитетным и информативным материалам, а не SEO-оптимизированному контенту.
Чем отличается цитирование в ChatGPT от Gemini и DeepSeek?
ChatGPT привязывает цитаты к конкретным фрагментам текста через смещения start_ix/end_ix. Gemini использует скрытые поля с оценками надёжности доменов и предпочитает крупные SaaS- и маркетинговые домены. DeepSeek возвращает массив search_results[], привязанный к под-запросам, и чаще цитирует новостные ресурсы и пресс-релизы. Эти различия означают, что стратегия продвижения должна быть разной для каждой платформы.
Можно ли повлиять на то, чтобы ChatGPT процитировал мой сайт?
Да, хотя точные алгоритмы не раскрываются. Рекомендуется создавать контент, который модель захочет использовать в конкретном фрагменте ответа: чёткие определения, уникальные данные, цитаты экспертов. Также полезно публиковаться на авторитетных платформах (например, Wikipedia или научные журналы). Важно понимать, что «общая известность бренда» не работает — нужна релевантность для конкретного утверждения. Регулярно проверяйте, какие источники цитируются для ваших целевых запросов, и адаптируйте стратегию.
Какие ограничения у эксперимента по анализу источников?
Эксперимент использовал только четыре запроса из одной продуктовой категории, что создаёт смещение выборки. N=10 прогонов даёт доверительный интервал ±15–20 процентных пунктов. Замеры проводились в один день, а веб-клиенты постоянно обновляются, поэтому результаты могут устареть. Кроме того, внутренние схемы ответов не публикуются, и расшифровки полей — это гипотезы. Тем не менее качественные выводы о различиях в подходах к цитированию остаются валидными.