Двум моделям с доступом к веб-поиску задали вопрос о лучших продуктах в 380 категориях софта и сохранили все URL, которые они использовали в качестве источников. Из 7 534 полученных цитирований 59,8% указывают на домены, занимающие место хуже 100 000-го в списке Tranco top-1M, а 23,4% — на домены, вообще не входящие в топ-миллион. Два из сайтов, обеспечивающих эту «подложку» (grounding — этап поиска и извлечения документов, который выполняют модели), назвали свои главные страницы в HTML-заголовке «Facts & Grounding Page». Эти два сайта вместе с третьим, судя по всему, связанным с ними доменом опубликовали в сумме 215 128 машинно-сгенерированных страниц вида best <category>. Ни один из трёх доменов не существовал до декабря 2023 года.

Что было сделано

2 сентября 2026 года 380 категорий с явным покупательским намерением — от «CRM software» до «museum collection management software» — были отправлены в perplexity/sonar и perplexity/sonar-pro через OpenRouter: по одному запросу на категорию для каждой модели, всего 760 вызовов. В каждом запросе просили выдать топ-5 в формате JSON с указанием официального домена главной страницы продукта. Все 760 запросов вернули корректный ответ, а обе модели раскрывают URL, которые использовали при поиске — именно поэтому выбор пал на них. Список категорий составили до получения каких-либо результатов и не пересматривали.

В итоге получилось 3 800 позиций в рекомендациях с упоминанием 1 807 уникальных продуктов и 7 534 цитирования, охватывающих 2 055 уникальных доменов. Каждый упомянутый домен проверили по ежедневному списку Tranco за 1 сентября 2026 года и по Wayback Machine, а также обратились к каждой из 1 502 предложенных моделями домашних страниц вендоров, чтобы убедиться в их существовании.

Google в исследование не вошёл. Подключение модели Gemini через OpenRouter означает маршрутизацию через собственный плагин веб-поиска OpenRouter, поэтому цитирования описывали бы работу этого плагина, а не поиска Google. Измерялся только Perplexity, и ничего в этом материале не следует читать как утверждение о других системах.

Куда ведут цитирования

Цитирования Без рейтинга (вне Tranco 1M) Рейтинг хуже #100k
perplexity/sonar 3 767 23,4% 59,8%
perplexity/sonar-pro 3 767 23,5% 59,9%
Суммарно 7 534 23,4% 59,8%

Медианный ранг Tranco среди 5 768 цитирований, указывающих на ранжированный домен, составляет 71 611. Концентрация цитирований на верхних позициях ничем не примечательна — десять самых цитируемых доменов забирают 17,3% всех цитирований, — так что дело не в том, что ответы поставляет картель известных сайтов. Дело в том, что заполняет остальные четыре пятых: 751 из 2 055 цитируемых доменов, то есть 36,5%, вообще не входят в топ-миллион.

Эти домены к тому же моложе. Медианная дата первого захвата Wayback для непроранжированных цитируемых доменов — 2020 год, против 2011-го у ранжированных, а 16,6% заархивированных непроранжированных доменов впервые попали в архив в 2025 году или позже — против 1,6% среди ранжированных.

Десять самых цитируемых доменов:

Домен Цитирования Доля Ранг Tranco
g2.com 291 3,86% 4 027
reddit.com 261 3,46% 105
guideflow.com 194 2,57% 177 039
gartner.com 158 2,10% 1 766
zapier.com 82 1,09% 2 919
wifitalents.com 71 0,94% 105 281
capterra.com 68 0,90% 6 387
linkedin.com 67 0,89% 18
worldmetrics.org 60 0,80% 104 737
gitnux.org 50 0,66% 42 759

Для сравнения: Википедию процитировали трижды из 7 534 раз.

Третий по величине источник — маркетинговый блог одного вендора

guideflow.com продаёт интерактивные демо продуктов. Это не сайт отзывов, не каталог и не издание, и он не конкурирует ни в одной из запрошенных категорий. Тем не менее его блог процитировали 194 раза в 96 из 380 категорий — четверть всех категорий, — что поставило домен на третье место, обойдя Gartner. Каждое цитирование ведёт на отдельный URL: 96 уникальных адресов блога guideflow.com, по одному на категорию, шесть из них — эстонская локализация одного и того же поста. В карте сайта числится 3 351 URL блога, из них 2 176 уникальных постов. Этот блог послужил источником для «3D rendering software», «IVR software», «RFID software» и «architecture practice software» в равной мере.

Ничего обманного тут нет. Guideflow ведёт крупный блог для контент-маркетинга, как это делают тысячи компаний. Речь о том, что делает с этим контентом слой поиска и извлечения: собственные листикл-статьи вендора о рынках, на которых он не работает, стали третьей по величине доказательной базой для ответа на вопрос о том, какой продукт покупать.

Страницы «фактов и подложки»

Ещё три сайта в первой десятке и сразу за ней — это wifitalents.com (71 цитирование, 27 категорий), worldmetrics.org (60, 22) и gitnux.org (50, 23). Вместе на них приходится 181 цитирование, 2,4% от общего числа, и они встречаются в 41 из 380 категорий.

Похоже, это одна и та же структура. Все три домена зарегистрированы через NameCheap в период с декабря 2023 по май 2024 года, все три делегируют DNS одной и той же паре серверов Cloudflare — pam.ns.cloudflare.com и sean.ns.cloudflare.com, — и все три используют одинаковый шаблон страниц с одинаковой навигацией: Services, Market Data, Software Advice, Editorial Process, Company. Каждый также ведёт блог ровно из шести постов, и все восемнадцать посвящены другим брендам из этого набора: по два поста о каждом из двух других сайтов и два — о четвёртом бренде, zipdo.co, который сидит на той же паре серверов имён и присвоил своей главной странице такой же заголовок «Facts & Grounding Page». Общая пара серверов имён — сильное косвенное доказательство единого аккаунта Cloudflare, но не прямое доказательство единого владельца; тем не менее шаблон, таксономия и блоги совпадают пункт в пункт.

Главное здесь — масштаб. В картах сайтов числится 103 578, 107 083 и 105 541 URL соответственно, из которых 70 731, 71 684 и 72 713 — страницы вида /best/<something>-software/: 215 128 сгенерированных гидов по выбору софта на три бренда, при этом блоговых постов на каждый бренд всего по шесть (седьмой URL /blog/ в каждой карте сайта — это индекс блога). Реальных категорий софта в таком количестве не существует.

Особенным этот случай делает то, как сайты сами себя описывают. При обращении 2 сентября 2026 года worldmetrics.org и gitnux.org возвращали HTML-заголовок вида <Brand> — Facts & Grounding Page и идентичное meta-описание, отличающееся только названием бренда:

Verified facts about Gitnux: an independent market research company publishing industry statistics, custom research, and software Best Lists. Company, legal, methodology, and compliance details in one machine-readable record.

«Grounding» — не термин, которым пользуются покупатели софта. Это название этапа, на котором поисковая система извлекает документы, чтобы обусловить ими ответ. Машиночитаемая запись «проверенных фактов о себе» тоже не выглядит услугой для человека-читателя. Своими заголовками и описаниями эти страницы обращены к программам, которые их читают, а не к людям.

Это чтение к тому же покупается вполне обычным способом. worldmetrics.org рекламирует кастомные маркетинговые исследования «от €5 000», готовые отчёты «от €499» и подбор поставщиков «от €2 500» — прямо над той же таксономией сгенерированных списков «лучших продуктов», которые извлекают модели.

Один шаблон, три разных вердикта

С каждого из трёх брендов загрузили одну и ту же страницу категории: «project estimation software». Каждая страница указывает свой рейтинг в JSON-LD, так что его можно прочитать без интерпретации. Каждая ранжирует десять инструментов; ниже — первые пять.

Сайт 1 2 3 4 5
worldmetrics.org Float Scoro Teamwork.com Procore Wrike
wifitalents.com Float Scoro Teamwork.com Buildertrend Apropo
gitnux.org Saviom Mosaic Buildertrend Float Teamwork.com

Победитель по версии Gitnux вообще не входит в пятёрку Worldmetrics. На каждой странице указаны три сотрудника-«эксперта»: Worldmetrics называет Kathryn Blake, Alexander Schmidt и Victoria Marsh; Gitnux — Diana Reeves, Helena Kowalczyk и Olivia Thornton; WifiTalents — Ryan Gallagher, Isabella Rossi и Natasha Ivanova — девять разных людей на один и тот же вопрос. Каждая страница заявляет о редакционном процессе; Gitnux помечает свой результат как «AI-verified · Expert reviewed». На всех трёх страницах в строке с указанием автора остался нерендерящийся шаблонный параметр: на двух он выглядит как «Within the next 26 days», на третьей — «Within the next 40 days».

Куда ведут рекомендации

1 502 предложенных моделями домашних страницы вендоров в основном в порядке. Каждую проверили дважды — напрямую и через ротируемый прокси, — и сайт считался доступным, если хотя бы одна из попыток дошла до цели, чтобы блокировка одного из IP-адресов не выглядела как исчезновение компании.

Десять из 1 502 доменов вообще не резолвятся ни в какой адрес — у восьми из них нет делегированного сервера имён, — включая graphiql.com (предложенный как домашняя страница GraphiQL, у которой такого сайта нет), todo.com (предложенный для Microsoft To Do) и aquasecurity.io (предложенный для Trivy). Ещё четыре резолвятся, но никогда не отвечают. Вместе с 404-ошибками 17 доменов — 1,1% — либо исчезли, либо недоступны. Ещё 92 (6,1%) редиректят на другой регистрируемый домен; большинство из них — обычные поглощения и ребрендинги, и полный список опубликован без попыток угадывать причину для каждого случая.

Два случая выбиваются из этой картины, и в обоих модели «разошлись» между собой. На запрос про платформы управления исследовательскими данными обе модели назвали Dryad: sonar-pro указал настоящий репозиторий на datadryad.org, а sonardryad.co, который перенаправляет на индонезийский портал онлайн-гэмблинга с заголовком, начинающимся с «BIGSLOT288 | Portal Game Online». На запрос про инструменты контроля качества данных обе модели назвали Monte Carlo: sonar указал montecarlodata.com, а sonar-promontecarlo.com, который перенаправляет на Monte-Carlo Société des Bains de Mer, монакскую группу отелей и казино.

Чего это не показывает

Две модели — не два независимых измерения. Они вернули побайтово идентичный список цитирований в 289 из 380 категорий, а их наборы URL пересекаются с коэффициентом Жаккара 0,898, так что оба тира Perplexity используют общий слой поиска и извлечения и их стоит рассматривать как один поисковый стек, опрошенный дважды. Их согласие по главному выбору — один и тот же продукт на первом месте в 290 из 380 категорий — говорит об этом общем слое поиска, а не о том, что независимые системы сходятся во мнении.

Результат касается только Perplexity. ChatGPT, Gemini, Copilot и AI Mode от Google не измерялись, и нет оснований предполагать, что их набор источников совпадает.

380 категорий составлены самостоятельно, а не взяты из реальных запросов покупателей, и список с уклоном в нишевые вертикали неизбежно выявит больше источников из длинного хвоста, чем список из распространённых запросов.

Все запросы к страницам шли через ротируемый прокси дата-центра под именованным исследовательским user-agent, так что ответы, которые эти сайты давали в ходе исследования, не обязательно совпадают с тем, что они отдают краулеру поисковой системы или обычному браузеру.

Четыре из семнадцати недоступных доменов вендоров — крупные сайты, среди них nasdaq.com и solidworks.com, — явно работают и просто не ответили на автоматический запрос; их засчитали как недоступные, а не как мёртвые. Всё исследование — снимок одного дня работы постоянно меняющегося поискового индекса.

Использована одна формулировка запроса, один прогон на категорию, без повторных выборок. Более ранний пилотный тест показывал, что список продуктов заметно меняется при замене слова «best» на «most popular», в то время как набор источников меняется гораздо слабее — но в этом прогоне это не измерялось.

Ранг Tranco — показатель популярности, а не качества, и низкий ранг сам по себе не обвинение. Здесь он использован лишь для того, чтобы отделить широко посещаемый веб от всего остального; каждое утверждение о конкретном сайте опирается на страницы этого сайта, которые в датасете приведены со ссылками и архивными копиями.

Не было показано, что что-либо из этого меняет итоговые ответы моделей. Не проверялось, изменились бы рекомендации при исключении этих источников, и Guideflow, и три бренда с «best list» вполне могут называть разумные продукты. Измерялось лишь то, из каких документов состоит доказательная база.

Наконец, общий контроль над тремя брендами — предположение, основанное на общей инфраструктуре и идентичном шаблоне. Кто на самом деле ими управляет, неизвестно; ни один из трёх сайтов не называет владельца.

Данные и методология

Полный датасет — все цитирования, все рекомендации, проверки по Tranco и Wayback, проверки доступности вендоров — и скрипты, которыми получены все приведённые цифры, доступны по адресу /data/manufactured-sources-behind-ai-recommendations/, вместе с описанием методологии и документацией по колонкам. Материал распространяется под лицензией CC BY 4.0. PDF-версия отчёта доступна по адресу trellner.com/data/manufactured-sources-behind-ai-recommendations/manufactured-sources-behind-ai-recommendations.pdf.