Активная угроза: кампания по спуфингу AI-ботов

Сервис Known Agents, который отслеживает поведение ботов и AI-агентов на более чем 5000 сайтов, сообщил о широкой кампании, в которой злоумышленники подделывают идентичность известных AI-ботов для сканирования сайтов на уязвимости. По наблюдениям аналитиков, атакующие целятся в пути, связанные с credentials и конфигурационными файлами AI-инструментов для разработки.

Мы наблюдаем масштабную кампанию, имитирующую AI-ботов, для сканирования сайтов на уязвимости. Похоже, атакующий целится в пути с credentials и конфигурациями, используемые AI-инструментами для разработки.

Спуфингом в терминологии Known Agents считается визит, который заявляет идентичность признанного агента, но не проходит поддерживаемый этим агентом метод аутентификации — например, верификацию по IP или Web Bot Auth (HTTP message signatures).

Кого чаще всего подделывают

По данным индекса, чаще всего злоумышленники маскируются под Googlebot — на его долю приходится 0,5% фальшивого трафика, заявляющего эту идентичность. Далее по частоте спуфинга идут ChatGPT-User, GPTBot, OAI-SearchBot и PerplexityBot — у каждого около 0,1%. ClaudeBot, Applebot, bingbot и ряд других ботов подделываются реже, но также фигурируют в списке.

Failed-проверка аутентификации указывает на то, что визит вероятно имитировал заявленного агента, но не идентифицирует ни конкретное ПО, ни оператора, который на самом деле выполнил запрос. Агенты без поддерживаемого метода аутентификации в эти измерения не включаются.

На что целятся атакующие

Среди недавно зафиксированных путей, к которым чаще всего обращались фальшивые боты, преобладают файлы конфигурации и credentials AI coding-инструментов и облачных сервисов:

  • /.config/anthropic/credentials/default.json
  • /.claude/settings.json
  • /.claude.json
  • /.hermes/.env
  • /.openclaw/.env
  • /.codex/config.toml
  • /.continue/config.json
  • /.aider.conf.yml
  • /service-account.json
  • /serviceaccountkey.json
  • /service_account.json
  • /firebase-adminsdk.json
  • /firebase-service-account.json
  • /.aws/credentials
  • /.aws/config
  • /.s3cfg
  • /.boto
  • /.npmrc
  • /.env.example
  • /.env.local
  • /.env.production
  • /.env.backup
  • /.env.old
  • /backend/.env
  • /api/.env
  • /admin/.env
  • /dockerfile
  • /docker-compose.yaml
  • /.docker/config.json
  • /terraform.tfstate
  • /credentials.json
  • /secrets.json
  • /secrets.yml
  • /key.json
  • /rclone.conf

Список наглядно показывает выбранную стратегию: атакующие ищут не общие уязвимости веб-приложений, а конкретно конфигурации Claude Code, Codex, Continue, Aider и других AI coding-агентов, а также ключи от AWS, Firebase, Docker и Terraform-стейты — то есть данные, которые при утечке дают прямой доступ к облачной инфраструктуре и API-ключам моделей.

Общая картина: боты против людей

Помимо кампании спуфинга, индекс Known Agents фиксирует общую динамику активности ботов на веб-сайтах. Доля визитов от ботов относительно людей составляет 35% и снизилась на 2% по сравнению с предыдущими 90 днями. Доля бот-трафика, связанного именно с AI, — 28%, и этот показатель вырос на 11%. При этом доля визитов людей, приходящих на сайты через AI chat-referral (ChatGPT, Perplexity, Gemini и другие), остаётся крайне низкой — 0,1% — и снизилась на 9%.

Соблюдение правил robots.txt агентами в среднем высокое: боты в целом следуют правилам в 98,5% случаев, а AI-скрейперы и AI data provider'ы — в 97,5% случаев. Среди самых блокируемых ботов на топ-1000 сайтов — GPTBot (24,6% сайтов блокируют его), CCBot (22,6%), ClaudeBot (21,7%) и Bytespider (18,9%).

Кто больше всего скрейпит контент для обучения AI

Среди AI data scraper'ов, собирающих контент сайтов для обучения моделей, лидирует ClaudeBot (Anthropic) — 27% активности такого типа, далее meta-externalagent (Meta) — 19,5%, Amazonbot (Amazon) — 19,2%, GPTBot (OpenAI) — 9,4% и Bytespider (ByteDance) — 7,3%.

В категории AI fetching, где боты забирают контент сайтов в реальном времени для формирования ответов AI-ассистентов, доминирует ChatGPT-User — 86,4% активности такого типа, что делает OpenAI абсолютным лидером среди операторов в этом сегменте.

Методология измерений

Индекс обновляется ежедневно на основе завершённых дней трафика с более чем 5000 сайтов, использующих продукты Known Agents для аналитики агентов и трекинга AI chat-referral. Текущий неполный день исключается из расчётов. Показатели эффективности robots.txt оценивают, насколько снижается частота запросов агента после введения правила disallow, сравнивая базовый уровень активности агента на сайтах, где он разрешён, с фактически наблюдаемой активностью на сайтах, где он запрещён.

Статистика по спуфингу считается отдельно для каждого агента как доля от общего серверного трафика по всем участвующим сайтам, усреднённая между сайтами. Учитываются только агенты с поддерживаемым методом аутентификации.