Lab Leadersлаборатория роста бизнеса

ИИ-боты на вашем сайте: сколько их на самом деле и как отличить подделку

Опубликовано 10 августа 2026 г.Обновлено 16 августа 2026 г.11 мин чтения

Имя бота в логах сайта ничего не доказывает: строку с названием краулера подставляет сам гость, и подделать её может кто угодно. Мы разобрали недельные логи lab-leaders.com за 3–10 августа 2026 года: из 1053 запросов, представившихся ботами ChatGPT и Claude, официальным спискам IP-адресов этих компаний соответствовали только 240. Остальные 77% пришли с адресов, которых в этих списках нет, и основная их часть искала на сайте файлы с паролями.

Вопрос «ИИ-боты ходят по моему сайту, это хорошо или плохо» за последний месяц перешёл из теории в бухгалтерию: издатели считают, сколько отдают трафика роботам, и начинают их закрывать. Мы сняли свои логи, посчитали и получили результат, которого не ждали. Ниже цифры и метод: повторить его на своём сайте можно за полчаса.

Краулер, он же поисковый робот, это программа, которая сама обходит страницы сайта и забирает их содержимое. Логи, они же журналы веб-сервера, это файл, куда сервер построчно записывает каждый такой визит.

Почему вообще возник вопрос о блокировке ИИ-краулеров

Поводом стал разбор владельца базы данных PatronView Ника Грея, опубликованный 7 августа 2026 года. По его логам за июнь Claude-SearchBot сделал 420 680 запросов за неделю и привёл за ту же неделю 12 живых посетителей. Курс обмена: 35 000 обходов на один переход. Роботу было отдано 4,63 гигабайта, людям, пришедшим по его ссылкам, 175 килобайт. Краулер Amazon читал около 117 тысяч страниц в сутки и не привёл ни одного человека, после чего 5 августа его заблокировали.

35 000 : 1
обходов ИИ-краулера на одного присланного посетителя по логам PatronView за июнь 2026 года
Source: Разбор Ника Грея, PatronView, 07.08.2026; изложение PPC Land

Цифра честная, но есть деталь, которую в пересказах теряют. PatronView, по описанию в том же разборе, это база примерно на полтора миллиона страниц. Робот, обходящий её целиком, физически не может окупиться переходами: там просто нечего процитировать в ответе на обычный вопрос человека. Переносить такое соотношение на сайт услуг из сотни страниц нельзя. Поэтому мы не стали делать выводы по чужим логам и сняли свои.

Как снять свой замер по логам за полчаса

Метод не требует ни платных сервисов, ни доступа к аналитике. Нужен только доступ к журналу веб-сервера. На типовом хостинге это файл access.log в панели управления, на своём сервере его пишут nginx, Apache или Caddy.

  1. Найдите журнал доступа за последние 7 дней

    Один файл или несколько с архивами. Неделя это минимальный разумный срок: краулеры ходят волнами, и суточный срез покажет случайную картину.

  2. Отфильтруйте строки по названиям ИИ-краулеров

    Ищите в поле User-Agent подстроки ClaudeBot, Claude-User, Claude-SearchBot, GPTBot, OAI-SearchBot, ChatGPT-User, PerplexityBot, Amazonbot, Amzn-SearchBot, Google-Extended, CCBot, Bytespider, meta-externalagent. User-Agent — это строка, которой гость представляется серверу.

  3. Посчитайте запросы и отданные байты по каждому имени

    Именно объём в байтах показывает реальную нагрузку. Количество запросов без объёма обманывает: тысяча обращений к robots.txt весит меньше, чем полсотни полных страниц.

  4. Проверьте каждый IP-адрес по официальному списку владельца бота

    Это главный шаг, и его почти никто не делает. Списки опубликованы: openai.com/gptbot.json, openai.com/searchbot.json, openai.com/chatgpt-user.json, claude.com/crawling/bots.json. Адрес не из списка означает, что перед вами не тот, за кого он себя выдаёт.

  5. Сопоставьте с переходами

    Посчитайте в тех же логах визиты, у которых в поле Referer стоит chatgpt.com, perplexity.ai и подобные адреса. Referer — поле, в котором браузер сообщает, с какой страницы человек к вам пришёл.

Что показали наши логи за 3–10 августа 2026 года

Сайт небольшой: около 90 страниц в карте сайта, тематика деловая, про рекламу и продвижение. За неделю сервер обработал 47 576 запросов. Строки с именами ИИ-краулеров нашлись в 2388 из них.

Дальше цифры перестали сходиться.

Что смотрелиРезультат за неделю
Всего запросов к сайту47 576
Запросов с именем ИИ-краулера в User-Agent2388 (34,2 МБ)
Из них с трёх адресов-самозванцев1566
Осталось после вычета этих трёх адресов822 запроса, 31,1 МБ

Отдельно мы сверили по официальным спискам IP ту часть, для которой такая сверка возможна: запросы от имени ботов OpenAI и Anthropic. Их оказалось 1053, и разложились они так:

Откуда пришёл запросЗапросов
Адрес есть в опубликованном списке владельца бота240
Три адреса-самозванца, описанные ниже772
Ещё девять разрозненных адресов не из списков41
Всего запросов от имени ботов OpenAI и Anthropic1053

Проверка на сходимость: 240 подтверждённых плюс 41 неподтверждённый запрос с прочих адресов дают 281, и ровно столько же дают строки OpenAI и Anthropic в таблице по именам ниже. Два разреза одного замера сошлись.

77%
запросов от имени ботов ChatGPT и Claude не подтвердились по опубликованным спискам IP-адресов этих компаний
Source: Логи Caddy lab-leaders.com, 3–10 августа 2026, сверка по openai.com/gptbot.json, openai.com/searchbot.json, openai.com/chatgpt-user.json, claude.com/crawling/bots.json

Три адреса подставляли по очереди все известные имена: ClaudeBot, GPTBot, OAI-SearchBot, ChatGPT-User, PerplexityBot, Amazonbot, Google-Extended. Два из них принадлежат облаку Google Cloud, третий зарегистрирован на небольшого американского провайдера. Ни одного нет в списках OpenAI и Anthropic. Оговорка важная: адрес в облаке Google арендует кто угодно за несколько долларов, и к самой компании Google эти визиты отношения не имеют. Облако здесь просто место, откуда удобно работать анонимно.

Про девять оставшихся адресов сказать нечего: единичные запросы к обычным страницам, без перебора и без вреда. Весь описанный ниже перебор относится к трём адресам-самозванцам.

Запрашивали они не статьи. Список того, что эти «ИИ-боты» искали на сайте: /.env, /.env.production, /.env.backup, /credentials.json, /service-account.json, /serviceAccountKey.json, /firebase-adminsdk.json, /gcp-credentials.json, /docker-compose.yml, /api/config. Это стандартный перебор файлов, в которых у неаккуратно собранного сайта лежат пароли к базе и ключи к платным сервисам. По тем же логам, из 2388 запросов «ИИ-краулеров» 727 получили в ответ 404, то есть страница не найдена.

Кто из настоящих ИИ-роботов читает сайт и сколько это стоит

После вычета трёх адресов-самозванцев остаётся 822 запроса и 31,1 мегабайта за неделю. Распределение по именам ниже. Списков IP-адресов для сверки есть не у всех владельцев, поэтому часть строк проверена только вычетом известных подделок:

РоботЗапросов за неделюОтдано
meta-externalagent (Meta)49521,4 МБ
OAI-SearchBot (OpenAI)1252,9 МБ
ClaudeBot (Anthropic)1142,2 МБ
GPTBot (OpenAI)261,3 МБ
PerplexityBot211,6 МБ
ChatGPT-User (переход по ссылке из чата)140,4 МБ
Google-Extended121,2 МБ
Bytespider (ByteDance)130 МБ
Claude-User (переход по ссылке из чата)20,1 МБ

Тридцать мегабайт в неделю это никакая нагрузка. Для сравнения: одна фотография с телефона весит больше. Счета за трафик от ИИ-ботов болят у сайтов с сотнями тысяч страниц. Сайт услуг такой нагрузки просто не замечает.

ИИ-роботы бывают двух разных пород, и в обсуждениях их почти всегда считают одной. Обучающий краулер (GPTBot, ClaudeBot, Google-Extended, CCBot) забирает текст в набор данных, на котором учат модель, и перехода вам не приведёт никогда. Отвечающий краулер (OAI-SearchBot, PerplexityBot, Claude-SearchBot) собирает материал для ответа на конкретный вопрос пользователя и ставит ссылку на источник. Это разные боты с разной экономикой, и одна общая запрещающая строка в robots.txt закрывает обоих сразу. О таком решении потом обычно жалеют.

Какой курс обмена получился у нас

За ту же неделю в логах записаны переходы: 284 с Google, 44 с TikTok, 22 с адресов OpenAI, 5 с Яндекса, 4 с Bing, 3 с DuckDuckGo. Считались они по полю Referer в тех же журналах сервера.

Считаем честно: 240 подтверждённых по адресу обходов ботами OpenAI и Anthropic против 22 зафиксированных в тех же логах переходов из ChatGPT. Порядок величины получается такой: десятки обходов на один переход. Не десятки тысяч.

Оговорки, без которых цифра врёт

Переходы по полю Referer считаются с недобором: часть клиентов ИИ-сервисов его не передаёт, а из мобильных приложений он теряется почти всегда. Реальное число переходов выше записанного. С другой стороны, наш сайт маленький и по нему есть цитирования, поэтому и обходов немного. Обе поправки работают в разные стороны, и общий смысл они не меняют: на сайте из сотни страниц ИИ-краулеры не создают проблемы, которую стоило бы решать блокировкой.

Стоит ли закрывать сайт от ИИ-ботов

Ответ зависит от того, чем вы зарабатываете, и распадается на три разных случая.

Сайт продаёт услуги или товары. Закрываться незачем. Ваш доход — заявки, а не показы рекламы на страницах. Попадание в ответ языковой модели работает как рекомендация и стоит вам тридцати мегабайт в неделю. Дешевле обходится только сарафанное радио.

Сайт зарабатывает на рекламе и трафике. Здесь конфликт реальный: модель пересказывает ваш материал, читатель до страницы не доходит, показ рекламы не случается. Разумный компромисс такой: закрывать обучающих краулеров и оставлять отвечающих, у которых есть ссылка на источник.

Сайт представляет собой большую базу данных или каталог. Случай PatronView. Полный обход миллиона страниц стоит денег на трафик и процессор, а окупиться переходами не может. Здесь блокировку или ограничение скорости обхода оправдывает арифметика.

Мы относимся к первой категории и закрываться не собираемся: мы строим видимость в ИИ-ответах осознанно и разбирали, что на неё влияет, в материале про llms.txt и настоящие факторы попадания в ответы ИИ. Механика попадания в ответы Google описана отдельно в разборе как попасть в AI Overviews, а вопрос о том, нужна ли под это отдельная работа, разобран в статье про GEO-оптимизацию, то есть работу над видимостью в ответах ИИ. С 15 сентября 2026 года выбор частично начинает делать за владельца инфраструктура: что именно меняет Cloudflare и как это проверить у себя, разобрано здесь: Cloudflare закрывает ИИ-краулеров по умолчанию.

Что делать с самозванцами

Обычный владелец сайта не может отличить настоящего бота от поддельного глазами, и это нормально. Что реально сделать:

  1. Проверять по IP, а не по имени. Списки адресов опубликованы, сверка автоматизируется десятком строк кода. Любое решение о доступе принимается по адресу.
  2. Не пытаться закрыть перебор паролей через robots.txt. Он там не работает. Работают другие вещи: файлы конфигурации не лежат в открытой папке сайта, ключи не хранятся в коде, ограничение частоты запросов с одного адреса включено.
  3. Проверить, что искомое действительно отсутствует. Наши 404 — это хорошая новость: перебирали, не нашли. Стоит зайти по адресам из списка выше на своём сайте и убедиться, что там пусто. Если хоть один файл отдаётся, бросайте статью и чините: это авария.
  4. Возвращаться к логам каждый месяц. Состав ботов меняется быстро: Amazon начал массовый обход этим летом, Meta за нашу неделю оказалась крупнейшим потребителем трафика среди настоящих роботов.

Нужен разбор видимости вашего сайта в ИИ-ответах?

Обсудить задачу

Главное из замера

Мы шли смотреть, во сколько нам обходится гостеприимство к ИИ-краулерам, и обнаружили, что две трети «ИИ-трафика» вообще не ИИ. Настоящие роботы взяли за неделю тридцать мегабайт и привели измеримые переходы. Решение не закрываться осталось прежним, но теперь под ним лежит собственная цифра.

Любой владелец сайта может повторить этот замер за полчаса и получить свой ответ. Ваш результат будет другим: между сайтом услуг и базой на миллион страниц разница в тысячи раз, и чужая цифра тут не подсказка.

Частые вопросы

Замер выполнен по журналам веб-сервера lab-leaders.com за период с 3 по 10 августа 2026 года. Сверка адресов проведена по спискам openai.com/gptbot.json, openai.com/searchbot.json, openai.com/chatgpt-user.json и claude.com/crawling/bots.json на 10 августа 2026 года. Данные по PatronView: разбор Ника Грея от 7 августа 2026 года.

Полезна ли статья?
Автор
Фёдор Шеришев
Google Ads × AI · основатель Lab Leaders

Основатель Lab Leaders. Google Partners с 2017 года, владелец мебельного производства Ideal Comfort. Строю бизнесы с помощью Google Ads и AI-агентов.

Читать дальше

UTM метки: что это, как их составить и почему отчёт всё равно врёт

UTM метки это приписка к адресу страницы, по которой аналитика понимает, откуда пришёл человек. Разбираем шесть параметров, подстановки рекламных систем, шесть ошибок, из-за которых отчёт врёт, и отдельно честно о трафике из нейросетей, который метками разметить нельзя.

10 мин

SEO-оптимизация сайта: что это, что в неё входит и что можно сделать самому

Оптимизация помещается целиком внутри вашего сайта, и принять её можно почти без специальных знаний. Разбираем три слоя работ, порядок действий с нуля, границу между «сделаю сам» и «нужен подрядчик» и пять причин, по которым деньги уходят в отчёт, а не в сайт.

10 мин

Аудит: 1 бизнес из 9, которых порекомендовал ChatGPT, описан с ошибкой

Попасть в ответ нейросети и быть в нём правильно описанным это две разные задачи. Свежий аудит показывает: прямой лжи мало, зато более трети утверждений о бизнесах не подтверждается ничем, а хуже всего проверяются лицензии и сертификаты.

8 мин

Аудит 4 776 заведений: нейросети не знают 85,6% реальных бизнесов, и звёзды на это не влияют

Первый замер, построенный на полной переписи рынка, а не на выборке: языковые модели не назвали ни разу 85,6% заведений. Выдумывают они редко, 0,08%. Разбираем, почему попадание в ответ и место внутри ответа решают разные сигналы и при чём тут отсутствие своего сайта.

9 мин