Имя бота в логах сайта ничего не доказывает: строку с названием краулера подставляет сам гость, и подделать её может кто угодно. Мы разобрали недельные логи lab-leaders.com за 3–10 августа 2026 года: из 1053 запросов, представившихся ботами ChatGPT и Claude, официальным спискам IP-адресов этих компаний соответствовали только 240. Остальные 77% пришли с адресов, которых в этих списках нет, и основная их часть искала на сайте файлы с паролями.
Вопрос «ИИ-боты ходят по моему сайту, это хорошо или плохо» за последний месяц перешёл из теории в бухгалтерию: издатели считают, сколько отдают трафика роботам, и начинают их закрывать. Мы сняли свои логи, посчитали и получили результат, которого не ждали. Ниже цифры и метод: повторить его на своём сайте можно за полчаса.
Краулер, он же поисковый робот, это программа, которая сама обходит страницы сайта и забирает их содержимое. Логи, они же журналы веб-сервера, это файл, куда сервер построчно записывает каждый такой визит.
Почему вообще возник вопрос о блокировке ИИ-краулеров
Поводом стал разбор владельца базы данных PatronView Ника Грея, опубликованный 7 августа 2026 года. По его логам за июнь Claude-SearchBot сделал 420 680 запросов за неделю и привёл за ту же неделю 12 живых посетителей. Курс обмена: 35 000 обходов на один переход. Роботу было отдано 4,63 гигабайта, людям, пришедшим по его ссылкам, 175 килобайт. Краулер Amazon читал около 117 тысяч страниц в сутки и не привёл ни одного человека, после чего 5 августа его заблокировали.
Цифра честная, но есть деталь, которую в пересказах теряют. PatronView, по описанию в том же разборе, это база примерно на полтора миллиона страниц. Робот, обходящий её целиком, физически не может окупиться переходами: там просто нечего процитировать в ответе на обычный вопрос человека. Переносить такое соотношение на сайт услуг из сотни страниц нельзя. Поэтому мы не стали делать выводы по чужим логам и сняли свои.
Как снять свой замер по логам за полчаса
Метод не требует ни платных сервисов, ни доступа к аналитике. Нужен только доступ к журналу веб-сервера. На типовом хостинге это файл access.log в панели управления, на своём сервере его пишут nginx, Apache или Caddy.
Найдите журнал доступа за последние 7 дней
Один файл или несколько с архивами. Неделя это минимальный разумный срок: краулеры ходят волнами, и суточный срез покажет случайную картину.
Отфильтруйте строки по названиям ИИ-краулеров
Ищите в поле User-Agent подстроки ClaudeBot, Claude-User, Claude-SearchBot, GPTBot, OAI-SearchBot, ChatGPT-User, PerplexityBot, Amazonbot, Amzn-SearchBot, Google-Extended, CCBot, Bytespider, meta-externalagent. User-Agent — это строка, которой гость представляется серверу.
Посчитайте запросы и отданные байты по каждому имени
Именно объём в байтах показывает реальную нагрузку. Количество запросов без объёма обманывает: тысяча обращений к robots.txt весит меньше, чем полсотни полных страниц.
Проверьте каждый IP-адрес по официальному списку владельца бота
Это главный шаг, и его почти никто не делает. Списки опубликованы: openai.com/gptbot.json, openai.com/searchbot.json, openai.com/chatgpt-user.json, claude.com/crawling/bots.json. Адрес не из списка означает, что перед вами не тот, за кого он себя выдаёт.
Сопоставьте с переходами
Посчитайте в тех же логах визиты, у которых в поле Referer стоит chatgpt.com, perplexity.ai и подобные адреса. Referer — поле, в котором браузер сообщает, с какой страницы человек к вам пришёл.
Что показали наши логи за 3–10 августа 2026 года
Сайт небольшой: около 90 страниц в карте сайта, тематика деловая, про рекламу и продвижение. За неделю сервер обработал 47 576 запросов. Строки с именами ИИ-краулеров нашлись в 2388 из них.
Дальше цифры перестали сходиться.
| Что смотрели | Результат за неделю |
|---|---|
| Всего запросов к сайту | 47 576 |
| Запросов с именем ИИ-краулера в User-Agent | 2388 (34,2 МБ) |
| Из них с трёх адресов-самозванцев | 1566 |
| Осталось после вычета этих трёх адресов | 822 запроса, 31,1 МБ |
Отдельно мы сверили по официальным спискам IP ту часть, для которой такая сверка возможна: запросы от имени ботов OpenAI и Anthropic. Их оказалось 1053, и разложились они так:
| Откуда пришёл запрос | Запросов |
|---|---|
| Адрес есть в опубликованном списке владельца бота | 240 |
| Три адреса-самозванца, описанные ниже | 772 |
| Ещё девять разрозненных адресов не из списков | 41 |
| Всего запросов от имени ботов OpenAI и Anthropic | 1053 |
Проверка на сходимость: 240 подтверждённых плюс 41 неподтверждённый запрос с прочих адресов дают 281, и ровно столько же дают строки OpenAI и Anthropic в таблице по именам ниже. Два разреза одного замера сошлись.
Три адреса подставляли по очереди все известные имена: ClaudeBot, GPTBot, OAI-SearchBot, ChatGPT-User, PerplexityBot, Amazonbot, Google-Extended. Два из них принадлежат облаку Google Cloud, третий зарегистрирован на небольшого американского провайдера. Ни одного нет в списках OpenAI и Anthropic. Оговорка важная: адрес в облаке Google арендует кто угодно за несколько долларов, и к самой компании Google эти визиты отношения не имеют. Облако здесь просто место, откуда удобно работать анонимно.
Про девять оставшихся адресов сказать нечего: единичные запросы к обычным страницам, без перебора и без вреда. Весь описанный ниже перебор относится к трём адресам-самозванцам.
Запрашивали они не статьи. Список того, что эти «ИИ-боты» искали на сайте: /.env, /.env.production, /.env.backup, /credentials.json, /service-account.json, /serviceAccountKey.json, /firebase-adminsdk.json, /gcp-credentials.json, /docker-compose.yml, /api/config. Это стандартный перебор файлов, в которых у неаккуратно собранного сайта лежат пароли к базе и ключи к платным сервисам. По тем же логам, из 2388 запросов «ИИ-краулеров» 727 получили в ответ 404, то есть страница не найдена.
Если бы мы приняли имя в логах на веру, картина получилась бы такой: «ИИ-боты дают две трети нагрузки, надо закрываться». А закрылись бы мы от того, что и так не работает, потому что перебор паролей идёт мимо robots.txt. Это текстовый файл в корне сайта, где вы просите роботов куда-то не ходить: просьба, а не замок, и соблюдают её только добросовестные. Самозванец читает его разве что для того, чтобы узнать, куда вы просите не ходить.
Кто из настоящих ИИ-роботов читает сайт и сколько это стоит
После вычета трёх адресов-самозванцев остаётся 822 запроса и 31,1 мегабайта за неделю. Распределение по именам ниже. Списков IP-адресов для сверки есть не у всех владельцев, поэтому часть строк проверена только вычетом известных подделок:
| Робот | Запросов за неделю | Отдано |
|---|---|---|
| meta-externalagent (Meta) | 495 | 21,4 МБ |
| OAI-SearchBot (OpenAI) | 125 | 2,9 МБ |
| ClaudeBot (Anthropic) | 114 | 2,2 МБ |
| GPTBot (OpenAI) | 26 | 1,3 МБ |
| PerplexityBot | 21 | 1,6 МБ |
| ChatGPT-User (переход по ссылке из чата) | 14 | 0,4 МБ |
| Google-Extended | 12 | 1,2 МБ |
| Bytespider (ByteDance) | 13 | 0 МБ |
| Claude-User (переход по ссылке из чата) | 2 | 0,1 МБ |
Тридцать мегабайт в неделю это никакая нагрузка. Для сравнения: одна фотография с телефона весит больше. Счета за трафик от ИИ-ботов болят у сайтов с сотнями тысяч страниц. Сайт услуг такой нагрузки просто не замечает.
ИИ-роботы бывают двух разных пород, и в обсуждениях их почти всегда считают одной. Обучающий краулер (GPTBot, ClaudeBot, Google-Extended, CCBot) забирает текст в набор данных, на котором учат модель, и перехода вам не приведёт никогда. Отвечающий краулер (OAI-SearchBot, PerplexityBot, Claude-SearchBot) собирает материал для ответа на конкретный вопрос пользователя и ставит ссылку на источник. Это разные боты с разной экономикой, и одна общая запрещающая строка в robots.txt закрывает обоих сразу. О таком решении потом обычно жалеют.
Какой курс обмена получился у нас
За ту же неделю в логах записаны переходы: 284 с Google, 44 с TikTok, 22 с адресов OpenAI, 5 с Яндекса, 4 с Bing, 3 с DuckDuckGo. Считались они по полю Referer в тех же журналах сервера.
Считаем честно: 240 подтверждённых по адресу обходов ботами OpenAI и Anthropic против 22 зафиксированных в тех же логах переходов из ChatGPT. Порядок величины получается такой: десятки обходов на один переход. Не десятки тысяч.
Переходы по полю Referer считаются с недобором: часть клиентов ИИ-сервисов его не передаёт, а из мобильных приложений он теряется почти всегда. Реальное число переходов выше записанного. С другой стороны, наш сайт маленький и по нему есть цитирования, поэтому и обходов немного. Обе поправки работают в разные стороны, и общий смысл они не меняют: на сайте из сотни страниц ИИ-краулеры не создают проблемы, которую стоило бы решать блокировкой.
Стоит ли закрывать сайт от ИИ-ботов
Ответ зависит от того, чем вы зарабатываете, и распадается на три разных случая.
Сайт продаёт услуги или товары. Закрываться незачем. Ваш доход — заявки, а не показы рекламы на страницах. Попадание в ответ языковой модели работает как рекомендация и стоит вам тридцати мегабайт в неделю. Дешевле обходится только сарафанное радио.
Сайт зарабатывает на рекламе и трафике. Здесь конфликт реальный: модель пересказывает ваш материал, читатель до страницы не доходит, показ рекламы не случается. Разумный компромисс такой: закрывать обучающих краулеров и оставлять отвечающих, у которых есть ссылка на источник.
Сайт представляет собой большую базу данных или каталог. Случай PatronView. Полный обход миллиона страниц стоит денег на трафик и процессор, а окупиться переходами не может. Здесь блокировку или ограничение скорости обхода оправдывает арифметика.
Мы относимся к первой категории и закрываться не собираемся: мы строим видимость в ИИ-ответах осознанно и разбирали, что на неё влияет, в материале про llms.txt и настоящие факторы попадания в ответы ИИ. Механика попадания в ответы Google описана отдельно в разборе как попасть в AI Overviews, а вопрос о том, нужна ли под это отдельная работа, разобран в статье про GEO-оптимизацию, то есть работу над видимостью в ответах ИИ. С 15 сентября 2026 года выбор частично начинает делать за владельца инфраструктура: что именно меняет Cloudflare и как это проверить у себя, разобрано здесь: Cloudflare закрывает ИИ-краулеров по умолчанию.
Что делать с самозванцами
Обычный владелец сайта не может отличить настоящего бота от поддельного глазами, и это нормально. Что реально сделать:
- Проверять по IP, а не по имени. Списки адресов опубликованы, сверка автоматизируется десятком строк кода. Любое решение о доступе принимается по адресу.
- Не пытаться закрыть перебор паролей через robots.txt. Он там не работает. Работают другие вещи: файлы конфигурации не лежат в открытой папке сайта, ключи не хранятся в коде, ограничение частоты запросов с одного адреса включено.
- Проверить, что искомое действительно отсутствует. Наши 404 — это хорошая новость: перебирали, не нашли. Стоит зайти по адресам из списка выше на своём сайте и убедиться, что там пусто. Если хоть один файл отдаётся, бросайте статью и чините: это авария.
- Возвращаться к логам каждый месяц. Состав ботов меняется быстро: Amazon начал массовый обход этим летом, Meta за нашу неделю оказалась крупнейшим потребителем трафика среди настоящих роботов.
Нужен разбор видимости вашего сайта в ИИ-ответах?
Обсудить задачуГлавное из замера
Мы шли смотреть, во сколько нам обходится гостеприимство к ИИ-краулерам, и обнаружили, что две трети «ИИ-трафика» вообще не ИИ. Настоящие роботы взяли за неделю тридцать мегабайт и привели измеримые переходы. Решение не закрываться осталось прежним, но теперь под ним лежит собственная цифра.
Любой владелец сайта может повторить этот замер за полчаса и получить свой ответ. Ваш результат будет другим: между сайтом услуг и базой на миллион страниц разница в тысячи раз, и чужая цифра тут не подсказка.
Частые вопросы
Замер выполнен по журналам веб-сервера lab-leaders.com за период с 3 по 10 августа 2026 года. Сверка адресов проведена по спискам openai.com/gptbot.json, openai.com/searchbot.json, openai.com/chatgpt-user.json и claude.com/crawling/bots.json на 10 августа 2026 года. Данные по PatronView: разбор Ника Грея от 7 августа 2026 года.