Каждый третий запрос к нашему сайту — проверка, не забыли ли мы запереть дверь. На живого человека с браузером похожа меньше четверти обращений.

Мы открыли журнал своего веб-сервера — файл, куда записывается каждое обращение к сайту, — и разобрали его построчно за две недели. Получилась картина интернета за кулисами.

📋 Коротко
За 14 суток сайт получил 121 684 запроса и отдал 9,2 гигабайта. Из них 7,9 гигабайта забрал один бот, скачавший один и тот же файл больше шести тысяч раз. Роботы ИИ-компаний дали почти одиннадцать тысяч обращений. Треть всех запросов оказалась попытками нащупать дыру, а самый активный «Googlebot» на поверку оказался сканером, который просто назвался чужим именем.

Как мы мерили

Данные — журнал веб-сервера nginx со 2 по 15 сентября 2026 года, четырнадцать полных суток. Это не аналитика с графиками, а текстовый файл, куда сервер записывает каждое обращение: кто пришёл, что запросил, что получил, сколько байт ушло.

Каждую строку мы разобрали по представлению — так программа называет себя при обращении: Googlebot, YandexBot, GPTBot. Поисковые роботы пишут туда своё имя честно. Взломщики маскируются под браузер или под чужого робота, но выдают себя адресами, которые запрашивают.

⚠️ Насколько точны эти цифры

Отличить человека от робота по журналу можно лишь приблизительно. Браузером мы считали то, что похоже на браузер по представлению, — а под браузер маскируются и сканеры. Поэтому наши 23% — скорее верхняя оценка доли людей.

Есть и обратный эффект: часть заходов живых читателей до журнала не доходит, потому что браузер берёт страницу из своих сохранённых копий. Какое из искажений сильнее, по журналу не скажешь, поэтому все цифры ниже — порядок величины, а не аптекарская точность.

Самый активный Googlebot оказался не Google

Первый же результат пришлось перепроверять дважды.

По имени в журнале Googlebot выглядел абсолютным чемпионом: 23 тысячи обращений, больше всех. Но настоящий робот Google ходит с известных адресов — их список компания публикует. Сверка по адресам дала неожиданное: из 23 тысяч «гуглов» настоящих оказалось 84. Всё остальное — 23 012 запросов с девяти соседних адресов одного провайдера.

Чем занимался этот самозванец, видно по тому, что он спрашивал: /.env, /secrets.json, /config.yml, /.yarnrc. Ни один поисковик такие файлы не ищет — в них хранят пароли и ключи. То есть под именем Google на сайт ходил обычный сканер уязвимостей, и делал это так интенсивно, что едва не перевесил всю остальную статистику.

Вывод из этого простой и полезный: имя в журнале ничего не доказывает. Представиться Googlebot может кто угодно — это просто строка текста, которую программа отправляет о себе.

Кто пришёл на самом деле

Кто Запросов Отдано трафика
Mail.ru 6 633 8 070 МБ
OpenAI (ChatGPT) 3 044 22 МБ
Anthropic (Claude) 2 486 13 МБ
Amazon 1 614 17 МБ
Meta 1 216 12 МБ
Perplexity 1 201 4 МБ
Яндекс 830 8 МБ
xAI (Grok) 797 3 МБ
Apple 527 2 МБ
ByteDance 402 1 МБ
Google (настоящий) 84 0,7 МБ

Mail.ru сделал семь тысяч запросов и забрал восемь гигабайт — при том что все остальные боты вместе взяли меньше ста мегабайт. Разница в сто раз, а запросов у них сопоставимо. С этим стоило разобраться.

Один бот и восемь гигабайт

У сайта есть служебный файл с лентой всех материалов — по нему работает подписка в приложениях-читалках. Весит он около полутора мегабайт, потому что содержит полные тексты статей.

Бот Mail.ru скачал его 6 394 раза за две недели. Примерно раз в три минуты, круглосуточно. Файл при этом почти не менялся: за две недели в нём появилось от силы пара десятков новых заголовков.

💸 Во что это обходится

7,9 гигабайта — это 86% всего трафика сайта за период. На каждый мегабайт, прочитанный живыми людьми, пришлось шесть мегабайт, выкачанных одним ботом впустую.

Нам это ничего не стоило: тариф с запасом. Но у хостингов с оплатой за трафик такой гость превращается в строчку в счёте, а владелец сайта смотрит на сто читателей в сутки и не понимает, откуда гигабайты.

И скажу прямо: это плохо написанный бот. Google на такой же ленте спрашивает «менялось ли?» и уходит, получив «нет», — ответ весит несколько сотен байт. Умение не качать одно и то же по кругу придумали до изобретения этого робота.

Мы уже как-то взвешивали, сколько мегабайт тратит обычный заход на сайт — так вот, вежливый робот обходится дешевле человека в сотни раз, а невежливый съедает больше, чем вся аудитория.

ИИ-боты уже ходят по всем

Самое заметное изменение в списке — компании, которых десять лет назад в нём не было вовсе.

OpenAI, Anthropic, Perplexity, Meta, Amazon, ByteDance и бот Grok вместе дали почти одиннадцать тысяч обращений за две недели. Это роботы, которые собирают тексты для обучения моделей и для ответов чат-ботов. Считай, каждый четвёртый заход робота сегодня — не от поисковика, а от ИИ-компании.

Когда чат-бот отвечает вам на вопрос о технике, ответ он мог собрать по статьям, которые до него скачал такой же робот. Отсюда вывод для всех, кто пишет в интернете: текст теперь читают не только люди и поисковики.

Ведут себя эти роботы по-разному. OpenAI и Anthropic заходят аккуратно: берут страницу, качают картинки, уходят. Amazon и ByteDance напористее, бегают по одним и тем же адресам чаще, чем те меняются. Общее у них одно: читателей они не приводят. Поисковик, забрав страницу, когда-нибудь покажет её человеку и приведёт его на сайт. Чат-бот перескажет ответ у себя. Читатель не придёт никогда.

Отказаться от такого гостя можно: в корне сайта лежит файл с правилами для роботов, имена ИИ-ботов вписываются туда отдельной строкой. Строчку эти боты воспринимают как просьбу — GPTBot и ClaudeBot её соблюдают, некоторые другие обходят, и гарантию даёт только блокировка на уровне сервера. Мы не вписывали: пока это выглядит как способ исчезнуть из ответов, которыми люди пользуются всё чаще.

📲 Такие замеры мы делаем регулярно

Проверяем обещания на цифрах и показываем, что вышло по факту. Подпишитесь на «Техпросто» в MAX, Telegram или Дзене, и разборы будут приходить сами.

А где Яндекс

Российский сайт на русском языке, про технику для российских читателей. Яндекс за две недели зашёл 830 раз — меньше, чем боты OpenAI, Anthropic и Perplexity по отдельности.

Дело не в запрете: правила для роботов у нас одинаковые для всех, никаких ограничений именно для Яндекса нет. Он просто заходит редко.

Яндекс обходит молодые сайты в последнюю очередь. Заглядывает, но толком не вычитывает. Пока это не изменится, потока читателей из поиска не будет — и это объясняет, почему первый год жизни нового сайта выглядит как разговор со стеной.

Треть всех запросов — попытка взлома

Представьте человека, который идёт вдоль длинной парковки и дёргает по очереди все ручки. Не потому, что выбрал вашу машину, — просто одна из сотни окажется незапертой, и этого достаточно. Ровно так работают сканеры уязвимостей, и в журнале это видно построчно.

Мы посчитали обращения к адресам, которых на нашем сайте нет и быть не может: служебные файлы, панели администратора, конфигурации. Таких запросов оказалось 31 009 — 31% от всего.

Что искали Запросов Зачем это взломщику
Файлы .env 15 892 Там хранят пароли к базам и ключи от сервисов
Файлы с названием config 6 417 Настройки сайта, тоже часто с паролями
Скрипты .php 2 923 Дыры в старых движках
Папка .git 1 267 Полная копия исходного кода сайта
Вход в WordPress 1 574 Подбор пароля к админке
Файлы с названием secrets 881 Ключи доступа к сторонним сервисам

Сразу успокою: ни одного из этих файлов на сайте не существует. Наш сайт собран так, что страницы отдаются готовыми файлами, ни базы данных, ни панели администратора у него нет, и все 31 009 попыток получили в ответ «страница не найдена». Каждый пятый ответ сервера за две недели был именно таким — 20,5% всех обращений.

Отдельная ирония: полторы тысячи запросов искали панель WordPress на сайте, где WordPress никогда не стоял. Боты об этом не знают и идут по списку.

Часть сканеров даже не скрывается. В журнале честно представились двое: feroxbuster (2 048 запросов) перебирает адреса по словарю, ExchangeScanner (1 120) искал почтовые серверы Microsoft, которых у нас отродясь не было. Имя своё не прячут, потому что прятаться не от кого: перебор стоит копейки, а ловить их некому.

Что из этого следует вам

Даже если сайта у вас нет, картина объясняет несколько вещей, которые обычно выглядят загадочно.

Роутер и умные устройства закрывайте первым делом. Такие же сканеры круглосуточно перебирают не только сайты, но и домашние адреса. Если у роутера открыт доступ из интернета, его найдут не потому, что вы кому-то интересны, а потому что робот идёт по списку. Как закрыть домашнюю сеть — отдельный разговор, но начинается он не с пароля, а с выключения удалённого доступа к панели роутера.

Пароль должен быть не только длинным, но и уникальным. Боты, стучавшиеся в нашу админку, ничего не угадывают — они перебирают готовые списки утёкших паролей. Мы как-то проверяли на обычном мини-компьютере, за сколько падает пароль: восьмизначный из одних цифр не прожил и десяти секунд. Против перебора по спискам не спасает ни длина, ни значки — спасает то, что этого пароля нет ни в одной утечке.

Не храните пароли в файлах «на всякий случай». Шестнадцать тысяч запросов к файлам .env — это индустрия, которая живёт на том, что кто-то однажды забыл закрыть такой файл. Домашняя заметка «пароли.txt» в облаке плоха по другой причине: она утекает вместе с аккаунтом или случайно открытой ссылкой.

Счётчик посещаемости всегда меньше, чем нагрузка на сервер. Если у знакомого сайт еле живой при трёх посетителях — скорее всего, дело не в посетителях. Счётчики вроде Метрики считают людей: они работают скриптом в браузере, а большинство роботов скрипты не выполняет — тех, что умеют, Метрика отсеивает отдельным фильтром. Сервер же считает всех подряд.

Фоновый обмен — норма сетевой жизни. Тот же принцип работает и дома: что именно техника делает за вашей спиной, мы разбирали отдельно.

Если коротко: из 121 тысячи обращений на живых читателей пришлась меньше четверти. Остальное — роботы поисковиков, сборщики текстов для чат-ботов, один прожорливый бот с лентой и толпа сканеров, методично дёргающих все двери подряд.

Если статья помогла — поделитесь с теми, кому может пригодиться. И заходите в наш канал в MAX, Telegram и Дзен — там анонсы новых материалов.