Каждый третий запрос к нашему сайту — проверка, не забыли ли мы запереть дверь. На живого человека с браузером похожа меньше четверти обращений.
Мы открыли журнал своего веб-сервера — файл, куда записывается каждое обращение к сайту, — и разобрали его построчно за две недели. Получилась картина интернета за кулисами.
Как мы мерили
Данные — журнал веб-сервера nginx со 2 по 15 сентября 2026 года, четырнадцать полных суток. Это не аналитика с графиками, а текстовый файл, куда сервер записывает каждое обращение: кто пришёл, что запросил, что получил, сколько байт ушло.
Каждую строку мы разобрали по представлению — так программа называет себя при обращении: Googlebot, YandexBot, GPTBot. Поисковые роботы пишут туда своё имя честно. Взломщики маскируются под браузер или под чужого робота, но выдают себя адресами, которые запрашивают.
Отличить человека от робота по журналу можно лишь приблизительно. Браузером мы считали то, что похоже на браузер по представлению, — а под браузер маскируются и сканеры. Поэтому наши 23% — скорее верхняя оценка доли людей.
Есть и обратный эффект: часть заходов живых читателей до журнала не доходит, потому что браузер берёт страницу из своих сохранённых копий. Какое из искажений сильнее, по журналу не скажешь, поэтому все цифры ниже — порядок величины, а не аптекарская точность.
Самый активный Googlebot оказался не Google
Первый же результат пришлось перепроверять дважды.
По имени в журнале Googlebot выглядел абсолютным чемпионом: 23 тысячи обращений, больше всех. Но настоящий робот Google ходит с известных адресов — их список компания публикует. Сверка по адресам дала неожиданное: из 23 тысяч «гуглов» настоящих оказалось 84. Всё остальное — 23 012 запросов с девяти соседних адресов одного провайдера.
Чем занимался этот самозванец, видно по тому, что он спрашивал: /.env, /secrets.json, /config.yml, /.yarnrc. Ни один поисковик такие файлы не ищет — в них хранят пароли и ключи. То есть под именем Google на сайт ходил обычный сканер уязвимостей, и делал это так интенсивно, что едва не перевесил всю остальную статистику.
Вывод из этого простой и полезный: имя в журнале ничего не доказывает. Представиться Googlebot может кто угодно — это просто строка текста, которую программа отправляет о себе.
Кто пришёл на самом деле
| Кто | Запросов | Отдано трафика |
|---|---|---|
| Mail.ru | 6 633 | 8 070 МБ |
| OpenAI (ChatGPT) | 3 044 | 22 МБ |
| Anthropic (Claude) | 2 486 | 13 МБ |
| Amazon | 1 614 | 17 МБ |
| Meta | 1 216 | 12 МБ |
| Perplexity | 1 201 | 4 МБ |
| Яндекс | 830 | 8 МБ |
| xAI (Grok) | 797 | 3 МБ |
| Apple | 527 | 2 МБ |
| ByteDance | 402 | 1 МБ |
| Google (настоящий) | 84 | 0,7 МБ |
Mail.ru сделал семь тысяч запросов и забрал восемь гигабайт — при том что все остальные боты вместе взяли меньше ста мегабайт. Разница в сто раз, а запросов у них сопоставимо. С этим стоило разобраться.
Один бот и восемь гигабайт
У сайта есть служебный файл с лентой всех материалов — по нему работает подписка в приложениях-читалках. Весит он около полутора мегабайт, потому что содержит полные тексты статей.
Бот Mail.ru скачал его 6 394 раза за две недели. Примерно раз в три минуты, круглосуточно. Файл при этом почти не менялся: за две недели в нём появилось от силы пара десятков новых заголовков.
7,9 гигабайта — это 86% всего трафика сайта за период. На каждый мегабайт, прочитанный живыми людьми, пришлось шесть мегабайт, выкачанных одним ботом впустую.
Нам это ничего не стоило: тариф с запасом. Но у хостингов с оплатой за трафик такой гость превращается в строчку в счёте, а владелец сайта смотрит на сто читателей в сутки и не понимает, откуда гигабайты.
И скажу прямо: это плохо написанный бот. Google на такой же ленте спрашивает «менялось ли?» и уходит, получив «нет», — ответ весит несколько сотен байт. Умение не качать одно и то же по кругу придумали до изобретения этого робота.
Мы уже как-то взвешивали, сколько мегабайт тратит обычный заход на сайт — так вот, вежливый робот обходится дешевле человека в сотни раз, а невежливый съедает больше, чем вся аудитория.
ИИ-боты уже ходят по всем
Самое заметное изменение в списке — компании, которых десять лет назад в нём не было вовсе.
OpenAI, Anthropic, Perplexity, Meta, Amazon, ByteDance и бот Grok вместе дали почти одиннадцать тысяч обращений за две недели. Это роботы, которые собирают тексты для обучения моделей и для ответов чат-ботов. Считай, каждый четвёртый заход робота сегодня — не от поисковика, а от ИИ-компании.
Когда чат-бот отвечает вам на вопрос о технике, ответ он мог собрать по статьям, которые до него скачал такой же робот. Отсюда вывод для всех, кто пишет в интернете: текст теперь читают не только люди и поисковики.
Ведут себя эти роботы по-разному. OpenAI и Anthropic заходят аккуратно: берут страницу, качают картинки, уходят. Amazon и ByteDance напористее, бегают по одним и тем же адресам чаще, чем те меняются. Общее у них одно: читателей они не приводят. Поисковик, забрав страницу, когда-нибудь покажет её человеку и приведёт его на сайт. Чат-бот перескажет ответ у себя. Читатель не придёт никогда.
Отказаться от такого гостя можно: в корне сайта лежит файл с правилами для роботов, имена ИИ-ботов вписываются туда отдельной строкой. Строчку эти боты воспринимают как просьбу — GPTBot и ClaudeBot её соблюдают, некоторые другие обходят, и гарантию даёт только блокировка на уровне сервера. Мы не вписывали: пока это выглядит как способ исчезнуть из ответов, которыми люди пользуются всё чаще.
Проверяем обещания на цифрах и показываем, что вышло по факту. Подпишитесь на «Техпросто» в MAX, Telegram или Дзене, и разборы будут приходить сами.
А где Яндекс
Российский сайт на русском языке, про технику для российских читателей. Яндекс за две недели зашёл 830 раз — меньше, чем боты OpenAI, Anthropic и Perplexity по отдельности.
Дело не в запрете: правила для роботов у нас одинаковые для всех, никаких ограничений именно для Яндекса нет. Он просто заходит редко.
Яндекс обходит молодые сайты в последнюю очередь. Заглядывает, но толком не вычитывает. Пока это не изменится, потока читателей из поиска не будет — и это объясняет, почему первый год жизни нового сайта выглядит как разговор со стеной.
Треть всех запросов — попытка взлома
Представьте человека, который идёт вдоль длинной парковки и дёргает по очереди все ручки. Не потому, что выбрал вашу машину, — просто одна из сотни окажется незапертой, и этого достаточно. Ровно так работают сканеры уязвимостей, и в журнале это видно построчно.
Мы посчитали обращения к адресам, которых на нашем сайте нет и быть не может: служебные файлы, панели администратора, конфигурации. Таких запросов оказалось 31 009 — 31% от всего.
| Что искали | Запросов | Зачем это взломщику |
|---|---|---|
Файлы .env |
15 892 | Там хранят пароли к базам и ключи от сервисов |
| Файлы с названием config | 6 417 | Настройки сайта, тоже часто с паролями |
Скрипты .php |
2 923 | Дыры в старых движках |
Папка .git |
1 267 | Полная копия исходного кода сайта |
| Вход в WordPress | 1 574 | Подбор пароля к админке |
| Файлы с названием secrets | 881 | Ключи доступа к сторонним сервисам |
Сразу успокою: ни одного из этих файлов на сайте не существует. Наш сайт собран так, что страницы отдаются готовыми файлами, ни базы данных, ни панели администратора у него нет, и все 31 009 попыток получили в ответ «страница не найдена». Каждый пятый ответ сервера за две недели был именно таким — 20,5% всех обращений.
Отдельная ирония: полторы тысячи запросов искали панель WordPress на сайте, где WordPress никогда не стоял. Боты об этом не знают и идут по списку.
Часть сканеров даже не скрывается. В журнале честно представились двое: feroxbuster (2 048 запросов) перебирает адреса по словарю, ExchangeScanner (1 120) искал почтовые серверы Microsoft, которых у нас отродясь не было. Имя своё не прячут, потому что прятаться не от кого: перебор стоит копейки, а ловить их некому.
Что из этого следует вам
Даже если сайта у вас нет, картина объясняет несколько вещей, которые обычно выглядят загадочно.
Роутер и умные устройства закрывайте первым делом. Такие же сканеры круглосуточно перебирают не только сайты, но и домашние адреса. Если у роутера открыт доступ из интернета, его найдут не потому, что вы кому-то интересны, а потому что робот идёт по списку. Как закрыть домашнюю сеть — отдельный разговор, но начинается он не с пароля, а с выключения удалённого доступа к панели роутера.
Пароль должен быть не только длинным, но и уникальным. Боты, стучавшиеся в нашу админку, ничего не угадывают — они перебирают готовые списки утёкших паролей. Мы как-то проверяли на обычном мини-компьютере, за сколько падает пароль: восьмизначный из одних цифр не прожил и десяти секунд. Против перебора по спискам не спасает ни длина, ни значки — спасает то, что этого пароля нет ни в одной утечке.
Не храните пароли в файлах «на всякий случай». Шестнадцать тысяч запросов к файлам .env — это индустрия, которая живёт на том, что кто-то однажды забыл закрыть такой файл. Домашняя заметка «пароли.txt» в облаке плоха по другой причине: она утекает вместе с аккаунтом или случайно открытой ссылкой.
Счётчик посещаемости всегда меньше, чем нагрузка на сервер. Если у знакомого сайт еле живой при трёх посетителях — скорее всего, дело не в посетителях. Счётчики вроде Метрики считают людей: они работают скриптом в браузере, а большинство роботов скрипты не выполняет — тех, что умеют, Метрика отсеивает отдельным фильтром. Сервер же считает всех подряд.
Фоновый обмен — норма сетевой жизни. Тот же принцип работает и дома: что именно техника делает за вашей спиной, мы разбирали отдельно.
Если коротко: из 121 тысячи обращений на живых читателей пришлась меньше четверти. Остальное — роботы поисковиков, сборщики текстов для чат-ботов, один прожорливый бот с лентой и толпа сканеров, методично дёргающих все двери подряд.
Если статья помогла — поделитесь с теми, кому может пригодиться. И заходите в наш канал в MAX, Telegram и Дзен — там анонсы новых материалов.