# Больше 120 тысяч запросов за две недели: посмотрели в логи своего сайта и выяснили, кто на него ходит

> Разобрали журнал веб-сервера построчно. Каждый третий запрос оказался проверкой на дыру в защите, один бот забрал 86% всего трафика, а самый активный «Googlebot» на поверку оказался вовсе не Google.


Каждый третий запрос к нашему сайту — проверка, не забыли ли мы запереть дверь. На живого человека с браузером похожа меньше четверти обращений.

Мы открыли журнал своего веб-сервера — файл, куда записывается каждое обращение к сайту, — и разобрали его построчно за две недели. Получилась картина интернета за кулисами.

<div class="callout callout-info">
<div class="callout-title">📋 Коротко</div>
За 14 суток сайт получил 121 684 запроса и отдал 9,2 гигабайта. Из них 7,9 гигабайта забрал один бот, скачавший один и тот же файл больше шести тысяч раз. Роботы ИИ-компаний дали почти одиннадцать тысяч обращений. Треть всех запросов оказалась попытками нащупать дыру, а самый активный «Googlebot» на поверку оказался сканером, который просто назвался чужим именем.
</div>

## Как мы мерили

Данные — журнал веб-сервера nginx со 2 по 15 сентября 2026 года, четырнадцать полных суток. Это не аналитика с графиками, а текстовый файл, куда сервер записывает каждое обращение: кто пришёл, что запросил, что получил, сколько байт ушло.

Каждую строку мы разобрали по представлению — так программа называет себя при обращении: Googlebot, YandexBot, GPTBot. Поисковые роботы пишут туда своё имя честно. Взломщики маскируются под браузер или под чужого робота, но выдают себя адресами, которые запрашивают.

<div class="callout callout-warning">
<div class="callout-title">⚠️ Насколько точны эти цифры</div>

Отличить человека от робота по журналу можно лишь приблизительно. Браузером мы считали то, что похоже на браузер по представлению, — а под браузер маскируются и сканеры. Поэтому наши 23% — скорее верхняя оценка доли людей.

Есть и обратный эффект: часть заходов живых читателей до журнала не доходит, потому что браузер берёт страницу из своих сохранённых копий. Какое из искажений сильнее, по журналу не скажешь, поэтому все цифры ниже — порядок величины, а не аптекарская точность.
</div>

## Самый активный Googlebot оказался не Google

Первый же результат пришлось перепроверять дважды.

По имени в журнале Googlebot выглядел абсолютным чемпионом: 23 тысячи обращений, больше всех. Но настоящий робот Google ходит с известных адресов — их список компания публикует. Сверка по адресам дала неожиданное: из 23 тысяч «гуглов» настоящих оказалось 84. Всё остальное — 23 012 запросов с девяти соседних адресов одного провайдера.

Чем занимался этот самозванец, видно по тому, что он спрашивал: `/.env`, `/secrets.json`, `/config.yml`, `/.yarnrc`. Ни один поисковик такие файлы не ищет — в них хранят пароли и ключи. То есть под именем Google на сайт ходил обычный сканер уязвимостей, и делал это так интенсивно, что едва не перевесил всю остальную статистику.

Вывод из этого простой и полезный: имя в журнале ничего не доказывает. Представиться Googlebot может кто угодно — это просто строка текста, которую программа отправляет о себе.

## Кто пришёл на самом деле

| Кто | Запросов | Отдано трафика |
|---|---|---|
| Mail.ru | 6 633 | 8 070 МБ |
| OpenAI (ChatGPT) | 3 044 | 22 МБ |
| Anthropic (Claude) | 2 486 | 13 МБ |
| Amazon | 1 614 | 17 МБ |
| Meta | 1 216 | 12 МБ |
| Perplexity | 1 201 | 4 МБ |
| Яндекс | 830 | 8 МБ |
| xAI (Grok) | 797 | 3 МБ |
| Apple | 527 | 2 МБ |
| ByteDance | 402 | 1 МБ |
| Google (настоящий) | 84 | 0,7 МБ |

Mail.ru сделал семь тысяч запросов и забрал восемь гигабайт — при том что все остальные боты вместе взяли меньше ста мегабайт. Разница в сто раз, а запросов у них сопоставимо. С этим стоило разобраться.

## Один бот и восемь гигабайт

У сайта есть служебный файл с лентой всех материалов — по нему работает подписка в приложениях-читалках. Весит он около полутора мегабайт, потому что содержит полные тексты статей.

Бот Mail.ru скачал его 6 394 раза за две недели. Примерно раз в три минуты, круглосуточно. Файл при этом почти не менялся: за две недели в нём появилось от силы пара десятков новых заголовков.

<div class="callout callout-fact">
<div class="callout-title">💸 Во что это обходится</div>

7,9 гигабайта — это 86% всего трафика сайта за период. На каждый мегабайт, прочитанный живыми людьми, пришлось шесть мегабайт, выкачанных одним ботом впустую.

Нам это ничего не стоило: тариф с запасом. Но у хостингов с оплатой за трафик такой гость превращается в строчку в счёте, а владелец сайта смотрит на сто читателей в сутки и не понимает, откуда гигабайты.

И скажу прямо: это плохо написанный бот. Google на такой же ленте спрашивает «менялось ли?» и уходит, получив «нет», — ответ весит несколько сотен байт. Умение не качать одно и то же по кругу придумали до изобретения этого робота.
</div>

Мы уже как-то [взвешивали, сколько мегабайт тратит обычный заход на сайт](https://tehprosto.ru/posts/skolko-trafika-sedaet-zahod-na-sayt/) — так вот, вежливый робот обходится дешевле человека в сотни раз, а невежливый съедает больше, чем вся аудитория.

## ИИ-боты уже ходят по всем

Самое заметное изменение в списке — компании, которых десять лет назад в нём не было вовсе.

OpenAI, Anthropic, Perplexity, Meta, Amazon, ByteDance и бот Grok вместе дали почти одиннадцать тысяч обращений за две недели. Это роботы, которые собирают тексты для обучения моделей и для ответов чат-ботов. Считай, каждый четвёртый заход робота сегодня — не от поисковика, а от ИИ-компании.

Когда чат-бот отвечает вам на вопрос о технике, ответ он мог собрать по статьям, которые до него скачал такой же робот. Отсюда вывод для всех, кто пишет в интернете: текст теперь читают не только люди и поисковики.

Ведут себя эти роботы по-разному. OpenAI и Anthropic заходят аккуратно: берут страницу, качают картинки, уходят. Amazon и ByteDance напористее, бегают по одним и тем же адресам чаще, чем те меняются. Общее у них одно: читателей они не приводят. Поисковик, забрав страницу, когда-нибудь покажет её человеку и приведёт его на сайт. Чат-бот перескажет ответ у себя. Читатель не придёт никогда.

Отказаться от такого гостя можно: в корне сайта лежит файл с правилами для роботов, имена ИИ-ботов вписываются туда отдельной строкой. Строчку эти боты воспринимают как просьбу — GPTBot и ClaudeBot её соблюдают, некоторые другие обходят, и гарантию даёт только блокировка на уровне сервера. Мы не вписывали: пока это выглядит как способ исчезнуть из ответов, которыми люди пользуются всё чаще.

<div class="callout callout-info">
<div class="callout-title">📲 Такие замеры мы делаем регулярно</div>

Проверяем обещания на цифрах и показываем, что вышло по факту. Подпишитесь на «Техпросто» в [MAX](https://max.ru/channel_tehprosto), [Telegram](https://t.me/tehprosto) или [Дзене](https://dzen.ru/tehprosto), и разборы будут приходить сами.
</div>

## А где Яндекс

Российский сайт на русском языке, про технику для российских читателей. Яндекс за две недели зашёл 830 раз — меньше, чем боты OpenAI, Anthropic и Perplexity по отдельности.

Дело не в запрете: правила для роботов у нас одинаковые для всех, никаких ограничений именно для Яндекса нет. Он просто заходит редко.

Яндекс обходит молодые сайты в последнюю очередь. Заглядывает, но толком не вычитывает. Пока это не изменится, потока читателей из поиска не будет — и это объясняет, почему первый год жизни нового сайта выглядит как разговор со стеной.

## Треть всех запросов — попытка взлома

Представьте человека, который идёт вдоль длинной парковки и дёргает по очереди все ручки. Не потому, что выбрал вашу машину, — просто одна из сотни окажется незапертой, и этого достаточно. Ровно так работают сканеры уязвимостей, и в журнале это видно построчно.

Мы посчитали обращения к адресам, которых на нашем сайте нет и быть не может: служебные файлы, панели администратора, конфигурации. Таких запросов оказалось 31 009 — 31% от всего.

| Что искали | Запросов | Зачем это взломщику |
|---|---|---|
| Файлы `.env` | 15 892 | Там хранят пароли к базам и ключи от сервисов |
| Файлы с названием config | 6 417 | Настройки сайта, тоже часто с паролями |
| Скрипты `.php` | 2 923 | Дыры в старых движках |
| Папка `.git` | 1 267 | Полная копия исходного кода сайта |
| Вход в WordPress | 1 574 | Подбор пароля к админке |
| Файлы с названием secrets | 881 | Ключи доступа к сторонним сервисам |

Сразу успокою: ни одного из этих файлов на сайте не существует. Наш сайт собран так, что страницы отдаются готовыми файлами, ни базы данных, ни панели администратора у него нет, и все 31 009 попыток получили в ответ «страница не найдена». Каждый пятый ответ сервера за две недели был именно таким — 20,5% всех обращений.

Отдельная ирония: полторы тысячи запросов искали панель WordPress на сайте, где WordPress никогда не стоял. Боты об этом не знают и идут по списку.

Часть сканеров даже не скрывается. В журнале честно представились двое: feroxbuster (2 048 запросов) перебирает адреса по словарю, ExchangeScanner (1 120) искал почтовые серверы Microsoft, которых у нас отродясь не было. Имя своё не прячут, потому что прятаться не от кого: перебор стоит копейки, а ловить их некому.

## Что из этого следует вам

Даже если сайта у вас нет, картина объясняет несколько вещей, которые обычно выглядят загадочно.

**Роутер и умные устройства закрывайте первым делом.** Такие же сканеры круглосуточно перебирают не только сайты, но и домашние адреса. Если у роутера открыт доступ из интернета, его найдут не потому, что вы кому-то интересны, а потому что робот идёт по списку. [Как закрыть домашнюю сеть](https://tehprosto.ru/guides/kak-zashchitit-wifi-router/) — отдельный разговор, но начинается он не с пароля, а с выключения удалённого доступа к панели роутера.

**Пароль должен быть не только длинным, но и уникальным.** Боты, стучавшиеся в нашу админку, ничего не угадывают — они перебирают готовые списки утёкших паролей. Мы как-то [проверяли на обычном мини-компьютере, за сколько падает пароль](https://tehprosto.ru/posts/za-skolko-vzlomayut-parol-eksperiment/): восьмизначный из одних цифр не прожил и десяти секунд. Против перебора по спискам не спасает ни длина, ни значки — спасает то, что этого пароля нет ни в одной утечке.

**Не храните пароли в файлах «на всякий случай».** Шестнадцать тысяч запросов к файлам `.env` — это индустрия, которая живёт на том, что кто-то однажды забыл закрыть такой файл. Домашняя заметка «пароли.txt» в облаке плоха по другой причине: она утекает вместе с аккаунтом или случайно открытой ссылкой.

**Счётчик посещаемости всегда меньше, чем нагрузка на сервер.** Если у знакомого сайт еле живой при трёх посетителях — скорее всего, дело не в посетителях. Счётчики вроде Метрики считают людей: они работают скриптом в браузере, а большинство роботов скрипты не выполняет — тех, что умеют, Метрика отсеивает отдельным фильтром. Сервер же считает всех подряд.

**Фоновый обмен — норма сетевой жизни.** Тот же принцип работает и дома: [что именно техника делает за вашей спиной](https://tehprosto.ru/posts/chto-tehnika-delaet-za-spinoy/), мы разбирали отдельно.

Если коротко: из 121 тысячи обращений на живых читателей пришлась меньше четверти. Остальное — роботы поисковиков, сборщики текстов для чат-ботов, один прожорливый бот с лентой и толпа сканеров, методично дёргающих все двери подряд.

*Если статья помогла — поделитесь с теми, кому может пригодиться. И заходите в наш канал в [MAX](https://max.ru/channel_tehprosto), [Telegram](https://t.me/tehprosto) и [Дзен](https://dzen.ru/tehprosto) — там анонсы новых материалов.*

