<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0"
  xmlns:atom="http://www.w3.org/2005/Atom"
  xmlns:content="http://purl.org/rss/1.0/modules/content/"
  xmlns:media="http://search.yahoo.com/mrss/">
  <channel>
    <title>Сайт on ТехПросто</title>
    <link>https://tehprosto.ru/tags/%D1%81%D0%B0%D0%B9%D1%82/</link>
    <description>Блог о технологиях для обычных людей: гайды по смартфонам, советы по безопасности, обзоры гаджетов и подборки техники — простым языком, без жаргона</description>
    <image>
      <title>ТехПросто</title>
      <url>https://tehprosto.ru/images/og-default.webp</url>
      <link>https://tehprosto.ru/images/og-default.webp</link>
    </image>
    <generator>Hugo</generator>
    <language>ru</language>
    <lastBuildDate>Wed, 16 Sep 2026 18:00:02 +0300</lastBuildDate>
    <atom:link href="https://tehprosto.ru/tags/%D1%81%D0%B0%D0%B9%D1%82/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Больше 120 тысяч запросов за две недели: посмотрели в логи своего сайта и выяснили, кто на него ходит</title>
      <link>https://tehprosto.ru/posts/kto-hodit-na-sayt-eksperiment/</link>
      <pubDate>Wed, 16 Sep 2026 18:00:02 +0300</pubDate>
      <guid>https://tehprosto.ru/posts/kto-hodit-na-sayt-eksperiment/</guid>
      <description>Разобрали журнал веб-сервера построчно. Каждый третий запрос оказался проверкой на дыру в защите, один бот забрал 86% всего трафика, а самый активный «Googlebot» на поверку оказался вовсе не Google.</description>
      <enclosure url="https://tehprosto.ru/images/kto-hodit-na-sayt-eksperiment/cover.webp" type="image/webp" length="0" />
      <category>интернет</category>
      <category>боты</category>
      <category>безопасность</category>
      <category>эксперимент</category>
      <category>сайт</category><content:encoded><![CDATA[<p>Каждый третий запрос к нашему сайту — проверка, не забыли ли мы запереть дверь. На живого человека с браузером похожа меньше четверти обращений.</p>
<p>Мы открыли журнал своего веб-сервера — файл, куда записывается каждое обращение к сайту, — и разобрали его построчно за две недели. Получилась картина интернета за кулисами.</p>
<div class="callout callout-info">
<div class="callout-title">📋 Коротко</div>
За 14 суток сайт получил 121 684 запроса и отдал 9,2 гигабайта. Из них 7,9 гигабайта забрал один бот, скачавший один и тот же файл больше шести тысяч раз. Роботы ИИ-компаний дали почти одиннадцать тысяч обращений. Треть всех запросов оказалась попытками нащупать дыру, а самый активный «Googlebot» на поверку оказался сканером, который просто назвался чужим именем.
</div>
<h2 id="как-мы-мерили">Как мы мерили</h2>
<p>Данные — журнал веб-сервера nginx со 2 по 15 сентября 2026 года, четырнадцать полных суток. Это не аналитика с графиками, а текстовый файл, куда сервер записывает каждое обращение: кто пришёл, что запросил, что получил, сколько байт ушло.</p>
<p>Каждую строку мы разобрали по представлению — так программа называет себя при обращении: Googlebot, YandexBot, GPTBot. Поисковые роботы пишут туда своё имя честно. Взломщики маскируются под браузер или под чужого робота, но выдают себя адресами, которые запрашивают.</p>
<div class="callout callout-warning">
<div class="callout-title">⚠️ Насколько точны эти цифры</div>
<p>Отличить человека от робота по журналу можно лишь приблизительно. Браузером мы считали то, что похоже на браузер по представлению, — а под браузер маскируются и сканеры. Поэтому наши 23% — скорее верхняя оценка доли людей.</p>
<p>Есть и обратный эффект: часть заходов живых читателей до журнала не доходит, потому что браузер берёт страницу из своих сохранённых копий. Какое из искажений сильнее, по журналу не скажешь, поэтому все цифры ниже — порядок величины, а не аптекарская точность.</p>
</div>
<h2 id="самый-активный-googlebot-оказался-не-google">Самый активный Googlebot оказался не Google</h2>
<p>Первый же результат пришлось перепроверять дважды.</p>
<p>По имени в журнале Googlebot выглядел абсолютным чемпионом: 23 тысячи обращений, больше всех. Но настоящий робот Google ходит с известных адресов — их список компания публикует. Сверка по адресам дала неожиданное: из 23 тысяч «гуглов» настоящих оказалось 84. Всё остальное — 23 012 запросов с девяти соседних адресов одного провайдера.</p>
<p>Чем занимался этот самозванец, видно по тому, что он спрашивал: <code>/.env</code>, <code>/secrets.json</code>, <code>/config.yml</code>, <code>/.yarnrc</code>. Ни один поисковик такие файлы не ищет — в них хранят пароли и ключи. То есть под именем Google на сайт ходил обычный сканер уязвимостей, и делал это так интенсивно, что едва не перевесил всю остальную статистику.</p>
<p>Вывод из этого простой и полезный: имя в журнале ничего не доказывает. Представиться Googlebot может кто угодно — это просто строка текста, которую программа отправляет о себе.</p>
<h2 id="кто-пришёл-на-самом-деле">Кто пришёл на самом деле</h2>
<table>
  <thead>
      <tr>
          <th>Кто</th>
          <th>Запросов</th>
          <th>Отдано трафика</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>Mail.ru</td>
          <td>6 633</td>
          <td>8 070 МБ</td>
      </tr>
      <tr>
          <td>OpenAI (ChatGPT)</td>
          <td>3 044</td>
          <td>22 МБ</td>
      </tr>
      <tr>
          <td>Anthropic (Claude)</td>
          <td>2 486</td>
          <td>13 МБ</td>
      </tr>
      <tr>
          <td>Amazon</td>
          <td>1 614</td>
          <td>17 МБ</td>
      </tr>
      <tr>
          <td>Meta</td>
          <td>1 216</td>
          <td>12 МБ</td>
      </tr>
      <tr>
          <td>Perplexity</td>
          <td>1 201</td>
          <td>4 МБ</td>
      </tr>
      <tr>
          <td>Яндекс</td>
          <td>830</td>
          <td>8 МБ</td>
      </tr>
      <tr>
          <td>xAI (Grok)</td>
          <td>797</td>
          <td>3 МБ</td>
      </tr>
      <tr>
          <td>Apple</td>
          <td>527</td>
          <td>2 МБ</td>
      </tr>
      <tr>
          <td>ByteDance</td>
          <td>402</td>
          <td>1 МБ</td>
      </tr>
      <tr>
          <td>Google (настоящий)</td>
          <td>84</td>
          <td>0,7 МБ</td>
      </tr>
  </tbody>
</table>
<p>Mail.ru сделал семь тысяч запросов и забрал восемь гигабайт — при том что все остальные боты вместе взяли меньше ста мегабайт. Разница в сто раз, а запросов у них сопоставимо. С этим стоило разобраться.</p>
<h2 id="один-бот-и-восемь-гигабайт">Один бот и восемь гигабайт</h2>
<p>У сайта есть служебный файл с лентой всех материалов — по нему работает подписка в приложениях-читалках. Весит он около полутора мегабайт, потому что содержит полные тексты статей.</p>
<p>Бот Mail.ru скачал его 6 394 раза за две недели. Примерно раз в три минуты, круглосуточно. Файл при этом почти не менялся: за две недели в нём появилось от силы пара десятков новых заголовков.</p>
<div class="callout callout-fact">
<div class="callout-title">💸 Во что это обходится</div>
<p>7,9 гигабайта — это 86% всего трафика сайта за период. На каждый мегабайт, прочитанный живыми людьми, пришлось шесть мегабайт, выкачанных одним ботом впустую.</p>
<p>Нам это ничего не стоило: тариф с запасом. Но у хостингов с оплатой за трафик такой гость превращается в строчку в счёте, а владелец сайта смотрит на сто читателей в сутки и не понимает, откуда гигабайты.</p>
<p>И скажу прямо: это плохо написанный бот. Google на такой же ленте спрашивает «менялось ли?» и уходит, получив «нет», — ответ весит несколько сотен байт. Умение не качать одно и то же по кругу придумали до изобретения этого робота.</p>
</div>
<p>Мы уже как-то <a href="https://tehprosto.ru/posts/skolko-trafika-sedaet-zahod-na-sayt/">взвешивали, сколько мегабайт тратит обычный заход на сайт</a> — так вот, вежливый робот обходится дешевле человека в сотни раз, а невежливый съедает больше, чем вся аудитория.</p>
<h2 id="ии-боты-уже-ходят-по-всем">ИИ-боты уже ходят по всем</h2>
<p>Самое заметное изменение в списке — компании, которых десять лет назад в нём не было вовсе.</p>
<p>OpenAI, Anthropic, Perplexity, Meta, Amazon, ByteDance и бот Grok вместе дали почти одиннадцать тысяч обращений за две недели. Это роботы, которые собирают тексты для обучения моделей и для ответов чат-ботов. Считай, каждый четвёртый заход робота сегодня — не от поисковика, а от ИИ-компании.</p>
<p>Когда чат-бот отвечает вам на вопрос о технике, ответ он мог собрать по статьям, которые до него скачал такой же робот. Отсюда вывод для всех, кто пишет в интернете: текст теперь читают не только люди и поисковики.</p>
<p>Ведут себя эти роботы по-разному. OpenAI и Anthropic заходят аккуратно: берут страницу, качают картинки, уходят. Amazon и ByteDance напористее, бегают по одним и тем же адресам чаще, чем те меняются. Общее у них одно: читателей они не приводят. Поисковик, забрав страницу, когда-нибудь покажет её человеку и приведёт его на сайт. Чат-бот перескажет ответ у себя. Читатель не придёт никогда.</p>
<p>Отказаться от такого гостя можно: в корне сайта лежит файл с правилами для роботов, имена ИИ-ботов вписываются туда отдельной строкой. Строчку эти боты воспринимают как просьбу — GPTBot и ClaudeBot её соблюдают, некоторые другие обходят, и гарантию даёт только блокировка на уровне сервера. Мы не вписывали: пока это выглядит как способ исчезнуть из ответов, которыми люди пользуются всё чаще.</p>
<div class="callout callout-info">
<div class="callout-title">📲 Такие замеры мы делаем регулярно</div>
<p>Проверяем обещания на цифрах и показываем, что вышло по факту. Подпишитесь на «Техпросто» в <a href="https://max.ru/channel_tehprosto">MAX</a>, <a href="https://t.me/tehprosto">Telegram</a> или <a href="https://dzen.ru/tehprosto">Дзене</a>, и разборы будут приходить сами.</p>
</div>
<h2 id="а-где-яндекс">А где Яндекс</h2>
<p>Российский сайт на русском языке, про технику для российских читателей. Яндекс за две недели зашёл 830 раз — меньше, чем боты OpenAI, Anthropic и Perplexity по отдельности.</p>
<p>Дело не в запрете: правила для роботов у нас одинаковые для всех, никаких ограничений именно для Яндекса нет. Он просто заходит редко.</p>
<p>Яндекс обходит молодые сайты в последнюю очередь. Заглядывает, но толком не вычитывает. Пока это не изменится, потока читателей из поиска не будет — и это объясняет, почему первый год жизни нового сайта выглядит как разговор со стеной.</p>
<h2 id="треть-всех-запросов--попытка-взлома">Треть всех запросов — попытка взлома</h2>
<p>Представьте человека, который идёт вдоль длинной парковки и дёргает по очереди все ручки. Не потому, что выбрал вашу машину, — просто одна из сотни окажется незапертой, и этого достаточно. Ровно так работают сканеры уязвимостей, и в журнале это видно построчно.</p>
<p>Мы посчитали обращения к адресам, которых на нашем сайте нет и быть не может: служебные файлы, панели администратора, конфигурации. Таких запросов оказалось 31 009 — 31% от всего.</p>
<table>
  <thead>
      <tr>
          <th>Что искали</th>
          <th>Запросов</th>
          <th>Зачем это взломщику</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>Файлы <code>.env</code></td>
          <td>15 892</td>
          <td>Там хранят пароли к базам и ключи от сервисов</td>
      </tr>
      <tr>
          <td>Файлы с названием config</td>
          <td>6 417</td>
          <td>Настройки сайта, тоже часто с паролями</td>
      </tr>
      <tr>
          <td>Скрипты <code>.php</code></td>
          <td>2 923</td>
          <td>Дыры в старых движках</td>
      </tr>
      <tr>
          <td>Папка <code>.git</code></td>
          <td>1 267</td>
          <td>Полная копия исходного кода сайта</td>
      </tr>
      <tr>
          <td>Вход в WordPress</td>
          <td>1 574</td>
          <td>Подбор пароля к админке</td>
      </tr>
      <tr>
          <td>Файлы с названием secrets</td>
          <td>881</td>
          <td>Ключи доступа к сторонним сервисам</td>
      </tr>
  </tbody>
</table>
<p>Сразу успокою: ни одного из этих файлов на сайте не существует. Наш сайт собран так, что страницы отдаются готовыми файлами, ни базы данных, ни панели администратора у него нет, и все 31 009 попыток получили в ответ «страница не найдена». Каждый пятый ответ сервера за две недели был именно таким — 20,5% всех обращений.</p>
<p>Отдельная ирония: полторы тысячи запросов искали панель WordPress на сайте, где WordPress никогда не стоял. Боты об этом не знают и идут по списку.</p>
<p>Часть сканеров даже не скрывается. В журнале честно представились двое: feroxbuster (2 048 запросов) перебирает адреса по словарю, ExchangeScanner (1 120) искал почтовые серверы Microsoft, которых у нас отродясь не было. Имя своё не прячут, потому что прятаться не от кого: перебор стоит копейки, а ловить их некому.</p>
<h2 id="что-из-этого-следует-вам">Что из этого следует вам</h2>
<p>Даже если сайта у вас нет, картина объясняет несколько вещей, которые обычно выглядят загадочно.</p>
<p><strong>Роутер и умные устройства закрывайте первым делом.</strong> Такие же сканеры круглосуточно перебирают не только сайты, но и домашние адреса. Если у роутера открыт доступ из интернета, его найдут не потому, что вы кому-то интересны, а потому что робот идёт по списку. <a href="https://tehprosto.ru/guides/kak-zashchitit-wifi-router/">Как закрыть домашнюю сеть</a> — отдельный разговор, но начинается он не с пароля, а с выключения удалённого доступа к панели роутера.</p>
<p><strong>Пароль должен быть не только длинным, но и уникальным.</strong> Боты, стучавшиеся в нашу админку, ничего не угадывают — они перебирают готовые списки утёкших паролей. Мы как-то <a href="https://tehprosto.ru/posts/za-skolko-vzlomayut-parol-eksperiment/">проверяли на обычном мини-компьютере, за сколько падает пароль</a>: восьмизначный из одних цифр не прожил и десяти секунд. Против перебора по спискам не спасает ни длина, ни значки — спасает то, что этого пароля нет ни в одной утечке.</p>
<p><strong>Не храните пароли в файлах «на всякий случай».</strong> Шестнадцать тысяч запросов к файлам <code>.env</code> — это индустрия, которая живёт на том, что кто-то однажды забыл закрыть такой файл. Домашняя заметка «пароли.txt» в облаке плоха по другой причине: она утекает вместе с аккаунтом или случайно открытой ссылкой.</p>
<p><strong>Счётчик посещаемости всегда меньше, чем нагрузка на сервер.</strong> Если у знакомого сайт еле живой при трёх посетителях — скорее всего, дело не в посетителях. Счётчики вроде Метрики считают людей: они работают скриптом в браузере, а большинство роботов скрипты не выполняет — тех, что умеют, Метрика отсеивает отдельным фильтром. Сервер же считает всех подряд.</p>
<p><strong>Фоновый обмен — норма сетевой жизни.</strong> Тот же принцип работает и дома: <a href="https://tehprosto.ru/posts/chto-tehnika-delaet-za-spinoy/">что именно техника делает за вашей спиной</a>, мы разбирали отдельно.</p>
<p>Если коротко: из 121 тысячи обращений на живых читателей пришлась меньше четверти. Остальное — роботы поисковиков, сборщики текстов для чат-ботов, один прожорливый бот с лентой и толпа сканеров, методично дёргающих все двери подряд.</p>
<p><em>Если статья помогла — поделитесь с теми, кому может пригодиться. И заходите в наш канал в <a href="https://max.ru/channel_tehprosto">MAX</a>, <a href="https://t.me/tehprosto">Telegram</a> и <a href="https://dzen.ru/tehprosto">Дзен</a> — там анонсы новых материалов.</em></p>
]]></content:encoded>
    </item>
  </channel>
</rss>
