Статті ·

Аналіз логів сервера: куди насправді йде краулінг-бюджет

Як прочитати access.log і побачити, що Googlebot обходить сторінки фільтрів замість товарів. З прикладами рядків, поясненням формату й чесними межами методу.

Search Console показує підсумок: скільки сторінок просканували, скільки в індексі. Лог сервера показує факти — кожен запит бота з точністю до секунди й URL. Різниця між ними приблизно така сама, як між банківською випискою за місяць і списком покупок.

Найчастіша знахідка виглядає так: сайт має три тисячі товарів, з них у пошуку половина, а бот при цьому робить дві третини запитів до сторінок фільтрів, які взагалі не мають бути в індексі.

Що таке краулінг-бюджет простими словами

Googlebot не обходить сайт нескінченно. На кожен сайт він витрачає обмежений ресурс, і чим повільніше відповідає сервер, тим менше сторінок встигає. Якщо цей ресурс іде на /catalog/?filter=color-red, /catalog/?filter=price-500 і ще сотню комбінацій — на товари його не лишається.

Як виглядає рядок логу

Стандартний формат nginx і Apache — combined:

188.163.44.12 - - [01/Jul/2026:03:14:07 +0300] "GET /catalog/instrumenty/?filter=price-500 HTTP/1.1" 200 48211 "-" "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)"

Тут є все потрібне:

  • IP і час запиту;
  • метод і повний URI разом із query-рядком;
  • код відповіді й розмір;
  • User-Agent, за яким видно, що це Googlebot.

Ключова деталь — саме повний URI. Якщо відрізати query-рядок, сторінки фільтрів зіллються з базовою категорією, і головна проблема стане невидимою.

Де взяти лог

  1. nginx: /var/log/nginx/access.log — попросіть у хостера або адміністратора;
  2. Apache: /var/log/apache2/access.log;
  3. Cloudflare: Logpush у форматі JSON;
  4. хостинги з панеллю зазвичай мають розділ «Логи» з завантаженням за період.

Достатньо 7–30 днів. Більший період дає точнішу картину, але й перший тиждень уже показує розподіл.

Що шукати

Розподіл по типах сторінок

Згрупуйте запити бота за типом: товари, категорії, фільтри, пагінація, статика, службові. Здоровий розподіл — більшість на товарах і категоріях. Якщо фільтри й пагінація разом дають понад 20%, це вже привід закрити їх у robots.txt.

Повторні 404 і 5xx

Бот повертається на зниклу сторінку місяцями. Якщо один URL віддає 404 понад три рази за період — це не випадковість, а десь лишилося посилання. Ставте 301 на актуальну сторінку або 410, якщо видалили назавжди: 410 бот сприймає як остаточне і перестає ходити швидше.

Сторінки, куди бот не заходив

Звірте список URL із sitemap із тим, що є в логах. Те, чого бот не відвідав за місяць, майже завжди має проблему з внутрішньою перелінковкою: на цю сторінку ніхто не посилається, і бот доходить до неї в останню чергу.

Сторінки-сироти

Зворотний випадок: бот ходить на URL, якого немає в sitemap. Іноді це забуті сторінки, іноді — сміття, що генерується скриптом. І те, і те варто побачити.

Чесна межа методу

Боти визначаються за User-Agent, а його легко підробити — цим користуються парсери, щоб їх не блокували. Тому цифри «Googlebot» завжди є верхньою оцінкою.

Повна перевірка робиться через зворотний DNS: IP має резолвитись у домен googlebot.com, а той — назад у той самий IP. З браузера це неможливо, тому в нашому аналізаторі цього кроку немає. Для оцінки розподілу бюджету це не критично: підроблені боти зазвичай ходять по тих самих сторінках, що й справжні.

Як подивитись свій лог

Перетягніть access.log у аналізатор логів. Файл обробляється у вашому браузері й нікуди не відправляється — це важливо, бо в логах клієнтів є IP-адреси відвідувачів.

Додатково можна вставити список URL із sitemap: тоді ви побачите ще й що бот не обходить і які сторінки-сироти він знаходить.