Analýza log súborov: ako zistiť, čo robot na vašom webe naozaj robí

Analýza logov je jediný spôsob, ako sa dozvedieť, čo vyhľadávací robot na webe skutočne robí: ktoré stránky navštevuje, ako často, koľko času im venuje a ktoré ignoruje úplne. Pri malom webe to riešiť netreba. Pri webe s tisíckami URL odhalí problémy, ktoré sa inak nedajú vidieť.

1. Čo je log a prečo je iný než Search Console

Server zaznamenáva každý prístup na web, od človeka aj od robota. Jeden riadok logu vyzerá zhruba takto:

66.249.66.1 - - [30/Aug/2026:14:22:07 +0200] "GET /blog/seo-audit/ HTTP/1.1" 200 18432 "-" "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)"

Prečítate z neho, kto prišiel (IP adresa a identifikácia prehliadača), kedy, na akú adresu, s akým výsledkom (200 = v poriadku, 404 = nenájdené) a koľko dát sa prenieslo.

Rozdiel oproti Google Search Console je zásadný:

Search ConsoleServerové logy
Rozsah dátSúhrn a vzorkaKaždý jeden prístup
Konkrétne adresyPrehľad Štatistiky prehľadávania, dostupný len pre služby na koreňovej úrovni doményÚplný záznam všetkých prístupov
RobotyLen GooglebotVšetky vrátane AI robotov a škodlivých
HistóriaPodľa zvoleného obdobia v prehľade (predvolene tri mesiace)Podľa nastavenia hostingu, často len týždne
NáročnosťOtvoríte a čítateTreba získať súbor a spracovať ho

2. Ako sa k logom dostať

Postup závisí od hostingu, ale býva jednoduchší, než sa čaká:

  • Zdieľaný hosting. V administrácii hľadajte „Logy“, „Prístupové logy“ alebo access_log. Niektorí poskytovatelia ich ponúkajú na stiahnutie, u iných ich treba najprv zapnúť.
  • Vlastný server. Súbory sú spravidla v /var/log/nginx/access.log alebo /var/log/apache2/access.log.
  • Cloudflare a podobné služby. Majú vlastné prehľady prevádzky robotov, ktoré netreba spracúvať ručne.

⚠️ Logy sa často mažú po niekoľkých dňoch. Ak plánujete analýzu, najprv si overte, ako dlho ich hosting uchováva, a prípadne požiadajte o predĺženie. Podľa mojej praxe je zmysluplná vzorka aspoň mesiac, pri kratšom období skreslia výsledok náhodné výkyvy. Nie je to hranica od Google.

Overte si pravosť robota. Identifikáciu prehliadača si môže nastaviť ktokoľvek, preto sa podľa nej pravosť robota určiť nedá. Google popisuje overenie spätným prekladom IP adresy: musí viesť na doménu googlebot.com, google.com alebo googleusercontent.com a spätný preklad tejto domény musí vrátiť pôvodnú IP (Verifying Googlebot). Ak tretiu doménu vynecháte, časť pravých požiadaviek vyhodnotíte ako falošné.

3. Čo v nich hľadať

Nejde o čítanie riadok po riadku, ale o zodpovedanie piatich otázok:

OtázkaČo prezradí
Ktoré URL robot navštevuje najčastejšie?Ak sú to filtre, zoradenia alebo parametre, kapacita sa míňa na balast; riešenie nájdete v článku o stránkovaní a filtroch.
Ktoré dôležité URL nenavštevuje vôbec?Stránka, ktorú robot nikdy neprešiel, sa nemôže umiestniť. Príčinou býva chýbajúce interné prelinkovanie.
Koľko prístupov končí chybou?Vysoký podiel odpovedí 404 a 500 znamená premrhanú kapacitu prehľadávania. Google ku kódu 404 dodáva, že je to silný signál danú adresu už neprechádzať, takže sa vám takto môžu stratiť aj adresy, ktoré ste obnoviť chceli.
Ako často sa vracia k novému obsahu?Ukazuje, ako rýchlo sa prejavia zmeny. Zriedkavé návštevy znamenajú pomalú reakciu na aktualizácie.
Chodia roboty na to, čo majú zakázané?Prístupy na URL zakázané v robots.txt naznačujú chybu v zápise pravidiel.

💡 Typický nález pri e-shopoch s filtrami: prevažná časť návštev robota smeruje na parametrické adresy, teda na kombinácie filtrov a zoradení, a produktové stránky, od ktorých závisia tržby, dostanú zvyšok. Konkrétny podiel tu neuvádzame, overiteľné číslo preň nemáme a web od webu sa líši. Zistíte ho však z vlastných logov za pár minút, z prehľadov Search Console sa vyčítať nedá.

4. Pre koho to má zmysel

Analýza logov nie je práca pre každý web, konkrétne:

Najprv hranice, ktoré uvádza sám Google. V dokumentácii ku kapacite prehľadávania píše, že riešiť ju má zmysel pri weboch s viac než milión stránkami, ktorých obsah sa mení aspoň raz týždenne, alebo s viac než 10 000 stránkami, ktorých obsah sa mení denne. Menšie weby sa podľa neho majú sústrediť na indexovanie, nie na kapacitu prehľadávania.

Analýza logov však odpovedá aj na iné otázky než na kapacitu, napríklad či robot nechodí tam, kam nemá. Nižšie je moje odporúčanie, kedy sa oplatí do nej pustiť. Sú to moje pracovné hranice, nie čísla od Google:

  • Malý web do stoviek stránok: spravidla netreba. Robot ho prejde bez problémov a vystačíte si so Search Console.
  • Web s tisíckami stránok: oplatí sa, najmä ak sa nový obsah dlho neindexuje.
  • E-shop s filtrami: áno. Práve tu býva vidieť, koľko kapacity spotrebujú parametrické adresy.
  • Po migrácii webu: áno, hneď. Logy ukážu, či robot našiel novú štruktúru a či presmerovania fungujú.

Na spracovanie stačia bežné nástroje. Malý súbor otvoríte v tabuľkovom procesore, väčší spracujete jednoduchým skriptom alebo špecializovaným analyzátorom logov. Cieľom nie je krásny report, ale zoznam URL, ktoré robot zbytočne prechádza, a zoznam tých, ktoré prehliada.

Analýza logov je pokročilá technická práca. Základ, ktorý jej predchádza, nájdete v prehľade SEO optimalizácia.

Súvisiace: SEO audit · Stránkovanie a filtre · Robots.txt a sitemap

Zdroje

  • Google Search Central: Verifying Googlebot and other Google crawlers – postup overenia pravosti robota spätným prekladom IP adresy (overené 8/2026).
  • Google Search Central: Managing crawl budget for large sites, hranice viac než milión stránok pri týždennej zmene obsahu a viac než 10 000 stránok pri dennej zmene, a stavový kód 404 ako silný signál adresu už neprechádzať.
  • Nápoveda Search Console: Crawl Stats report, čo o prevádzke robotov ukazuje Search Console; prehľad je dostupný len pre služby na koreňovej úrovni domény.
  • Nápoveda Search Console: Performance report, predvolené obdobie prehľadu Výkon sú posledné tri mesiace.

Časté otázky

Potrebuje analýzu logov aj malý web?

Spravidla nie. Web do zhruba sto stránok robot prejde bez problémov celý a všetko podstatné uvidíte v Google Search Console. Zmysel to dáva pri webe nad tisíc URL, pri e-shope s filtrami a vždy po migrácii webu.

Ako zistím, či je Googlebot v logu pravý?

Identifikácia prehliadača sa dá sfalšovať, preto sa overuje IP adresa. Spätný preklad IP musí viesť na doménu googlebot.com alebo google.com a preklad tejto domény späť musí vrátiť pôvodnú IP adresu. Postup je opísaný v dokumentácii Google.

Kde nájdem logy, keď mám bežný hosting?

V administrácii hostingu hľadajte položku Logy alebo Prístupové logy, prípadne súbor access_log cez FTP. Niektorí poskytovatelia ich musia najprv zapnúť. Overte si aj to, ako dlho sa uchovávajú, často len niekoľko dní.

Čo je najčastejší nález pri analýze logov?

Že prevažná časť kapacity robota ide na parametrické URL (kombinácie filtrov, zoradenia a stránkovanie), zatiaľ čo produktové a obsahové stránky dostanú len zvyšok. Riešením je obmedziť indexáciu a prechádzanie týchto kombinácií.