Robots.txt a sitemap.xml: ako riadiť, čo Google indexuje

Robots.txt hovorí robotom, čo smú prehľadávať, sitemap.xml im ponúka zoznam adries, ktoré chcete mať v indexe. Kľúčové je nezameniť ich úlohy: Google výslovne uvádza, že robots.txt nie je nástroj na to, aby sa stránka nedostala do vyhľadávania, na to slúži značka noindex alebo ochrana heslom. Tento návod vysvetľuje oba súbory, ich limity a chyby, ktoré dokážu web vyradiť z výsledkov.

1. Čo je robots.txt

Robots.txt je jednoduchý textový súbor umiestnený v koreni webu (napríklad vasadomena.sk/robots.txt). Je to prvá vec, ktorú robot pri návšteve webu prečíta – a hovorí mu, ktoré časti webu smie a nesmie prehľadávať.

Jeho obsah je veľmi jednoduchý. Uvediete, pre ktorého robota pravidlo platí (User-agent) a čo mu zakazujete (Disallow) alebo povoľujete (Allow). Bežný web nepotrebuje zložité pravidlá, často stačí povoliť všetko a odkázať na mapu stránok. Google v dokumentácii uvádza, že súbor slúži predovšetkým na riadenie prevádzky robotov, aby web nezahltili požiadavkami.

⚠️ Pozor na jediný riadok. Zápis Disallow: / zakáže prehľadávanie celého webu. Stáva sa to najčastejšie pri prechode z testovacej verzie na ostrú – na testovacom webe je zákaz správny, no ak sa prekopíruje na ostrý web, prestane sa indexovať všetko. Po každom spustení nového webu si robots.txt skontrolujte ako prvé.

2. Zákaz prehľadávania nie je noindex

Toto je najčastejšie nedorozumenie okolo robots.txt. Súbor riadi prehľadávanie (crawling), nie indexáciu. Rozdiel je zásadný:

NástrojČo spravíKedy ho použiť
robots.txt – DisallowZakáže robotovi stránku prejsť. Stránka sa aj tak môže objaviť vo výsledkoch (bez popisu), ak na ňu vedú odkazy.Šetrenie kapacity na nezmyselných sekciách (napr. interné vyhľadávanie)
značka noindexSpoľahlivo vylúči stránku z indexu – ale robot ju musí najprv prejsť, aby značku videl.Keď stránka naozaj nemá byť vo výsledkoch

Z toho vyplýva dôležité pravidlo: ak chcete stránku dostať von z vyhľadávania, použite noindex a nezakazujte ju zároveň v robots.txt. Keby ste ju zakázali, robot by ju neprešiel, značku noindex by nikdy nevidel a stránka by mohla vo výsledkoch zostať. Google to formuluje priamo: robots.txt nie je nástroj na to, aby sa stránka nedostala do Google, na to slúži noindex, ochrana heslom alebo odstránenie stránky. Dodáva tiež, že zablokovanie stránky vylúči z prehľadávania aj obrázky, videá a súbory PDF na nej, ak na ne neodkazujú iné, povolené stránky.

3. Čo je sitemap.xml

Sitemap.xml (mapa stránok) je zoznam adries, ktoré chcete mať zaindexované. Má podobu súboru vo formáte XML, kde pri každej adrese môžete uviesť aj dátum poslednej zmeny (lastmod). Značky <priority> a <changefreq> Google ignoruje, takže ich vypĺňať netreba. Hodnotu lastmod naopak používa, ak je dôsledná a overiteľná, teda ak zodpovedá skutočnej poslednej podstatnej zmene stránky.

Sitemap negarantuje indexovanie. Google uvádza, že odoslanie mapy stránok je iba nápoveda a nezaručuje, že ju stiahne alebo použije na prehľadávanie adries. Zároveň platia technické limity: jeden súbor môže mať najviac 50 MB v nekomprimovanej podobe alebo 50 000 adries. Väčší web si mapu rozdelí na viac súborov a zastreší ich indexovým súborom máp.

Kedy ju teda potrebujete? Google odpovedá jasne: pri správne prelinkovanom webe väčšinu stránok objaví aj bez nej, sitemapa pomáha pri veľkých, nových alebo zložitejších weboch a pri stránkach, na ktoré vedie málo interných odkazov.

💡 Do sitemap patria len stránky, ktoré chcete v indexe. Nemali by v nej byť presmerované adresy, chybové stránky (404), stránky so značkou noindex ani neplnohodnotné varianty (napríklad filtrované URL). Nepresná sitemap znižuje dôveru vyhľadávača v jej obsah.

4. Ako sitemap udržiavať a odoslať

Najväčšia slabina map stránok je zastaranosť – pri ručnom vytváraní sa na aktualizáciu po pridaní obsahu ľahko zabudne. Preto by mala sitemap vznikať automaticky: väčšina redakčných systémov ju generuje sama (často cez SEO doplnok) a pri statických weboch to zvládne generátor pri každom zostavení.

Keď mapu máte, dajte o nej vedieť vyhľadávaču dvomi spôsobmi:

  • Odkazom v robots.txt – pridajte riadok Sitemap: https://vasadomena.sk/sitemap.xml. Robot ju tak nájde sám.
  • Odoslaním v Google Search Console – v sekcii Mapy stránok. Zároveň uvidíte, či ju Google spracoval bez chýb a koľko adries z nej pozná.

Prečítajte si viac: Google Search Console: návod pre začiatočníkov

5. Najčastejšie chyby

  • Zabudnutý zákaz z testovacej verzie. Disallow: / na ostrom webe zastaví celé SEO. Kontrolujte po každom spustení.
  • Blokovanie CSS a JavaScriptu. Ak robotovi zakážete tieto súbory, nedokáže stránku vykresliť tak, ako ju vidí návštevník, a posúdi ju podľa neúplného obrazu.
  • Snaha skryť súkromné údaje cez robots.txt. Súbor je verejný a ktokoľvek si ho prečíta. Google odporúča citlivé sekcie chrániť heslom alebo značkou noindex, nie zákazom v robots.txt.
  • Vypĺňanie priority a changefreq. Google tieto hodnoty ignoruje, takže ide o zbytočnú prácu.
  • Nepravdivý lastmod. Ak sa dátum mení pri každom zostavení webu bez skutočnej zmeny obsahu, Google ho prestane brať do úvahy.
  • Zastaraná sitemapa plná presmerovaných alebo neexistujúcich adries.
  • Súčasný zákaz aj noindex na tej istej stránke. Vzájomne sa vylučujú, značku robot neuvidí.

Oba súbory patria do technickej časti práce, ktorú treba mať v poriadku skôr, než sa pustíte do obsahu. Poradie krokov nájdete v prehľade SEO optimalizácia.

Súvisiace: Prečo Google neindexuje stránku · SEO audit krok po kroku · Duplicitný obsah a kanonizácia

Zdroje

  • Google Search Central: Introduction to robots.txt, účel súboru, rozdiel oproti noindex a dôsledky zablokovania stránky.
  • Google Search Central: What is a sitemap, kedy sitemapu potrebujete a kedy nie.
  • Google Search Central: Build and submit a sitemap, limit 50 MB a 50 000 adries, ignorovanie priority a changefreq, použitie lastmod a nezáväznosť odoslania.

Časté otázky

Potrebuje každý web robots.txt?

Nie je povinný – ak chýba, robot jednoducho prehľadáva všetko. Odporúča sa ho však mať, aspoň s povolením prehľadávania a odkazom na sitemap.xml. Pri väčších weboch pomáha usmerniť, kam robot nemá chodiť.

Aký je rozdiel medzi Disallow a noindex?

Disallow v robots.txt zakáže robotovi stránku prejsť, no tá sa aj tak môže objaviť vo výsledkoch, ak na ňu vedú odkazy. Značka noindex spoľahlivo vylúči stránku z indexu, ale robot ju musí prejsť, aby ju videl. Preto ich nekombinujte na tej istej stránke.

Zaručí sitemap.xml, že sa stránky zaindexujú?

Nie. Google uvádza, že odoslanie mapy stránok je iba nápoveda a nezaručuje, že mapu stiahne alebo ju použije na prehľadávanie adries. Pomáha najmä veľkým, novým alebo zložitejším webom a stránkam, na ktoré vedie málo interných odkazov. Pri malom a dobre prelinkovanom webe Google väčšinu stránok objaví aj bez nej.

Ako často mám sitemap aktualizovať?

Ideálne pri každej zmene obsahu a automaticky, väčšina systémov mapu generuje sama. Hodnotu lastmod nechajte odrážať skutočnú poslednú podstatnú zmenu stránky: Google ju používa len vtedy, keď je dôsledná a overiteľná. Značky priority a changefreq vypĺňať netreba, tie ignoruje.