Otázky a odpovědi

Časté dotazy

Shromáždili jsme otázky, které se opakují nejčastěji. Odpovědi jsou co nejpřesnější, ale technické chování Googlebotu se může měnit s každou aktualizací.

Základy indexování

Crawlování je proces, kdy Googlebot navštíví URL a stáhne obsah stránky. Indexování je následný proces, kdy Google analyzuje stažený obsah a rozhodne, zda a jak ho zařadí do svého indexu.

Stránka může být procházena, ale neindexována. Důvody jsou různé: noindex meta tag, nízká kvalita obsahu, duplicita, nebo technická chyba při zpracování. Naopak stránka nemůže být indexována bez předchozího procházení.

Záleží na mnoha faktorech. Nová stránka na etablovaném webu s dobrým crawl budgetem může být indexována do několika hodin. Nový web nebo stránka bez interních odkazů může čekat dny nebo týdny.

Odeslání URL přes nástroj "URL Inspection" v Google Search Console může proces urychlit, ale nezaručuje okamžité indexování. Sitemap.xml pomáhá Googlebotu najít stránky, ale také negarantuje rychlé indexování.

Googlebot je webový crawler Googlu. V log souborech se identifikuje user-agentem obsahujícím řetězec "Googlebot". Existuje více verzí: Googlebot (pro desktop), Googlebot-Smartphone (pro mobilní verze), Googlebot-Image (pro obrázky) a další.

Pozor: user-agent lze snadno zfalšovat. Reálný Googlebot pochází z IP adres v rozsahu, který Google zveřejňuje. Ověření pravosti probíhá zpětným DNS lookup: IP adresa musí být přiřazena k doméně googlebot.com nebo google.com.

Crawl budget

Ano, přímo. Googlebot sleduje dobu odezvy serveru a přizpůsobuje frekvenci požadavků. Pokud server reaguje pomalu nebo vrací chyby 5xx, Googlebot zpomalí procházení, aby server nepřetěžoval.

Toto chování je popsáno v oficiální dokumentaci Googlu pod pojmem "crawl rate limit". Rychlý server s konzistentní dobou odezvy pod 200ms umožňuje Googlebotu procházet web efektivněji.

Robots.txt blokuje Googlebotu přístup k určitým URL. Pokud Googlebot narazí na blokovanou URL, zastaví se a neprocházuje ji. Tím se ušetří část crawl budgetu pro jiné stránky.

Důležitý detail: Googlebot může stále znát URL blokovanou v robots.txt (například ze sitemapy nebo z externího odkazu) a zobrazit ji v indexu jako URL bez obsahu. Blokování v robots.txt neznamená automaticky vyloučení z indexu.

Sitemap.xml pomáhá Googlebotu najít stránky, které by jinak mohl přehlédnout kvůli slabé interní struktuře odkazů. Nezvyšuje přímo crawl budget, ale pomáhá ho využít efektivněji.

Do sitemapy patří pouze stránky, které mají být indexovány. Přidávání stránek s noindex tagem nebo blokovaných v robots.txt do sitemapy je chyba, která matoucí signály Googlebotu.

Log soubory a nástroje

Ne nutně. Základní analýzu lze provést v příkazové řádce: grep filtruje řádky s Googlebotom, awk extrahuje konkrétní sloupce, sort a uniq počítají výskyty. Pro menší weby toto postačí.

Pro větší weby nebo pravidelnou analýzu existují specializované nástroje. Screaming Frog Log File Analyser je desktop aplikace pro Windows a Mac. Botify a Lumar jsou cloudové platformy pro enterprise weby. Excel nebo Google Sheets zvládnou základní vizualizaci po exportu dat.

Pro analýzu chování Googlebotu je ideální uchovávat logy alespoň 90 dní, aby bylo možné porovnat data s Google Search Console, která také zobrazuje 90denní okno.

Z právního hlediska (GDPR) je potřeba zvážit, že logy obsahují IP adresy uživatelů, což jsou osobní údaje. Standardní doporučení je uchovávat logy maximálně 30 dní pro provozní účely, pokud nemáte jiný právní základ pro delší uchovávání.

Nenašli jste odpověď?

Napište nám svou otázku. Pokud bude obecně relevantní, přidáme ji do tohoto seznamu.

Napsat dotaz