Hloubkové analýzy

Technické rozbory

Podrobné vysvětlení technických aspektů indexování. Každý rozbor se soustředí na jedno konkrétní téma a snaží se ho popsat tak, aby byl srozumitelný bez programátorského vzdělání.

Schéma distribuce crawl budgetu mezi stránkami webu
Crawl budget

Crawl budget pro weby pod deset tisíc stránek

Crawl budget je pojem, který se v SEO komunitě používá hodně, ale ne vždy přesně. Google ho popisuje jako kombinaci dvou věcí: crawl capacity limit a crawl demand.

Crawl capacity limit je maximální počet paralelních požadavků, které Googlebot může odeslat, aniž by přetěžoval váš server. Googlebot tento limit průběžně upravuje na základě doby odezvy serveru. Pokud server reaguje pomalu, Googlebot zpomalí.

Crawl demand odráží, jak moc Google považuje stránky za hodné procházení. Populárnější stránky s více zpětnými odkazy jsou procházeny častěji.

Pro web s méně než tisícem stránek, který funguje na normálním hostingu, crawl budget zpravidla není omezujícím faktorem. Googlebot zvládne takový web projít celý za jeden den. Problém nastává u webů s mnoha automaticky generovanými URL, například e-shopy s kombinacemi filtrů.

Jak ověřit: V Google Search Console, sekce Nastavení, najdete Statistiky procházení. Tam vidíte celkový počet požadavků za posledních 90 dní.
Obrazovka Google Search Console se statistikami procházení webu
Search Console

Statistiky procházení v Google Search Console

Google Search Console obsahuje sekci Statistiky procházení, která je pro pochopení chování Googlebotu na vašem webu klíčová. Najdete ji v levém menu pod Nastavení.

Hlavní metriky jsou celkový počet požadavků za den, průměrná doba odezvy v milisekundách a celkové přenesené bajty. Graf ukazuje vývoj za posledních 90 dní.

Pod grafem jsou tabulky rozdělující požadavky podle odpovědi (2xx, 3xx, 4xx, 5xx), podle účelu (stránka, soubor sitemapy, obrázek, video), a podle Googlebota (Smartphone, Desktop).

Zpráva o pokrytí indexu (Index Coverage) je jiná sekce a ukazuje stav indexování. Stránky jsou rozděleny do čtyř kategorií: chyba, varování, platná s varováním, platná. Každá kategorie má podkategorie s konkrétními důvody.

Pozor: Data v Search Console jsou zpožděna přibližně o 2-3 dny. Nejedná se o data v reálném čase.
Vizualizace duplicitních URL a jejich dopadu na crawl budget
Duplicitní obsah

Jak duplicity plýtvají crawl budgetem

Duplicitní obsah v kontextu crawl budgetu neznamená nutně kopírování cizích textů. Jde o situaci, kdy více různých URL zobrazuje stejný nebo velmi podobný obsah.

Typické příklady: stránka produktu dostupná přes /produkt/nazev/ i přes /kategorie/podkategorie/nazev/. Stránky s parametry řazení jako ?sort=price nebo ?sort=name. HTTP a HTTPS verze stejné stránky. Verze s www a bez www. Stránky s lomítkem na konci URL a bez něj.

Každá z těchto URL je pro Googlebot samostatná stránka. Pokud má web tisíc produktů, ale každý je dostupný přes pět různých URL, Googlebot musí projít pět tisíc URL místo tisíce.

Canonical tag říká Googlu, která URL je preferovaná verze. Nezabrání Googlebotu stránku navštívit, ale ovlivní, která verze bude indexována. Pro eliminaci zbytečných URL z procházení je účinnější kombinace robots.txt a správné struktury interních odkazů.

Terminál s analýzou log souborů serveru zobrazující požadavky Googlebotu
Log soubory

Co odhalí analýza log souborů

Serverové logy jsou záznamy každého HTTP požadavku na váš server. Každý řádek obsahuje IP adresu, datum a čas, HTTP metodu, požadovanou URL, stavový kód, velikost odpovědi, referrer a user-agent.

Googlebot se identifikuje user-agentem "Googlebot/2.1". Filtrováním logů na tento user-agent získáte přesný přehled o tom, které stránky Googlebot navštívil, kdy a jak reagoval server.

Tato data jsou unikátní. Google Search Console ukazuje agregovaná data s určitým zpožděním a výběrem. Logy ukazují vše: včetně stránek, které jsou v Search Console označeny jako chyby, stránek blokovaných robots.txt (Googlebot je přesto někdy navštíví), nebo stránek, které Googlebot navštívil, ale nikdy neindexoval.

Základní analýzu lze provést v příkazové řádce pomocí grep a awk. Pro větší weby existují specializované nástroje jako Screaming Frog Log File Analyser nebo Botify.

Ověření Googlebotu: Reálný Googlebot lze ověřit zpětným DNS lookup. Falešné boty se za Googlebot vydávají běžně.