Vizualizace procesu indexování webových stránek
Technické vzdělávání

Proč Google možná nezná
polovinu vašeho webu

Crawl budget, indexování, log soubory. Tři věci, které ovlivňují, co Google o vašem webu ví. Vysvětlujeme je srozumitelně, bez prodeje služeb.

Procházejte dolů

Co tady najdete

Tento portál vznikl proto, že technické stránky indexování jsou pro majitele webů obtížně dostupné. Dokumentace Googlu je rozsáhlá a psaná pro vývojáře. Tady se snažíme vysvětlit podstatu věci.

Neprodáváme SEO služby. Neprovádíme audity. Nepřijímáme zakázky. Píšeme o tom, jak indexování funguje, protože to považujeme za užitečné vědět.

Crawlování

Jak Googlebot prochází weby, co ovlivňuje frekvenci návštěv a co znamená crawl budget v praxi.

Indexování

Rozdíl mezi procházením a indexováním. Proč procházená stránka nemusí být indexovaná.

Log soubory

Co jsou serverové logy, jak je číst a proč ukazují věci, které žádný jiný nástroj neodhalí.

Search Console

Kde v Google Search Console najdete statistiky procházení a jak je správně interpretovat.

Témata, která rozebíráme

Konkrétní otázky, konkrétní odpovědi. Bez obecností.

Search Console

Statistiky procházení v GSC

Přesný postup, kde v Google Search Console najdete data o tom, jak Googlebot váš web prochází. Které metriky sledovat a co znamenají.

Číst rozbor
Duplicitní obsah

Jak duplicity plýtvají crawl budgetem

Když Googlebot opakovaně prochází stránky se stejným obsahem, využívá tím část vašeho crawl budgetu. Jak duplicity vznikají a jak je identifikovat.

Číst rozbor
Log soubory

Co odhalí analýza log souborů

Serverové logy zaznamenávají každý požadavek Googlebotu. Ukazují, které stránky robot navštívil, kdy a jak často. To žádný jiný nástroj neposkytne.

Číst rozbor
Základy

Rozdíl mezi crawlováním a indexováním

Jsou to dva různé procesy. Stránka může být procházena, ale neindexována. Nebo indexována, ale zřídka procházena. Proč na tomto rozdílu záleží.

Číst rozbor
Schéma procesu procházení webu Googlebotom
Googlebot prochází web systematicky, ale ne náhodně.

Proč to vůbec řešit

Představte si, že máte e-shop s pěti sty produkty. Otevřete Google Search Console a zjistíte, že indexovaných je jen dvě stě z nich. Zbytek Google buď nikdy nenavštívil, nebo navštívil, ale neindexoval.

Tato situace je běžnější, než se zdá. Příčiny jsou různé: technické chyby v robots.txt, příliš mnoho URL s parametry, pomalý server, nebo prostě špatná struktura interních odkazů.

Pochopit, proč se to děje, je první krok. Tento portál se soustředí právě na toto pochopení.

Neposkytujeme SEO poradenství ani audity. Obsah tohoto portálu je výhradně vzdělávací.

Kdo za portálem stojí

Lidé, kteří tato témata studují a píší o nich.

Jan Mašek, autor článků o technickém SEO a indexování

Jan Mašek

Technická analýza

Zabývá se tím, jak vyhledávače zpracovávají webový obsah. Píše o crawlování, struktuře URL a serverových logách.

Petra Horáková, autorka průvodců Google Search Console

Petra Horáková

Search Console a data

Zaměřuje se na interpretaci dat z Google Search Console. Píše průvodce pro majitele webů, kteří s tímto nástrojem začínají.

Tomáš Blažek, specialista na log soubory a serverovou analýzu

Tomáš Blažek

Log soubory a servery

Specializuje se na analýzu serverových logů. Vysvětluje, jak přistupovat k raw datům o chování Googlebotu na vašem serveru.

Lucie Dvořáčková, redaktorka a koordinátorka obsahu portálu

Lucie Dvořáčková

Obsah a srozumitelnost

Stará se o to, aby technické texty byly čitelné i pro ty, kdo nemají programátorské vzdělání. Překládá složité koncepty do srozumitelného jazyka.

Časté dotazy

Otázky, které dostáváme nejčastěji.

Crawl budget je přibližný počet URL, které Googlebot prochází na vašem webu za určité časové období. Ovlivňují ho dva faktory: crawl rate limit (kolik požadavků Googlebot může odeslat, aniž by přetěžoval server) a crawl demand (jak moc Google považuje váš web za hodný procházení).

Pro weby s méně než tisícem stránek není crawl budget zpravidla kritickým problémem. Stává se relevantním u větších webů, e-shopů s mnoha filtry nebo webů s automaticky generovanými URL.

V Google Search Console přejděte do sekce "Nastavení" a tam najdete "Statistiky procházení" (Crawl stats). Tato sekce ukazuje celkový počet požadavků Googlebotu za posledních 90 dní, průměrnou dobu odezvy a celkové přenesené bajty.

Detailnější pohled nabídne zpráva o pokrytí indexu (Index Coverage), kde vidíte, které stránky jsou indexovány, které mají chyby a které jsou záměrně vyloučeny.

Když Googlebot navštíví stránku, jejíž obsah je totožný nebo velmi podobný jiné stránce, spotřebuje tím část crawl budgetu bez přidané hodnoty. U e-shopů to typicky nastává u stránek s filtry produktů, různými seřazeními nebo variantami produktů dostupnými přes různé URL.

Řešením je kombinace canonical tagů, správné konfigurace robots.txt a v některých případech parametrizace URL v Google Search Console.

Log soubory jsou uloženy na webovém serveru. U sdíleného hostingu je nejčastěji najdete v ovládacím panelu (cPanel, Plesk) v sekci "Logy" nebo "Statistiky". U VPS nebo dedikovaného serveru jsou typicky v adresáři /var/log/apache2/ nebo /var/log/nginx/.

Formát logu závisí na použitém webovém serveru. Apache používá Combined Log Format, Nginx má podobný formát. Každý řádek představuje jeden HTTP požadavek a obsahuje IP adresu, datum, požadovanou URL, stavový kód a user-agent.

Ne. Tento portál je výhradně vzdělávací. Nepřijímáme zakázky, neprovádíme audity, neposkytujeme konzultace ani doporučení pro konkrétní weby. Veškerý obsah je obecný a informační.

Pokud hledáte odbornou pomoc s konkrétním webem, doporučujeme kontaktovat SEO specialisty nebo technické konzultanty, kteří se na tuto oblast zaměřují.

Důvodů může být více. Stránka nemusí mít žádné interní odkazy vedoucí na ni, takže ji Googlebot nenajde. Může být blokována v robots.txt. Může mít noindex meta tag. Může být považována za duplicitní. Nebo ji Googlebot prostě ještě nestihl navštívit.

Zpráva o pokrytí indexu v Google Search Console rozděluje stránky do kategorií podle důvodu neindexování. To je první místo, kde hledat odpověď.

Máte konkrétní otázku?

Pokud jste nenašli odpověď, napište nám. Negarantujeme odpověď na každý dotaz, ale čteme všechny zprávy.

Napsat dotaz