Crawl budget pro weby pod deset tisíc stránek
Google přiděluje každému webu určitý počet požadavků za den. Jak velký je tento limit pro menší weby a kdy začíná být relevantní pro vaše rozhodování?
Číst rozbor
Crawl budget, indexování, log soubory. Tři věci, které ovlivňují, co Google o vašem webu ví. Vysvětlujeme je srozumitelně, bez prodeje služeb.
Tento portál vznikl proto, že technické stránky indexování jsou pro majitele webů obtížně dostupné. Dokumentace Googlu je rozsáhlá a psaná pro vývojáře. Tady se snažíme vysvětlit podstatu věci.
Neprodáváme SEO služby. Neprovádíme audity. Nepřijímáme zakázky. Píšeme o tom, jak indexování funguje, protože to považujeme za užitečné vědět.
Jak Googlebot prochází weby, co ovlivňuje frekvenci návštěv a co znamená crawl budget v praxi.
Rozdíl mezi procházením a indexováním. Proč procházená stránka nemusí být indexovaná.
Co jsou serverové logy, jak je číst a proč ukazují věci, které žádný jiný nástroj neodhalí.
Kde v Google Search Console najdete statistiky procházení a jak je správně interpretovat.
Konkrétní otázky, konkrétní odpovědi. Bez obecností.
Google přiděluje každému webu určitý počet požadavků za den. Jak velký je tento limit pro menší weby a kdy začíná být relevantní pro vaše rozhodování?
Číst rozborPřesný postup, kde v Google Search Console najdete data o tom, jak Googlebot váš web prochází. Které metriky sledovat a co znamenají.
Číst rozborKdyž Googlebot opakovaně prochází stránky se stejným obsahem, využívá tím část vašeho crawl budgetu. Jak duplicity vznikají a jak je identifikovat.
Číst rozborServerové logy zaznamenávají každý požadavek Googlebotu. Ukazují, které stránky robot navštívil, kdy a jak často. To žádný jiný nástroj neposkytne.
Číst rozborJsou to dva různé procesy. Stránka může být procházena, ale neindexována. Nebo indexována, ale zřídka procházena. Proč na tomto rozdílu záleží.
Číst rozbor
Představte si, že máte e-shop s pěti sty produkty. Otevřete Google Search Console a zjistíte, že indexovaných je jen dvě stě z nich. Zbytek Google buď nikdy nenavštívil, nebo navštívil, ale neindexoval.
Tato situace je běžnější, než se zdá. Příčiny jsou různé: technické chyby v robots.txt, příliš mnoho URL s parametry, pomalý server, nebo prostě špatná struktura interních odkazů.
Pochopit, proč se to děje, je první krok. Tento portál se soustředí právě na toto pochopení.
Lidé, kteří tato témata studují a píší o nich.
Technická analýza
Zabývá se tím, jak vyhledávače zpracovávají webový obsah. Píše o crawlování, struktuře URL a serverových logách.
Search Console a data
Zaměřuje se na interpretaci dat z Google Search Console. Píše průvodce pro majitele webů, kteří s tímto nástrojem začínají.
Log soubory a servery
Specializuje se na analýzu serverových logů. Vysvětluje, jak přistupovat k raw datům o chování Googlebotu na vašem serveru.
Obsah a srozumitelnost
Stará se o to, aby technické texty byly čitelné i pro ty, kdo nemají programátorské vzdělání. Překládá složité koncepty do srozumitelného jazyka.
Otázky, které dostáváme nejčastěji.
Crawl budget je přibližný počet URL, které Googlebot prochází na vašem webu za určité časové období. Ovlivňují ho dva faktory: crawl rate limit (kolik požadavků Googlebot může odeslat, aniž by přetěžoval server) a crawl demand (jak moc Google považuje váš web za hodný procházení).
Pro weby s méně než tisícem stránek není crawl budget zpravidla kritickým problémem. Stává se relevantním u větších webů, e-shopů s mnoha filtry nebo webů s automaticky generovanými URL.
V Google Search Console přejděte do sekce "Nastavení" a tam najdete "Statistiky procházení" (Crawl stats). Tato sekce ukazuje celkový počet požadavků Googlebotu za posledních 90 dní, průměrnou dobu odezvy a celkové přenesené bajty.
Detailnější pohled nabídne zpráva o pokrytí indexu (Index Coverage), kde vidíte, které stránky jsou indexovány, které mají chyby a které jsou záměrně vyloučeny.
Když Googlebot navštíví stránku, jejíž obsah je totožný nebo velmi podobný jiné stránce, spotřebuje tím část crawl budgetu bez přidané hodnoty. U e-shopů to typicky nastává u stránek s filtry produktů, různými seřazeními nebo variantami produktů dostupnými přes různé URL.
Řešením je kombinace canonical tagů, správné konfigurace robots.txt a v některých případech parametrizace URL v Google Search Console.
Log soubory jsou uloženy na webovém serveru. U sdíleného hostingu je nejčastěji najdete v ovládacím panelu (cPanel, Plesk) v sekci "Logy" nebo "Statistiky". U VPS nebo dedikovaného serveru jsou typicky v adresáři /var/log/apache2/ nebo /var/log/nginx/.
Formát logu závisí na použitém webovém serveru. Apache používá Combined Log Format, Nginx má podobný formát. Každý řádek představuje jeden HTTP požadavek a obsahuje IP adresu, datum, požadovanou URL, stavový kód a user-agent.
Ne. Tento portál je výhradně vzdělávací. Nepřijímáme zakázky, neprovádíme audity, neposkytujeme konzultace ani doporučení pro konkrétní weby. Veškerý obsah je obecný a informační.
Pokud hledáte odbornou pomoc s konkrétním webem, doporučujeme kontaktovat SEO specialisty nebo technické konzultanty, kteří se na tuto oblast zaměřují.
Důvodů může být více. Stránka nemusí mít žádné interní odkazy vedoucí na ni, takže ji Googlebot nenajde. Může být blokována v robots.txt. Může mít noindex meta tag. Může být považována za duplicitní. Nebo ji Googlebot prostě ještě nestihl navštívit.
Zpráva o pokrytí indexu v Google Search Console rozděluje stránky do kategorií podle důvodu neindexování. To je první místo, kde hledat odpověď.
Pokud jste nenašli odpověď, napište nám. Negarantujeme odpověď na každý dotaz, ale čteme všechny zprávy.