Technické SEO

Crawl budget

Definice

Crawl budget je množství stránek, které je Google (Googlebot) ochotný a schopný na webu procházet za určité období. Skládá se ze dvou částí - kolik toho server unese (crawl capacity limit) a o kolik toho Google vůbec stojí (crawl demand). Netýká se všech webů stejně: relevantní je především u webů s desítkami tisíc a víc stránek.

Google skládá crawl budget ze dvou nezávislých částí. Crawl capacity limit (dřív se říkalo hostload) je technický strop - kolik připojení a jak dlouho může Googlebot na server otevírat, aniž by ho zpomalil. Když web odpovídá stabilně a rychle, limit se postupně zvyšuje; když se objeví chyby 5xx nebo signál přetížení (HTTP 429), Google prochází míň. Crawl demand je druhá strana - o kolik toho Google na webu vůbec stojí, bez ohledu na to, kolik by unesl. Tady hraje roli, kolik URL si Google o webu myslí, že existuje, jak je web populární a jak často se obsah reálně mění. Web se přitom počítá po jednotlivých hostname - www.example.com a shop.example.com mají každý svůj vlastní crawl budget, i kdyby šlo o stejnou firmu.

Kdy se crawl budgetem vůbec zabývat

Google k tomu ve vlastním průvodci uvádí konkrétní hranice, ne jen „velký web”: týká se webů s milionem a víc stránek, které se mění aspoň jednou týdně, nebo webů s 10 000 a víc stránkami, které se mění denně. Třetí případ je nezávislý na velikosti - vysoký podíl stránek v Search Console ve stavu „Obsah zjištěn - momentálně neindexováno” je signál, že Googlebot na ně nestíhá, bez ohledu na to, kolik jich celkem je.

Pro drtivou většinu firemních webů a menších e-shopů crawl budget není problém, který by stál za řešení - Google sám v úvodu průvodce píše, že pokud se nové stránky indexují ve stejný den, kdy vyjdou, průvodce nepotřebujete číst. Když se u menšího webu stránky do výsledků nedostávají, má to skoro vždy jinou příčinu: blokaci, špatně nastavený canonical, slabý obsah nebo technickou chybu - ne to, že by Googlu docházel čas.

Dva rozšířené mýty

Noindex crawl budget nešetří. Tag noindex řekne Googlu, ať stránku nezařazuje do výsledků - ale to zjistí až poté, co si o stránku znovu zažádá. Google to popisuje přímo: požadavek na stránku pošle, teprve při zpracování odpovědi ji na základě noindexu zahodí. Čas na tu žádost je tak stejně promarněný, jako kdyby noindex vůbec nebyl.

Blokace v robots.txt automaticky nepřesune ušetřený čas jinam. Zablokovaná stránka Googlu ušetří práci s tou konkrétní URL, ale Google ten čas nepřerozdělí na jiné stránky webu, pokud web zrovna nenaráží na crawl capacity limit. U webu, který na limit vůbec nedosahuje - a to je většina malých a středních webů - blokace nízkokvalitních stránek pomůže jinak (přestanou se plést do indexace a zabírat místo v reportech), ale „uvolněná” kapacita se nikam automaticky nepřelije.

Co se skutečně počítá

Google v doporučených postupech mluví hlavně o tom, aby se čas nemarnil na URL, které o pozornost nestojí:

  • Konsolidace duplicit - ne blokace, ale sloučení, aby Google procházel jedinečný obsah, ne jedinečné adresy.
  • Vracení 404/410 u trvale smazaných stránek - silnější signál „už to nekontroluj” než tichá 200 nebo měkká (soft) 404, kterou Google prochází dál a marní na ni čas.
  • Krátké přesměrovací řetězce - každý další skok v cestě je další požadavek navíc.
  • Aktuální sitemap s vyplněným <lastmod>, aby Google věděl, co se skutečně změnilo, bez nutnosti to ověřovat opakovaným procházením.
  • HTTP caching (kód 304) - když se stránka od posledního procházení nezměnila, odpověď 304 ušetří přenos i zpracování na obou stranách.

Crawl budget není limit velikosti stránky

Tohle se snadno plete, protože jde o podobné číslo v podobném kontextu. Google od března 2026 potvrzuje, že Googlebot z jedné URL stáhne maximálně 2 MB (u PDF 64 MB) - zbytek stránky za touhle hranicí se nestáhne, nevykreslí a neindexuje. Je to ale limit na jednu konkrétní stránku, ne na to, kolik stránek webu Google celkem projde - to řeší crawl capacity limit a crawl demand výš. Prakticky na to narazí jen web s nezvykle těžkým HTML (vložené base64 obrázky, obrovské bloky inline CSS/JS) - u běžné stránky se 2 MB nedosáhne ani zdaleka.

Jak crawl budget skutečně zvýšit

Podle Google existují jen dvě páky: přidat serveru výkon (pokud Search Console hlásí vyčerpanou kapacitu hostitele), nebo zlepšit signály, které Google používá k odhadu, jak moc se o web zajímat - popularitu, jedinečnost obsahu a celkovou hodnotu pro uživatele. Technická optimalizace výš pomůže využít to, co web už má, ale nový crawl budget si web nevynutí bez toho, aby si ho zasloužil obsahem nebo výkonem serveru.

Související pojmy
Z teorie do praxe

Proberte to se mnou.

Crawl budget řeším jen tam, kde na to velikost webu skutečně ukazuje - u menšího webu bych tím jen odváděl pozornost od skutečné příčiny. V měsíční správě nejdřív ověřím, jestli je to vůbec ta správná diagnóza, než na ni nasadím opravu.

Napište mi

Nebo se podívejte na službu SEO správa →