Technické SEO

Index bloat

Definice

Index bloat je stav, kdy má vyhledávač ve svém indexu velké množství nízkohodnotných, duplicitních nebo nechtěných stránek webu - typicky filtrů, parametrických URL nebo tenkého obsahu. Postihuje web jakékoli velikosti, ne jen velké weby jako crawl budget, a hlavní riziko je zhoršení signálu kvality pro celý web, ne ztracený čas Googlebota.

Vyhledávač obvykle neodmítne zaindexovat stránku jen proto, že je slabá - pokud na ni vede odkaz a nic mu v tom nebrání, zaindexuje ji, a nechá až později rozhodnout, jestli se ve výsledcích vůbec ukáže. Když se tenhle proces opakuje ve velkém - stovky variant jedné stránky, tisíce prázdných výpisů - index se naplní obsahem, který nikdo nehledá a který jen ředí zbytek webu.

Nejčastější příčiny

  • Filtry a fasetová navigace u e-shopů - každá kombinace barvy, velikosti a ceny vytvoří novou URL se stejným, nebo skoro stejným obsahem jako ta bez filtru.
  • Parametrické URL - sledovací parametry (?utm_=), ID relace nebo řazení výpisu, které vytvářejí desítky adres pro jednu stránku.
  • Výchozí archivy a štítky redakčních systémů - WordPress běžně zaindexuje archiv podle autora, data nebo štítku, i když na něm nikdy nebyl záměr stavět samostatný obsah.
  • Interní vyhledávání - výsledkové stránky vlastního vyhledávače webu, které se do indexu dostanou, aniž by je kdy měl někdo najít přes Google.
  • Zbytky po migraci - staré URL, které po přechodu na nový systém nebo doménu zůstaly technicky dostupné a nikdo je nezavřel.

Proč to není jen o crawl budgetu

Index bloat a crawl budget spolu souvisí, ale řeší jiný problém a jinou skupinu webů. Ten druhý je otázka, kolik toho Googlebot stihne projít - podle Google relevantní hlavně u webů s desítkami tisíc a víc stránkami. Index bloat je otázka, co z toho, co Google projde, skutečně skončí v indexu - a to se týká webu jakékoli velikosti, i menšího e-shopu se třemi filtry navíc.

Hlavní riziko jsou dvě věci, které se dějí až po zaindexování - ne promarněný čas při procházení:

  1. Kanibalizace klíčových slov - víc podobných stránek cílí na stejný dotaz místo jedné silné, takže si navzájem ředí signály a žádná z nich nevyhraje pozici, kterou by vyhrála sama.
  2. Signál kvality pro celý web. Google od zavedení Helpful Content update v roce 2022 počítá tenhle signál na úrovni celého webu, ne jednotlivé stránky - ve vlastním oznámení píše, že „libovolný obsah, ne jen ten nehodnotný, se na webu s relativně vysokým podílem nehodnotného obsahu bude v hledání dařit hůř”. Zaindexovaná hromada prázdných filtrů tak může táhnout dolů i ty stránky webu, které jsou samy o sobě v pořádku.

Jak index bloat odhalit

Nejrychlejší orientační odhad je operátor site:vasedomena.cz - ukáže hrubý počet zaindexovaných URL, ale číslo kolísá a není přesné, takže se hodí jen na první podezření, ne na přesné měření. Spolehlivější je Search Console: v přehledu Stránky (Indexování) porovnejte počet skutečně zaindexovaných URL s tím, kolik smysluplných stránek web reálně má. Násobně vyšší číslo, než čekáte, nebo náhlý skok v grafu za poslední týdny jsou signál, že se do indexu dostalo něco navíc.

Jak ho řešit

Volba nástroje závisí na příčině, ne na tom, který je „nejsilnější”:

  • Canonical tag na filtrech a parametrických variantách, které mají zůstat dostupné pro uživatele, ale nemají soutěžit o vlastní pozici - ukazuje na tu jednu verzi, která má být v indexu.
  • Noindex na stránkách, které nemají v indexu co dělat vůbec (interní vyhledávání, prázdné archivy) - Google si o takovou stránku stejně zažádá, takže se čas procházení neušetří. Tady to nevadí: úkol je dostat konkrétní URL z indexu, ne ušetřit čas procházení, a to noindex splní i s tím drobným zbytkovým nákladem.
  • 301 přesměrování nebo smazání (404/410) u starých URL po migraci, které nemají mít žádnou náhradu.
  • Konsolidace obsahu tam, kde víc tenkých stránek řeší v podstatě totéž - sloučit do jedné silnější je řešení příčiny, ne jen příznaku.

Robots.txt do týhle sady nepatří - blokuje procházení, ale nezaručí odebrání už zaindexované stránky, takže na existující index bloat sám o sobě nezabírá.

Související pojmy
Z teorie do praxe

Proberte to se mnou.

Počet zaindexovaných stránek je jedno z čísel, které v měsíční správě sleduju v čase - ne proto, že by víc znamenalo líp, ale proto, že náhlý skok obvykle značí problém dřív, než se projeví na návštěvnosti.

Napište mi

Nebo se podívejte na službu SEO správa →