hektor.se

Indexering inom SEO

Indexering är steget efter crawling. Google hämtar sidan, tolkar den och avgör om den ska sparas i indexet. Utan indexering finns sidan inte i sökresultatet, hur bra den än är skriven.

Crawling, rendering, indexering

Tre steg, i den ordningen. Googlebot hämtar HTML-koden. Renderingen kör sidans JavaScript och ger det slutliga innehållet. Först därefter avgör Google om sidan ska sparas.

Stegen kan gå fel var för sig. En sida som crawlas kan bli oindexerad. En sida som är indexerad kan ha crawlats för länge sedan. Läs alltid av vilket steg som brister innan du åtgärdar något.

Så kontrollerar du om en sida är indexerad

Ta URL-inspektionen i Search Console först. Den svarar för en URL i taget, och den svarar på riktigt: den visar om URL:en finns i indexet, vilken canonical Google valde, när sidan senast crawlades och vad renderingen gav. Ingen annan metod ger dig de fyra svaren samtidigt.

En site:-sökning duger som snabbkoll men inte som facit. Träffarna är ungefärliga, antalet är en uppskattning, och en sida kan saknas i resultatet utan att vara oindexerad. Använd den för att se mönster — vilka mappar som är tunga i indexet — inte för att avgöra enskilda URL:er.

För helheten: jämför antalet indexerade URL:er i rapporten "Sidor" med antalet URL:er i din sitemap. Är sitemapen större saknas sidor du vill ha in. Är indexet större har du fått med URL:er du inte känner till, och då är det index bloat du tittar på snarare än ett indexeringsproblem.

Varför en sida inte indexeras

Fyra orsaker täcker nästan alla fall jag ser i Search Console:

  • Sidan är blockerad. En noindex i robots-taggen, eller en regel i robots.txt som hindrar crawlingen. Notera skillnaden: robots.txt stoppar hämtningen, inte indexeringen. En blockerad sida kan ändå hamna i indexet, utan text.
  • Google valde en annan sida. Sidan pekar på en annan URL med en canonical, eller Google bedömer att en annan URL är originalet. Statusen heter "Duplikat" i Search Console.
  • Sidan är för tunn. Google crawlar den, men sparar den inte. Det är ett kvalitetsbeslut, inte ett tekniskt fel, och det syns som "Crawlad – för närvarande inte indexerad".
  • Sidan går inte att nå. Inga interna länkar pekar dit, eller servern svarar med fel statuskod.

Verktyg som styr indexeringen

Verktyg Vad det gör Vad det inte gör
noindex Tar bort sidan ur indexet efter nästa crawl Sparar ingen crawl budget — sidan måste hämtas för att regeln ska läsas
robots.txt Hindrar hämtningen Garanterar ingen borttagning ur indexet
Canonical Pekar ut originalet bland dubbletter Är ett förslag, inte ett kommando
Sitemap Visar vilka URL:er du vill ha indexerade Tvingar fram ingen indexering
Statuskod 410 Tar bort sidan snabbare än 404 Flyttar inget värde vidare — använd 301 för det

En vanlig miss: noindex plus en blockering i robots.txt på samma URL. Då läses aldrig taggen, och sidan ligger kvar. Välj ett av dem.

Index bloat

Index bloat betyder att indexet fylls av sidor utan eget syfte: filtersidor, sökresultat, tunna taggsidor, sidor 2 till 40 i en paginering. De rankar inte själva, och de tar crawl budget från sidorna som ska ranka.

Åtgärden är sällan ett svep med noindex. Räkna först. Om antalet indexerade URL:er är flera gånger större än antalet sidor du faktiskt vill ha i sökresultatet, leta upp mönstret bakom skillnaden och ta bort orsaken. Min studie av paginering mätte just det på riktig data.

Mät det själv

Rapporten "Sidor" i Search Console är utgångspunkten. Läs den per orsak, inte per sida, och jämför antalet indexerade URL:er med antalet URL:er i din sitemap. Serverloggen visar sedan vad Googlebot faktiskt hämtar, och hur ofta. De två källorna tillsammans räcker för de flesta beslut.

Guider i ämnet