Indexering inom SEO
Indexering är steget efter crawling. Google hämtar sidan, tolkar den och avgör om den ska sparas i indexet. Utan indexering finns sidan inte i sökresultatet, hur bra den än är skriven.
Crawling, rendering, indexering
Tre steg, i den ordningen. Googlebot hämtar HTML-koden. Renderingen kör sidans JavaScript och ger det slutliga innehållet. Först därefter avgör Google om sidan ska sparas.
Stegen kan gå fel var för sig. En sida som crawlas kan bli oindexerad. En sida som är indexerad kan ha crawlats för länge sedan. Läs alltid av vilket steg som brister innan du åtgärdar något.
Så kontrollerar du om en sida är indexerad
Ta URL-inspektionen i Search Console först. Den svarar för en URL i taget, och den svarar på riktigt: den visar om URL:en finns i indexet, vilken canonical Google valde, när sidan senast crawlades och vad renderingen gav. Ingen annan metod ger dig de fyra svaren samtidigt.
En site:-sökning duger som snabbkoll men inte som facit.
Träffarna är ungefärliga, antalet är en uppskattning, och en sida kan
saknas i resultatet utan att vara oindexerad. Använd den för att se
mönster — vilka mappar som är tunga i indexet — inte för att avgöra
enskilda URL:er.
För helheten: jämför antalet indexerade URL:er i rapporten "Sidor" med antalet URL:er i din sitemap. Är sitemapen större saknas sidor du vill ha in. Är indexet större har du fått med URL:er du inte känner till, och då är det index bloat du tittar på snarare än ett indexeringsproblem.
Varför en sida inte indexeras
Fyra orsaker täcker nästan alla fall jag ser i Search Console:
- Sidan är blockerad. En
noindexi robots-taggen, eller en regel irobots.txtsom hindrar crawlingen. Notera skillnaden: robots.txt stoppar hämtningen, inte indexeringen. En blockerad sida kan ändå hamna i indexet, utan text. - Google valde en annan sida. Sidan pekar på en annan URL med en canonical, eller Google bedömer att en annan URL är originalet. Statusen heter "Duplikat" i Search Console.
- Sidan är för tunn. Google crawlar den, men sparar den inte. Det är ett kvalitetsbeslut, inte ett tekniskt fel, och det syns som "Crawlad – för närvarande inte indexerad".
- Sidan går inte att nå. Inga interna länkar pekar dit, eller servern svarar med fel statuskod.
Verktyg som styr indexeringen
| Verktyg | Vad det gör | Vad det inte gör |
|---|---|---|
noindex | Tar bort sidan ur indexet efter nästa crawl | Sparar ingen crawl budget — sidan måste hämtas för att regeln ska läsas |
robots.txt | Hindrar hämtningen | Garanterar ingen borttagning ur indexet |
| Canonical | Pekar ut originalet bland dubbletter | Är ett förslag, inte ett kommando |
| Sitemap | Visar vilka URL:er du vill ha indexerade | Tvingar fram ingen indexering |
| Statuskod 410 | Tar bort sidan snabbare än 404 | Flyttar inget värde vidare — använd 301 för det |
En vanlig miss: noindex plus en blockering i
robots.txt på samma URL. Då läses aldrig taggen, och sidan
ligger kvar. Välj ett av dem.
Index bloat
Index bloat betyder att indexet fylls av sidor utan eget syfte: filtersidor, sökresultat, tunna taggsidor, sidor 2 till 40 i en paginering. De rankar inte själva, och de tar crawl budget från sidorna som ska ranka.
Åtgärden är sällan ett svep med noindex. Räkna först. Om
antalet indexerade URL:er är flera gånger större än antalet sidor du
faktiskt vill ha i sökresultatet, leta upp mönstret bakom skillnaden och
ta bort orsaken. Min studie av
paginering mätte just det på riktig data.
Mät det själv
Rapporten "Sidor" i Search Console är utgångspunkten. Läs den per orsak, inte per sida, och jämför antalet indexerade URL:er med antalet URL:er i din sitemap. Serverloggen visar sedan vad Googlebot faktiskt hämtar, och hur ofta. De två källorna tillsammans räcker för de flesta beslut.