hektor.se

Indexering inom SEO

Indexering är steget efter crawling. Google hämtar sidan, tolkar den och avgör om den ska sparas i indexet. Utan indexering finns sidan inte i sökresultatet, hur bra den än är skriven.

Crawling, rendering, indexering

Tre steg, i den ordningen. Googlebot hämtar HTML-koden. Renderingen kör sidans JavaScript och ger det slutliga innehållet. Först därefter avgör Google om sidan ska sparas.

Stegen kan gå fel var för sig. En sida som crawlas kan bli oindexerad. En sida som är indexerad kan ha crawlats för länge sedan. Läs alltid av vilket steg som brister innan du åtgärdar något.

Så kontrollerar du om en sida är indexerad

Ta URL-inspektionen i Search Console först. Den svarar för en URL i taget, och den svarar på riktigt: den visar om URL:en finns i indexet, vilken canonical Google valde, när sidan senast crawlades och vad renderingen gav. Ingen annan metod ger dig de fyra svaren samtidigt.

En site:-sökning duger som snabbkoll men inte som facit. Träffarna är ungefärliga, antalet är en uppskattning, och en sida kan saknas i resultatet utan att vara oindexerad. Använd den för att se mönster — vilka mappar som är tunga i indexet — inte för att avgöra enskilda URL:er.

För helheten: jämför antalet indexerade URL:er i rapporten "Sidor" med antalet URL:er i din sitemap. Är sitemapen större saknas sidor du vill ha in. Är indexet större har du fått med URL:er du inte känner till, och då är det index bloat du tittar på snarare än ett indexeringsproblem.

Så begär du indexering av en sida

Knappen "Begär indexering" ligger i URL-inspektionen i Search Console. Den lägger URL:en i en prioriterad kö för crawling. Det är allt den gör: den garanterar inte att sidan indexeras, bara att Googlebot tittar på den tidigare än den annars hade gjort. Är sidan blockerad, duplikat eller för tunn kommer den tillbaka oindexerad hur många gånger du än trycker.

Använd den när du har åtgärdat något konkret — tagit bort en noindex, rättat en canonical, lagt till innehållet som saknades — och du vill att rättelsen ska synas snabbare. Att begära indexering om och om igen för samma oförändrade URL gör ingenting.

För fler sidor än en handfull är sitemapen rätt verktyg. Skicka in den i Search Console och håll lastmod ärlig, så hittar Google de ändrade URL:erna själv. Kvoten på "Begär indexering" är liten och tar slut fort.

Hur lång tid tar indexering?

Det finns inget utlovat svar, men mönstret är stabilt nog att planera efter. En ny sida på en sajt Google crawlar ofta hamnar oftast i indexet inom några dagar. På en sajt som crawlas sällan, eller där sidan ligger djupt och har få interna länkar, tar det veckor.

Två saker avgör mer än allt annat. Det första är hur ofta Googlebot redan besöker sajten — se datumet för senaste crawlning i URL-inspektionen. Det andra är hur lätt sidan är att nå: en URL som ligger tre klick från startsidan och står i sitemapen hittas snabbare än en som bara nås via en filtrering.

Har det gått mer än ett par veckor är det sällan tiden det är fel på. Läs statusen i URL-inspektionen i stället — den säger vilken av orsakerna nedan det handlar om.

Varför en sida inte indexeras

Fyra orsaker täcker nästan alla fall jag ser i Search Console:

  • Sidan är blockerad. En noindex i robots-taggen, eller en regel i robots.txt som hindrar crawlingen. Notera skillnaden: robots.txt stoppar hämtningen, inte indexeringen. En blockerad sida kan ändå hamna i indexet, utan text.
  • Google valde en annan sida. Sidan pekar på en annan URL med en canonical, eller Google bedömer att en annan URL är originalet. Statusen heter "Duplikat" i Search Console.
  • Sidan är för tunn. Google crawlar den, men sparar den inte. Det är ett kvalitetsbeslut, inte ett tekniskt fel, och det syns som "Crawlad – för närvarande inte indexerad".
  • Sidan går inte att nå. Inga interna länkar pekar dit, eller servern svarar med fel statuskod.

Verktyg som styr indexeringen

Verktyg Vad det gör Vad det inte gör
noindex Tar bort sidan ur indexet efter nästa crawl Sparar ingen crawl budget — sidan måste hämtas för att regeln ska läsas
robots.txt Hindrar hämtningen Garanterar ingen borttagning ur indexet
Canonical Pekar ut originalet bland dubbletter Är ett förslag, inte ett kommando
Sitemap Visar vilka URL:er du vill ha indexerade Tvingar fram ingen indexering
Statuskod 410 Tar bort sidan snabbare än 404 Flyttar inget värde vidare — använd 301 för det

En vanlig miss: noindex plus en blockering i robots.txt på samma URL. Då läses aldrig taggen, och sidan ligger kvar. Välj ett av dem.

Index bloat

Index bloat betyder att indexet fylls av sidor utan eget syfte: filtersidor, sökresultat, tunna taggsidor, sidor 2 till 40 i en paginering. De rankar inte själva, och de tar crawl budget från sidorna som ska ranka.

Åtgärden är sällan ett svep med noindex. Räkna först. Om antalet indexerade URL:er är flera gånger större än antalet sidor du faktiskt vill ha i sökresultatet, leta upp mönstret bakom skillnaden och ta bort orsaken. Min studie av paginering mätte just det på riktig data.

Mät det själv

Rapporten "Sidor" i Search Console är utgångspunkten. Läs den per orsak, inte per sida, och jämför antalet indexerade URL:er med antalet URL:er i din sitemap. Serverloggen visar sedan vad Googlebot faktiskt hämtar, och hur ofta. De två källorna tillsammans räcker för de flesta beslut.

Guider i ämnet