I SEO-arbeidet med ethvert nettsted er et uunnværlig trinn å analysere sitemap.
Se om det finnes, hva det inneholder, om det kan forbedres…
På små nettsteder er det viktig, men på store, som ecommercebutikker med flere merkevarer, er det helt avgjørende, siden optimalisering av crawl budget –tiden Google-boten er tildelt for å crawle nettstedet vårt– er et must hvis vi vil rangere godt på konkurranseutsatte søkeord.
Og en måte å gjøre det på er å administrere sitemapen riktig.
I denne artikkelen vil jeg forklare hvordan du analyserer den. Men først, hvis du nettopp har begynt med SEO, starter vi med det grunnleggende…
Índice de Contenidos del Artículo
Hva er en Sitemap?
En Sitemap, eller Sitemap.xml, er ganske enkelt en fil eller en samling filer i formatet .xml som forteller botene hvilke URL-er nettstedet vårt består av.
Hvis du ikke vet det, inneholder en .xml-fil flere poster, hver med ulike verdier for bestemte egenskaper:

Selv om den ser slik ut, kan du tenke på den som en Excel-fil der hver rad viser en post og hver kolonne verdien for en bestemt egenskap i posten.
Du kan faktisk åpne den med Excel:

Som jeg sa, bør denne filen inneholde alle URL-ene på nettstedet vårt som vi ønsker at Google skal crawle.
Denne nyansen er viktig, fordi det kan finnes URL-er vi av ulike grunner ikke vil indeksere (juridiske merknader, brukerens kundeområde), og som derfor ikke bør være med i sitemapen.
Filen må lastes opp til serveren vår. Når den ligger der (alle CMS-er har måter å generere den på), sender vi URL-en til Google Search Console, slik at Googles crawler kan begynne å crawle den.
Nå som du vet hva den er, forklarer jeg hvordan du analyserer den.
Prosessen for å analysere en Sitemap
Jeg kommer til å bruke Screaming Frog, sannsynligvis det kraftigste verktøyet som finnes for on-page SEO.
Så installer det først på datamaskinen din.
Når du har det, forklarer jeg hvordan du gjennomfører de tre nødvendige trinnene.
#1. Finn URL-en til sitemapen
For å analysere en sitemap må du først få tak i den.
Og hvis det gjelder nettstedet vårt eller et prosjekt vi administrerer, kan vi alltid gå til GSC.
Men hvis vi vil analysere sitemapen til en konkurrent (ja, det går også), må vi finne den.
For å gjøre det åpner vi filen robots.txt.
Denne filen ligger i rotmappen til domenet. Eksempel:
https://www.yopongoelhielo.com/robots.txt
Når vi åpner den, ser vi noe som dette:

Der finner vi URL-en vi trenger.
Vi kopierer den og åpner Screaming Frog.
#2. Konfigurere Screaming Frog
Her skal vi endre to ting.
Det første er valgfritt, og jeg har egentlig ikke sett at det endrer resultatene, men jeg gjør det av gammel vane.
Jeg mener å åpne innstillingene og, under «User-Agent», velge Googlebot (Smartphone), for å etterligne Googles crawler:

Det andre er obligatorisk og innebærer å sette Screaming Frog i listemodus, slik at det bare crawler URL-ene i sitemapen og ingen andre:

#3. Importere sitemapen
Nå klikker vi på Importer og deretter på «Last ned XML-sitemap»:

Lim inn sitemap-URL-en vi kopierte fra robots.txt i programmet:

Når vi bekrefter, begynner programmet å crawle URL-ene i sitemapen:

Én ting til: Hvis URL-en vi har oppgitt er et «sitemap over sitemaps», altså et «indeks»-sitemap som inneholder andre sitemaps (svært vanlig hvis du bruker SEO-pluginen Yoast i WordPress til å generere det), kan programmet spørre om vi vil behandle alle URL-ene. Da svarer vi ja.
Nå er forberedelsene ferdige.
Når Screaming Frog er ferdig med å behandle hele sitemapen, begynner den virkelige analysen.
Innsikt og punkter som bør analyseres
Når verktøyet har samlet inn informasjonen, kan vi svare på enkelte spørsmål som er relevante for SEO.
Hvor mange URL-er finnes i sitemapen?
Screaming Frog forteller deg det:

Det er interessant å sammenligne dette tallet, for eksempel, med antallet URL-er som er indeksert i Google, som vi henter fra Google Search Console:

Hvis det finnes forskjeller –og det gjør det som regel– må vi finne årsaken. Og vurdere om forskjellene er riktige eller ikke.
Anbefalingen er for øvrig at hvert sitemap inneholder opptil 1 000 URL-er. Hvis nettstedet ditt har flere, er det best å opprette flere sitemaps som nås fra hovedsitemapen.
Men for å være ærlig gjør jeg det bare hvis jeg ser indekseringsproblemer i GSC.
Finnes det URL-er som ikke kan indekseres i sitemapen?
Alle URL-ene i sitemapen bør kunne indekseres. Faktisk er å få URL-er indeksert det grunnleggende formålet med sitemaps, så vi bør ikke ta med noen «ikke-indekserbare» URL-er.
Screaming Frog avslører om det finnes noen:

En annen måte å se disse dataene, og noen av dem vi skal gå gjennom, er via sitemappens egen meny:

Inneholder den URL-er som er blokkert i robots.txt eller kanonisert?
I denne kolonnen ser vi om noen av disse tilfellene forekommer, noe de ikke bør gjøre.

Når vi snakker om «kanoniserte» URL-er, mener vi for øvrig URL-er i sitemapen der meta «canonical» peker til en annen URL. Bare den sistnevnte bør være med i sitemapen.
Hvis vi ser en slik URL, trenger vi bare å klikke på den. Verktøyet viser da den kanoniske URL-en (den som bør være med i sitemapen):

Finnes det paginerte sider?
Med paginerte sider mener jeg side 2 og påfølgende sider som vises i produktlister i en ecommercebutikk eller i artikkellister på en blogg.
Ingen av dem bør være med i sitemapen.
For å kontrollere dette ser vi på denne kolonnen og sjekker visuelt at de ikke finnes:

Finnes det foreldreløse sider?
En foreldreløs side er en side som ikke har noen lenker som peker til den fra andre sider på nettstedet.
Det vil si at den bare er tilgjengelig hvis du kjenner URL-en, og slike sider er derfor ikke relevante for nettstedet ditt.
En side som finnes i sitemapen, skal være viktig, så vi bør ikke legge til noen foreldreløse sider der.
Her kan vi kontrollere at det ikke finnes noen:

Finnes det 301- eller 404-koder?
Dette er to svarkoder som serveren returnerer når en ressurs, for eksempel en nettside, blir forespurt.
Her kan vi se kodeverdiene for hver URL i sitemapen:

Kodene 301 er videresendinger.
Sitemapen bør bare inneholde de endelige URL-ene, fordi videresendinger sløser bort svært verdifull tid for Google-boten.
Kodene 404 er feilkoder som skyldes URL-er som ikke finnes. Det bør selvfølgelig ikke være noen slike i sitemapen vår.
Sidenes relevans
Så langt har vi sett på feilene.
Det vi fortsatt må analysere på store nettsteder, er om alle sidene som er tatt med er relevante, eller om det kan lønne seg å «beskjære» sitemapen litt, slik at Googles crawler ikke «går seg vill blant grenene» (ordspillet var ikke til å unngå).
Her er det opp til deg (eller SEO-spesialisten din) å avgjøre om URL-er skal utelukkes.
Som du ser ovenfor, har sitemapen til Yo pongo el hielo 22k URL-er, mens Google har indeksert 30k og crawlet 230k uten å indeksere dem, altså elleve ganger så mange:

Alle disse URL-ene er sekundære for oss, og vi vil ikke at de skal vises i Googles SERP-er på bekostning av rangeringen til andre som absolutt bør vises.
Derfor gjør vi blant annet slik at de holdes utenfor sitemapen.
Med dette eksemplet håper jeg det er tydelig hvordan du finpusser sitemapen din.
Dermed har vi gått gjennom analysepunktene du bør kontrollere i nettstedets sitemap for å holde den i god form.
Det var vel ikke så ille?
Konklusjoner
Gjennom artikkelen har du sett hvordan du analyserer sitemapen til nettstedet ditt, og hvilke aspekter du må kontrollere.
Jeg håper du sitter igjen med at det slett ikke er komplisert å analysere en sitemap (å rette den er selvfølgelig en annen sak).
Prosessen består av bare tre trinn, og verktøyet tar seg av alt. Det er heller ikke så mange punkter å analysere…
Om bare alle deler av nettstedadministrasjon var like enkle…
Uansett publiserer jeg hver uke en artikkel om digitale forretningstemaer, noen enklere og andre vanskeligere, slik det naturlig nok er.
Du kan få en ny artikkel på e-post hver torsdag ved å abonnere her.

Legg igjen en kommentar