Gjennomsøking er hvordan søkemotorer oppdager sider på nettet. Et program kalt en gjennomsøker, for eksempel Googlebot, følger lenker og leser nettstedskart for å finne URL-er, og henter deretter disse sidene slik at innholdet kan behandles.

Gjennomsøking er et av de første trinnene i søk. En side må vanligvis gjennomsøkes før Google kan indeksere den, og indekserte sider kan deretter konkurrere om rangeringer.

Hva er gjennomsøking?

En gjennomsøker jobber gjennom en liste over URL-er den allerede kjenner til, henter hver enkelt og legger til eventuelle nye lenker den finner i køen. Køen fortsetter å vokse etter hvert som den oppdager mer av nettet.

Robotsøkere finner sidene dine på tre måter:

  • Lenker fra sider som allerede er kjent, på nettstedet ditt eller noen andres
  • XML nettstedskartet ditt, som viser URL-er du ønsker å finne
  • Search Console forespørsler, for eksempel forespørsler om indeksering gjennom URL inspeksjonsverktøyet

Når en side er hentet, går innholdet videre til behandling. Om det lagres og vises i resultatene er en helt egen avgjørelse.

Gjennomsøking, indeksering og rangering er ikke det samme

Det er her mest forvirring starter, og det spiller en rolle i praksis.

  • Gjennomsøking er oppdagelse. Gjennomsøkingsverktøyet henter siden din.
  • Indeksering er lagring. Google analyserer siden og bestemmer om den skal legges til i indeksen. Mange gjennomsøkte sider blir aldri indeksert.
  • Rangering er plassering. Hvilke av de indekserte sidene vises for et gitt søk, og i hvilken rekkefølge.

Hvert trinn kan mislykkes på egenhånd. En gjennomsøkt side blir kanskje ikke indeksert av ulike årsaker, inkludert kvalitet, duplisering eller andre tekniske og indekseringsmessige hensyn. En indeksert side rangerer kanskje ikke fordi noe bedre finnes. I Search Console er ”Gjennomsøkt, for øyeblikket ikke indeksert” nøyaktig dette: funnet, hentet og utelatt.

Hva kan forhindre gjennomsøking?

Robots.txt

En robots.txt-fil forteller robotsøkeprogrammer hvilke deler av nettstedet ditt de kan få tilgang til. Den kan bidra til å administrere robotsøkeprogrammets aktivitet og forhindre unødvendige forespørsler til serveren din.

Googles dokumentasjon er direkte om grensen: robots.txt er ikke en mekanisme for å holde en side ute av Google. For å gjøre det, bruk noindex eller passordbeskyttelse.

Feilen nesten alle gjør

Her er fellen. Noen vil ha en side ute av søkeresultatene, så de legger til en noindex-tag og blokkerer URL-en i robots.txt, med den begrunnelse at to barrierer er tryggere enn én.

De jobber mot hverandre.

For at noindex skal fungere, må robotsøkeprogrammet hente siden og lese taggen. Hvis robots.txt blokkerer URL-en, ser robotsøkeprogrammet den aldri, og siden kan fortsatt vises i resultatene når andre nettsteder lenker til den.

Riktig rekkefølge er det motsatte av hva som føles trygt: tillat gjennomsøking, og bruk deretter noindex. Slipp robotsøkeprogrammet inn slik at den kan lese instruksjonen om å forlate.

Andre vanlige blokkeringer

  • Foreldreløse sider uten interne lenker som peker til dem
  • Serverfeil som returnerer 5xx-svar når roboten kaller
  • Langsomme responstider, som reduserer hvor mye av nettstedet ditt som blir gjennomsøkt
  • Innloggingsvegger, siden roboter ikke kan logge på
  • Ødelagte omdirigeringskjeder som går i løkker eller ender i blindvei

Gjennomsøkingsbudsjett

Gjennomsøkingsbudsjettet er omtrent hvor mange sider en robot vil hente fra nettstedet ditt i en gitt periode.

For de fleste små og mellomstore nettsider er ikke gjennomsøkingsbudsjettet noe du trenger å bekymre deg for. Google kan vanligvis gjennomsøke et nettsted med bare noen få dusin eller noen få hundre sider uten problemer.

Det begynner å spille en rolle på store nettsider, for eksempel e-handelskataloger med tusenvis av URL variasjoner eller nettsider som genererer endeløse filtrerte og parameterbaserte sider. Når en robot bruker besøkene sine på nesten identiske parameter URL-er, venter de virkelig nye sidene dine lenger på å bli funnet.

Avsluttende tanker

De fleste gjennomsøkingsproblemer er uhell. En robots.txt-linje som er igjen fra et testnettsted, en side ingen lenket til, en viderekobling som ble ødelagt under en migrering.

Sjekk Sider rapporten i Search Console. Den forteller deg hva som ble gjennomsøkt, hva som ble indeksert og hva som ble ekskludert, og årsaken til hvert av dem. Det er vanligvis raskere enn å gjette.

Vanlige spørsmål

Hva er forskjellen mellom gjennomsøking og indeksering?

Gjennomsøking betyr å finne og hente en side. Indeksering betyr å analysere og lagre den slik at den potensielt kan vises i søkeresultatene. En side kan gjennomsøkes uten å bli indeksert.

Hinder robots.txt at en side vises i Google?

Nei. Robots.txt kontrollerer gjennomsøking, ikke indeksering. Googles egen dokumentasjon sier at det ikke er en mekanisme for å holde en side ute av Søk. En blokkert URL kan fortsatt indekseres hvis andre sider lenker til den, selv om den vanligvis vises uten en beskrivelse.

Hvorfor gjennomsøkes ikke siden min?

Vanlige årsaker er ingen interne lenker som peker til den, en robots.txt-regel som blokkerer banen, siden som ligger bak en pålogging, serverfeil når roboten kaller eller en ødelagt viderekobling. Bruk URL inspeksjonsverktøyet i Search Console for å se nøyaktig hva Google fant.

Bør jeg bruke robots.txt og noindex sammen? 

Nei. Hvis robots.txt blokkerer URL-en, kan ikke roboten hente siden og vil aldri lese noindex taggen, så siden forblir kvalifisert for indeksering. Tillat gjennomsøking først, og bruk deretter noindex.