70 60 56 63

Mange webshops står lige nu med et nyt spørgsmål, som ikke fandtes på samme måde for få år siden: Skal AI-crawlere have adgang til sitet, eller skal de holdes ude?

Det korte svar er, at det sjældent giver mening at vælge helt sort eller helt hvidt. For de fleste webshops er den bedste løsning at styre adgangen selektivt. Nogle crawlere kan være relevante at tillade, andre bør begrænses, og enkelte områder af sitet skal næsten altid holdes lukkede. Samtidig er det vigtigt at vide, at robots.txt hjælper med styring, men ikke giver en teknisk garanti for fuld blokering.

Hvad er AI-crawlere for webshops?

AI-crawlere er bots, der henter indhold fra websites for at læse, analysere eller bruge det i AI-relaterede tjenester. Det kan være crawlere fra søgemaskiner, AI-søgetjenester, annonceplatforme eller virksomheder, der træner og forbedrer modeller på offentligt webindhold.

I en webshop-kontekst betyder det, at crawlere kan hente alt fra kategoritekster og produktbeskrivelser til hjælpesider, blogindlæg og ofte også teknisk genererede URL’er, hvis de ikke er styret ordentligt.

Det gør spørgsmålet mere praktisk end teoretisk. Du tager ikke kun stilling til synlighed. Du tager også stilling til serverbelastning, datakvalitet, adgang til indhold og risikoen for at blokere noget, som stadig er vigtigt for Google eller andre platforme.

Hvorfor valget mellem blokere eller tillade ofte er for groft

En fuld blokering kan virke tryg, men kan også være unødigt bred. En fuld tilladelse kan virke enkel, men giver sjældent nok kontrol. Webshops har som regel flere typer sider med vidt forskellige behov.

Nogle sider er oplagte at gøre tilgængelige, fordi de er offentlige og vigtige for synlighed. Andre sider bør holdes væk fra både klassiske bots og AI-crawlere, fordi de er irrelevante, følsomme eller tunge at crawle.

ValgFordelRisikoTypisk egnet til
Fuld blokeringEnkel at sætte opKan være for restriktiv og give utilsigtede konsekvenserSider med følsomt eller lavværdi-indhold
Fuld tilladelseMaksimal adgang til offentligt indholdMindre kontrol og mere crawlbelastningEnkle sites med lav kompleksitet
Selektiv styringBedre balance mellem synlighed og kontrolKræver mere vedligeholdelseDe fleste webshops
Blokering med ekstra sikkerhedMere håndfast håndhævelseMere teknisk opsætningWebshops med meget indhold eller høj bottrafik

Sådan virker robots.txt for AI-crawlere

robots.txt bygger på Robots Exclusion Protocol og fungerer som en offentlig tekstfil med regler for crawlere. Her kan du angive user-agent, allow, disallow og ofte også sitemap. Ifølge Googles dokumentation downloader og parser Googles crawlere filen, før de crawler sitet, så de kan se, hvilke områder der må besøges.

Det er den gode nyhed. Den mindre gode nyhed er, at robots.txt ikke er en lås. Det er et sæt instruktioner, som velopdragne crawlere vælger at følge. Google, OpenAI og andre store aktører beskriver selv filen som et værktøj til styring, ikke som en garanti for teknisk håndhævelse.

Det er også værd at huske strukturen på sitet. Har du flere subdomæner, vil hvert subdomæne normalt have sin egen robots.txt. En regel på www.ditdomæne.dk dækker altså ikke automatisk blog.ditdomæne.dk eller shop.ditdomæne.dk.

Et simpelt eksempel kan se sådan ud:

User-agent: OAI-SearchBot
Disallow: /

User-agent: Googlebot
Allow: /

User-agent: *
Disallow: /checkout/
Disallow: /konto/
Disallow: /cart/
Sitemap: https://www.ditdomæne.dk/sitemap.xml

Eksemplet viser princippet, ikke den rigtige løsning for alle. Den rigtige opsætning afhænger af, hvilke bots du vil styre, og hvilke dele af webshoppen der skal kunne crawles.

Konsekvenser ved at blokere AI-crawlere i en webshop

Blokerer du AI-crawlere, begrænser du deres adgang til at læse dit offentlige indhold. Det kan være helt rimeligt, hvis du vil beskytte indhold, reducere bottrafik eller undgå, at store mængder produktsider bliver hentet af systemer, du ikke ser værdi i.

For nogle webshops handler blokering mest om performance. Cloudflare peger på, at visse AI-bots kan belaste servere mere end traditionelle crawlere. Det er ikke uvæsentligt, hvis du har mange produkter, filter-URL’er og facetter eller et site med begrænsede serverressourcer.

Risikoen opstår, når blokeringen bliver for bred eller for upræcis. En fejl i robots.txt, firewall-regler eller bot management kan ramme legitime crawlere, som du faktisk vil have ind. I en e-commerce-opsætning kan det betyde dårligere synlighed i Google, langsommere opdatering af produktdata eller manglende adgang til centrale sider.

Google beskriver også, at en webshop godt kan lanceres med kun forsiden åben og produkterne lukket midlertidigt. Det viser, hvor følsom crawling og indeksering er over for adgangsregler. Hvis hele sitet eller vigtige produktområder forbliver lukket for længe, bliver de detaljerede oplysninger heller ikke tilgængelige i Google Search og Shopping på samme måde.

Når blokering giver mening, er det ofte på disse områder:

Konsekvenser ved at tillade AI-crawlere i en webshop

Tillader du AI-crawlere, gør du dit offentlige indhold lettere tilgængeligt for aktører, der læser og analyserer webindhold. Det kan være relevant, hvis du vil sikre, at åbne produkt- og informationssider kan forstås af flere typer tjenester.

Der kan også være mere konkrete hensyn. OpenAI skelner mellem forskellige bots, herunder OAI-SearchBot og OAI-AdsBot. I deres egen vejledning fremgår det, at annoncører særligt bør prioritere OAI-AdsBot, hvis målet er annonceklarhed. Det siger noget vigtigt: Ikke alle AI-crawlere har samme funktion, og derfor bør de heller ikke behandles ens.

Adgangen har dog en pris i form af belastning og mindre kontrol. Hvis du tillader alt til alle, kan du ende med at give fri adgang til store mængder lavværdi-indhold, parameter-URL’er og tynde sider, som ikke hjælper din forretning.

Når tilladelse kan være relevant, er det ofte disse typer adgang, man vurderer først:

  • Kategorisider: Giver struktur og kontekst om sortiment
  • Hjælpe- og leveringssider: Kan støtte forståelse af vilkår, fragt og service
  • Annonceorienterede bots: Kan have betydning for kvalitetstjek i annonceringsmiljøer

Et forkert robots.txt kan ramme Google hårdere end AI-bots

Den største praktiske fejl er sjældent, at en AI-crawler får for meget adgang, men at en webshop kommer til at blokere vigtige Google-crawlere ved et uheld.

Selektiv styring af AI-crawlere giver ofte mest kontrol

For de fleste webshops er selektiv styring den bedste arbejdsmodel. Den tager højde for, at forskellige bots har forskellige formål, og at forskellige områder af sitet har forskellig værdi.

Start med at dele sitet op i zoner. Offentlige produktsider, kategorier, guides og hjælpesider er én zone. Konto, checkout, interne søgninger, previews, staging og tekniske endpoints er en anden. Derefter vurderer du, hvilke user-agents der skal have adgang til hvad.

En webshop bør også skelne mellem SEO-behov og AI-behov. Googlebot er stadig central for organisk synlighed. Her skal du være ekstra varsom. Google nævner også, at de i visse e-commerce-sammenhænge kan bruge add-to-cart som en del af verificeringen af den endelige pris, inklusive skat og fragt. Det betyder ikke, at alle checkout-nære sider skal stå åbne for alt og alle. Det betyder, at aggressiv blokering uden test kan skabe problemer.

En pragmatisk model ser ofte sådan ud:

  • Tillad åbent indhold: Produkter, kategorier, brands, guides og ofte CMS-sider
  • Bloker driftskritiske områder: Checkout, konto, wishlists, intern søgning og preview
  • Overvåg belastning: Se på logs, crawlspikes og mønstre pr. bot

Ekstra beskyttelse mod AI-crawlere ud over robots.txt

Hvis du vil være mere sikker på håndhævelsen, skal du supplere robots.txt med tekniske kontroller. Her er Cloudflare, WAF-regler, rate limiting og bot management typiske værktøjer.

Cloudflare har funktioner til AI Crawl Control, hvor man kan identificere AI-crawlere og vælge at tillade eller blokere dem. På gratisplanen sker identifikation ud fra user-agent strings, og på betalte planer er der flere muligheder for styring. Cloudflare viser også målinger på robots.txt violations, altså bots der forsøger adgang i strid med dine regler.

Det er nyttigt af to grunde. Dels får du bedre indsigt i, hvem der crawler sitet. Dels kan du skille mellem de bots, der følger reglerne, og dem der forsøger at gå udenom.

Her er det vigtigt at være ærlig om begrænsningen: user-agent strings kan være lette at forfalske. Hvis din webshop har høj værdi, følsomt indhold eller markant bottrafik, bør du overveje ekstra verifikation, adgangskontrol og loganalyse frem for kun at stole på robots.txt.

Praktisk robots.txt-styring for webshops med AI-crawlere

En god opsætning begynder ikke i filen, men i prioriteringen. Før du ændrer noget, bør du vide, hvilke bots der allerede besøger sitet, hvor de lander, og om de skaber værdi eller blot belastning.

Lav derefter regler, der er enkle og tydelige. Mange webshops ender med for mange specialregler, som ingen tør røre ved senere. Det er sjældent en fordel.

Et fornuftigt minimum kunne være:

  • blokering af konto, kurv og checkout for brede user-agents
  • særskilte regler for udvalgte AI-crawlere
  • åben adgang til de vigtigste offentlige landingssider
  • korrekt sitemap-angivelse
  • test af, at Google stadig kan crawle de sider der driver synlighed og salg

Har du både Shopify, WooCommerce og ekstra landingsområder på subdomæner, så gennemgå dem hver for sig. Det samme gælder kampagnesider og blogsektioner, hvor regler ofte lever deres eget liv.

Hvad marketingteams bør følge efter ændringer i crawler-styring

Når reglerne er sat op, er arbejdet ikke færdigt. Effekten skal måles.

Følg udviklingen i serverlogs, crawlstatistik, indeksering, load på sitet og eventuelle fejl i Google Search Console. Hvis du bruger Cloudflare eller lignende, så hold øje med mønstre pr. crawler og tegn på robots.txt violations.

Kig også på forretningsdelen. Mister vigtige sider synlighed? Falder antallet af crawlede produktsider? Eller falder botbelastningen uden negative effekter? Den slags spørgsmål er vigtigere end den principielle debat om AI alene.

Næste skridt for webshops der vil styre AI-crawlere

Hvis din webshop ikke har taget stilling endnu, er første skridt ikke at blokere alt. Første skridt er at skabe overblik over bots, URL-typer og forretningskritiske sider.

Derefter giver det mening at vælge en selektiv model: tillad det offentlige indhold, der giver mening, beskyt de områder der ikke skal læses, og supplér robots.txt med teknisk kontrol, hvis du vil tættere på reel håndhævelse.

Det giver mere præcision, færre fejl og bedre kontrol over både crawling, indeksering og drift.