ChatGPT refererer flittigt til eksterne websider, men hvor kommer de citerede sider egentlig fra? Ny forskning fra RESONEO afdækker hele mekanikken bag ChatGPT’s kilde-håndtering – og det har stor betydning for dig, der arbejder med online marketing og SEO.
1. Tre lag i ChatGPT’s kildeopsætning
- a) Discovery-index – “labrador”
- b) Læser-cache (fulde sider i Markdown)
- c) Live-opslag (kun i betalte “Thinking/Think” mode)
Hvert lag har forskellige regler, opdateringshyppighed og “blind spots”. Jo bedre du forstår dem, desto nemmere kan du optimere dit site til AIsøg.
2. Sådan opdagede vi det
- En Chrome-udvidelse fangede ChatGPT’s interne datastrøm indtil 21. juli, inklusive feltet “result_source”.
- Fire pipeline-koder dukkede op: labrador, bright, oxylabs, serp – hver uofficielt navngivet af os via formateringssignaturer.
- Vi genkender dem i dag med >98% nøjagtighed.
- Omfattende test på tværs af gratis vs. betalt, Instant vs. Think/Thinking, API vs. produkt.
3. De vigtigste pipelines kort
- Labrador: OpenAI’s eget index – web, nyheder, arXiv, Reddit, YouTube m.fl.
- Bright + Oxylabs: Live-scrapede Google-resultater (web & nyheder).
- Shopping (P1/P2/P3): OpenAI’s merchant-feeds + Google som priskilde.
- Lokal (B1/B3, Yelp, TripAdvisor): Visning via Google Maps.
Fokus i denne artikel er på “web search” (labrador, bright, oxylabs).
4. Gratis vs. betalt – Instant vs. Think/Thinking
- Gratis Instant: ~11 kilder (93% fra labrador), svar på få sekunder, 0 web-opslag.
- Gratis Think: ~35 URL’er, to-doblet kildemængde, 75% labrador, 22% oxylabs.
- Betalt Thinking (medium effort): ~33 URL’er, 75% bright, 25% labrador – men færre domæner end i juli.
- Betalt Thinking (high effort): Endnu færre kilder, mere “navigational” søg med site:-operator op til 58%.
Betalte brugere hæfter sig altså stadig ved Google-drevet Bright, mens gratis Think primært søger i OpenAI’s eget index.
5. Labrador vs. Bing – et helt eget index
- Kun 1,5% af labrador-URL’er findes i Bings top 20 for samme søgninger.
- Labrador titler er utrimmet (op til 289 tegn), snippets er faste 200 tegn, uafhængige af søgeord.
- Snippets ankre på H1 + omkringliggende synligt indhold (kategori-label, alt-tekst, forfatter, dato, TOC).
- Meta descriptions ignoreres i labrador, men tæller stadig i Google-drevne pipelines.
Konsekvens: I Instant-mode læser modellen eneste snippet-uddrag skåret ved crawl-tid – ikke dine meta-tags eller dynamisk tilpassede uddrag.
6. Når ChatGPT åbner sider (Reading Cache)
- Fulde sider gemmes som Markdown i en delt cache, “stale-while-revalidate”:
- Frisk kopi i ~30 minutter, herefter serveres gammel kopi umiddelbart + baggrunds-opdatering.
- Ingen Cache-Control eller noindex forhindrer opslag.
- Robot’en eksekverer ikke JavaScript, sider >4 MB afvises helt (HTTP 400).
- Skjult CSS-tekst og alt-tekst medtages; scripts, iframes og JSON-LD fjernes.
Du kan via en API-parameter se sidens seneste crawl-dato – en gratis “exposure metric” ingen holder øje med.
7. Analytisk blindspot – UTM og brugeragent
- Klikbare citations-links får som oftest utm_source=chatgpt.com.
- Men sider, modellen selv åbner i Thinking-mode, får ingen UTM-parameter.
- Har du kun lukket på UTM, ser du ikke de sider, ChatGPT faktisk læser – tjek derfor også “ChatGPT-User” user agent i server-logs.
8. Mystiske citations uden “synlige” resultater
- Nogle citerede URL’er har intet snippet – kun titel + link. (Særligt arXiv, Reddit, men også andre.)
- Snippet-løse URLs citeres oftere (14,9% vs. 8,2% for sider med snippet).
- Enkelte citerede domæner vises ikke blandt resultater – ser ud til at komme fra modelhukommelsen (parametrisk viden).
9. SEO-actionables i dag
- Skriv titler som meningsfyldte, selvstændige sætninger (H1 når op til +200 tegn tæller).
- Placer din kerne-besked inden for 200 tegn efter H1 (før kategori-labels, byline, TOC).
- Brug beskrivende alt-tekster i toppen af siden.
- Behold meta description (gælder stadig for bright/oxylabs-pipelines).
- Hold sider under 4 MB og content læsbart uden JavaScript.
10. Langsigtet strategi: Ejer svaret, ikke kun snippet-tricks
- AI-assistenter har cutoff-viden og er afhængige af retrieval – kvalitet vinder.
- SEO-fundament: Crawlable markup, klare titler, målrettet indhold der besvarer brugernes spørgsmål.
- Fokuser på de reelle, menneskelige spørgsmål (fx “Hvilken barnevogn passer igennem metropas?” frem for “49 cm stelbredde”).
- Brug data fra kundeanmeldelser, support-chats, undersøgelser og fora til at afdække kundernes ordvalg og smertepunkter.
Opsummering: Selvom ChatGPT’s retrieval-stack udvikler sig hastigt, er det grundlæggende SEO-principper, der sikrer synlighed. Skab tydeligt, struktureret indhold, svar på reelle brugerbehov – og optimer parate, statiske uddrag omkring H1, så du rammer ChatGPT’s snippet-ramme i Instant-mode. På den måde er du rustet både til labrador, bright, oxylabs – og de fremtidige AI-søgemaskiner, vi endnu ikke kender. Læs den detaljerede analyse af ChatGPT’s retrieval stack for endnu flere indsigter.
“`