ChatGPT, Claude eller Gemini? Sådan vælger I model

1. august 2026

ChatGPT, Claude eller Gemini? Sådan vælger I model

Hvilken AI-model skal I vælge til virksomheden? Fem kriterier der faktisk afgør valget — og hvorfor arkitekturen betyder mere end leverandøren.

Valget mellem ChatGPT (OpenAI), Claude (Anthropic) og Gemini (Google) betyder mindre for jeres resultat end de fleste tror — og langt mindre end kvaliteten af jeres data og den måde, løsningen er bygget på. De tre er tæt på hinanden på de opgaver, danske virksomheder faktisk bruger dem til, og rækkefølgen skifter flere gange om året. Den beslutning, der holder, er derfor ikke "hvilken model", men "hvordan bygger vi, så modellen kan skiftes ud på en eftermiddag". Hos Indee vælger vi model per opgave og bygger altid, så den kan udskiftes.

Fem kriterier der faktisk afgør valget

Glem benchmark-tabellerne. Fem ting flytter beslutningen i praksis:

  • Opgavetypen. Lange, sammenhængende dokumenter stiller andre krav end korte klassifikationer i stor mængde. Skal modellen kalde værktøjer og API'er, er pålidelig værktøjsbrug vigtigere end sproglig elegance.
  • Datahåndtering og compliance. Findes der en databehandleraftale? Kan I køre på EU-hostede endpoints? Bruges jeres data til træning? Det her sorterer ofte mere brutalt end kvalitet — se vores gennemgang af GDPR-kravene til AI i danske virksomheder.
  • Svartid. En intern rapportgenerator må gerne tage 30 sekunder. En chat, en medarbejder venter på foran en borger, må ikke.
  • Pris pr. kald. Prisforskellene mellem den bedste og den næstbedste model til en given opgave kan være en faktor 5-10. På en løsning med tusindvis af kald om dagen er det den post, der afgør driftsbudgettet.
  • Økosystemet omkring jer. Kører I i forvejen på Azure eller Google Cloud, er der reel værdi i at holde jer til det, der er integreret — i identitetsstyring, logning og fakturering, ikke i modelkvalitet.

Vælg model efter opgave, ikke efter leverandør

I praksis ender de fleste danske virksomheder med at bruge mere end én model. Et realistisk billede:

OpgaveHvad der betyder nogetTypisk valg
Klassifikation i stor mængdePris pr. kald og svartidEn lille, billig model — også gerne open source
Lange dokumenter og analyseStort kontekstvindue, præcis gengivelseEn af de store modeller fra OpenAI, Anthropic eller Google
Værktøjsbrug og integrationerPålidelig, struktureret outputDen model der klarer jeres egne testcases bedst
Følsomme data uden ekstern overførselHosting og kontrolOpen source (Llama, Qwen, Mistral) på egen infrastruktur

Den sidste linje er værd at dvæle ved: open source er ikke gratis. I sparer betalingen pr. kald og betaler i stedet for GPU'er, drift og opdateringer. Det regnestykke tipper først, når volumen er høj nok, eller når kravet om at holde data helt inde i huset er ufravigeligt.

Byg til udskiftning

Det tekniske råd, der holder længst: læg et tyndt lag mellem jeres applikation og modellen. Ét sted i koden, der ved, hvilken leverandør der kaldes, og hvordan svaret ser ud. Så bliver et modelskifte en konfigurationsændring frem for et projekt.

Det gælder også opad. Prompter, der er skrevet stramt op ad én models særheder, skal skrives om ved hvert skifte. Prompter, der beskriver opgaven klart og afleverer output i et fast format, flytter sig sjældent.

Byg jeres eget testsæt — det er her, valget afgøres

Offentlige benchmarks siger noget om modeller i almindelighed og næsten intet om jeres opgave. Det, der virker, er kedeligt og effektivt:

  1. Saml 20-50 rigtige eksempler fra jeres egen hverdag — inklusive de svære og de sjældne.
  2. Skriv ned, hvordan et godt svar ser ud for hvert af dem.
  3. Kør de samme eksempler igennem to-tre modeller og sammenlign.

Det tager typisk en dag og er den bedste dag, I bruger i hele forløbet. Testsættet bliver samtidig jeres sikkerhedsnet: næste gang en leverandør udsender en ny version, kan I måle, om den blev bedre eller dårligere til netop jeres opgave — i stedet for at gætte.

Vi bruger den samme fremgangsmåde i Validi, hvor AI foreslår journalnotater til sundhedsprofessionelle. Der er det ikke nok, at et svar lyder godt; det skal være rigtigt på de konkrete sager, klinikkerne rent faktisk har.

Ofte stillede spørgsmål

Hvilken AI-model er bedst til dansk?

De store modeller fra OpenAI, Anthropic og Google er alle brugbare på dansk, og forskellen er lille på almindelig tekst. Den bliver derimod tydelig på fagsprog, forkortelser og domænespecifikke termer — og dét kan I kun måle på jeres egne eksempler. Kør 20-50 rigtige tekster fra jeres egen hverdag igennem to-tre modeller, før I beslutter jer.

Skal vi vælge én leverandør til det hele?

Sjældent. Det giver enklere fakturering og færre aftaler, men koster ofte i både pris og kvalitet, fordi ingen leverandør er bedst til alt. Et fornuftigt kompromis er én hovedleverandør til det meste og friheden — teknisk og aftalemæssigt — til at bruge en anden, hvor det giver mening.

Hvor tit skal vi skifte model?

Vurdér det hvert halve år, og skift kun, når jeres eget testsæt viser en reel forbedring, eller når prisen ændrer regnestykket. At jage den nyeste model hver måned koster mere i udviklingstid, end det giver i kvalitet.


Skal vi hjælpe jer med at vælge og teste model på jeres egne data? Book en uforpligtende samtale med Indee — eller se vores ydelser for, hvordan et forløb ser ud.