Danske prompts fylder lidt mere end tilsvarende engelske prompts i mange AI modeller. Men testen peger ikke på, at virksomheder skal skifte til engelsk. Sprogvalg skal afhænge af arbejdsgangen.

Mange danske virksomheder er begyndt at diskutere, om medarbejdere bør bruge engelsk, når de arbejder med ChatGPT, Copilot, Claude, Gemini og andre AI værktøjer.

Med baggrund i tallene i vores undersøgelse, så lyder det også umiddelbart effektivt. Engelsk er ofte kortere. Mange modeller er hovedsageligt trænet på engelsk. Mange tekniske begreber er allerede på engelsk. Og i nogle workflows kan en engelsk prompt give et mere kompakt input.

AI bruges dog ikke kun af specialister, der dagligt arbejder ”på engelsk”.

AI bruges også af HR-medarbejdere, undervisere, konsulenter, kundeservice, marketing, projektledere, sagsbehandlere, ledere og ansatte, der tænker bedst på dansk, arbejder med danske kunder og skal skrive til danske modtagere. Hvis de bliver tvunget over i engelsk for at være "mere effektive", kan man hurtigt miste præcision, tryghed og i sidste ende brugen af AI.

Derfor lavede vi en større test.

Vi ville ikke bare spørge, om dansk fylder mere end engelsk. For det vil det grundet at engelsk er langt mere udbredt end dansk stort set altid gøre. I stedet ville vi finde ud af, hvornår det betyder noget, hvornår det næsten forsvinder i mængden, og hvornår sprogskiftet kan være en falsk besparelse i praksis.

Kort fortalt: hvad betyder tokens for AI prompts?

Tokens er de små tekststykker, en AI model læser og skriver med. Det er ikke helt det samme som ord. Et kort ord kan være én token, et langt ord kan deles op, og tegnsætning kan også tælle med.

Det betyder tre konkrete ting:

Tokens er forbruget i opgaven. Jo mere tekst modellen skal læse og skrive, jo mere arbejde beder du den om at udføre.

Tokens kan blive til kroner og øre i store workflows. Ikke fordi hvert enkelt spørgsmål er dyrt, men fordi små forskelle kan vokse, når en proces kører mange gange.

Tokens hænger også sammen med energi og klima. Mere tekst og mere beregning kræver mere compute (udregninger på datacentrene). Derfor giver det mening at fjerne rod, gentagelser og unødvendig tekst i faste AI arbejdsgange.

Pointen her er ikke et regnestykke med øre pr. prompt, men at sprog, kildetekst og workflowdesign kan påvirke forbruget, når AI bliver en fast del af driften.

Hovedpointerne fra undersøgelsen

I den samlede test brugte danske prompts i gennemsnit omkring 1,06x så mange input tokens som tilsvarende engelske prompts, når svaret stadig skulle være på dansk.

Forskellen var størst i korte hverdagsopgaver, hvor dansk lå omkring 1,11x forbrug vs. engelsk.

I gentagne workflows lå dansk omkring 1,06x forbrug.

I lange opgaver med dansk kildemateriale faldt forskellen til omkring 1,01x, fordi kildeteksten fylder langt mere end selve prompten.

Kvaliteten holdt sig høj i testen, med en gennemsnitlig kvalitetsscore på 4,5 ud af 5.

Derfor skal alle ikke bare prompte på engelsk. Virksomheder bør vælge sprog efter arbejdsgang.

Dansk bør normalt være standard for bred medarbejderbrug, kunde-nære opgaver, HR, undervisning, intern kommunikation og situationer, hvor nuance betyder noget.

Engelsk eller hybrid kan give mening i specialistarbejde, tekniske flows og gentagne AI automatiseringer, men bør testes på den konkrete opgave.

Det er værd at huske på, at en prompt ofte er en del af en medarbejders arbejdsgang, så hvis sprogvalget gør medarbejderen usikker, bliver det samlede output ikke nødvendigvis bedre, selv om prompten bliver kortere.

Hvorfor vi testede dansk mod engelsk

Hos HverdagsAI arbejder vi hovedsageligt med danske virksomheder, der både bruger AI i almindelige chatværktøjer og i mere faste processer: promptskabeloner, interne assistenter, agent-workflows, mødenoter, kundeservice, content, undervisning, compliance, rapportering og AI automatisering.

Når vi kigger på arbejdsgange, flyder modelvalg og sprog ofte sammen.

Og i den forbindelse støder vi ofte på spørgsmål som:

  • Skal vi skrive vores prompts på engelsk?

  • Hvad når outputtet skal være på dansk?

  • Og er det anderledes i AI workflows eller med AI agenter?

  • Bør vores interne promptskabeloner være engelske, selv om medarbejderne arbejder på dansk?

  • Betyder det mere i AI agenter og automationer end i almindelig ChatGPT brug?

Derfor handler det ikke kun om at spare tokens ved at prompte på engelsk. Det handler om, hvornår sproget giver værdi for kvaliteten, gør arbejdet nemmere for medarbejderen og passer til det konkrete AI scenarie, uanset om det er almindelig chatbrug, AI automation eller AI agenter.

Der skal skelnes mellem de forskellige opgaver og måder at bruge AI på.

I almindelig medarbejderbrug kan det være helt forkert at optimere efter kortest mulig prompt. Medarbejderen skal kunne forklare sin opgave præcist, vurdere svaret og bruge det videre. Hvis dansk giver bedre input og gør det nemmere for den enkelte medarbejder, er dansk ofte det rigtige valg.

I workflows med høj volumen er situationen anderledes. Hvis en agent eller API-baseret proces kører samme type opgave igen og igen, kan selv små forskelle i tokenforbrug blive relevante. Men også her skal man teste kvalitet, sprogcompliance og fejltyper. En kortere prompt er ikke nyttig, hvis den skaber mere efterarbejde.

Sådan er testen lavet

Analysen bygger på 1.440 kontrollerede kørsler. I datagrundlaget viser vi de sammenlignelige tabeller fra det balancerede tabelgrundlag med 1.260 kørsler, hvor 14 modelspor er testet på samme 30 scenarier og tre sprogvarianter.

Se datagrundlag og metode for testen i den separate metodeoversigt.

Vi har lavet testen som et studie med signifikans, men ikke som en universel modelrangliste. Det overordnede spørgsmål for baggrunden for undersøgelsen var:

”Hvad sker der med tokenforbrug og output, når realistiske danske opgaver skifter mellem dansk, engelsk og hybrid?”

Testdesignet

Testen består af 1.440 kontrollerede testkørsler. Vi brugte 14 modelspor og 30 syntetiske danske forretningsscenarier. Der indgår ingen kundedata.

Hver opgave blev testet i tre sprogvarianter: dansk prompt til dansk output, engelsk prompt til dansk output og engelsk prompt til engelsk output.

Opgaverne blev fordelt på korte hverdagsopgaver, gentagne workflow-opgaver og lange opgaver med dansk kildetekst.

Opsætningen brugte faste prompts, faste outputgrænser efter opgavetype og ingen modelspecifik prompttilpasning. De 14 modelspor kørte temperatur 0 og top_p 1.

De tre promptvarianter

Vi testede hver opgave i tre varianter:

  1. Dansk prompt, dansk output.

  2. Engelsk prompt, dansk output.

  3. Engelsk prompt, engelsk output.

Den centrale sammenligning i artiklen er variant 1 mod variant 2: hvad sker der, når output stadig skal være dansk, men prompten skifter fra dansk til engelsk?

Det er den situation, vi møder hos de fleste danske virksomheder. Kundemails, mødereferater, ledelsesnoter og interne beskeder skal stadig lande på dansk. Derfor er det mest relevante spørgsmål: ”kan den faste prompt bagved med fordel stå på engelsk, selv om arbejdet foregår på dansk?”

Det målte vi

For hver testkørsel noterede vi tokens i prompten, tokens i svaret, samlet tokenforbrug og latency. Når en model viste reasoning-tokens, blev de også taget med i optællingen. Derefter vurderede vi tre ting, som betyder noget i brug: om svaret holdt sproget, om kvaliteten var høj nok, og om lange danske kilder blev fastholdt korrekt.

Alle rækker med længdegrænser, sprogproblemer eller QA-fejl blev genkørt med justeret outputgrænse, før det endelige resultat blev analyseret. Slutstatus var 1.440 gennemførte testkørsler, uden manglende usage-data, uden sprogfejl og uden kvalitetsscore under den valgte grænse.

Hovedresultat: dansk gav cirka 1,06x højere input-tokenforbrug

I testen brugte danske prompts i gennemsnit omkring 1,06x så mange input tokens som tilsvarende engelske prompts, når svaret stadig skulle være på dansk.

Det samlede resultat viser samme hovedmønster på tværs af opgavetyper: dansk fylder ofte lidt mere, men forskellen er ikke ens i alle typer opgaver.

Det er også derfor, sprogvalget skal vurderes i den opgave, hvor prompten faktisk skal bruges. For en medarbejder, der bruger AI nogle få gange om ugen, kan sprogkvalitet, tryghed og præcision let betyde mere end en lille forskel i promptens længde. For et fast workflow, der kører tusindvis af gange, er det mere fornuftigt at teste, hvad sproget konkret betyder.

Forskellen afhænger af opgavetypen

Den største forskel kom i korte opgaver, hvor selve prompten fylder en større del af hele prompten.

I lange opgaver med dansk kildemateriale bliver prompten derimod relativt mindre vigtig. Her dominerer kildeteksten. Hvis du sender lange danske mødereferater, kundetekster, sagsnotater eller produktbeskrivelser ind i modellen, er det ofte bedre at optimere kildemateriale, struktur og datamængde end at skifte promptsprog.

I korte chat- og adoptionsopgaver lå dansk omkring 1,11x. Her kan sprogvalget ses tydeligst, fordi prompten fylder meget i forhold til hele opgaven.

I gentagne workflows og automationer lå dansk omkring 1,06x. Det er netop her, virksomheder bør teste, hvis workflowet kører ofte og kan standardiseres.

I lange opgaver med dansk kildetekst faldt dansk til omkring 1,01x. Her dominerer kildematerialet, og struktur, beskæring og datakvalitet betyder ofte mere end promptsprog.

Søjlediagram for dansk vs engelsk AI med 14 modelspor, inklusive OpenAI Thinking og OpenAI Instant

Modelsporene trak ikke helt samme vej

Vi tog 14 modelspor med, fra små hurtige modeller til tungere modeller.

Spændet var ikke voldsomt, men det var tydeligt. DeepSeek lå højest i testen med 1,0892x. OpenAI Instant lå lavest med 1,0431x, og OpenAI Thinking landede samme sted.

Det betyder ikke, at OpenAI Instant nødvendigvis er "bedst", eller at DeepSeek nødvendigvis er "dårligst". Testen måler ikke alt, og modellerne har forskellige styrker. Men det er tydeligt, at modelvalg og sprogvalg hænger sammen, og virksomheder bør ikke antage, at samme promptstrategi fungerer ens på alle modeller.

Der er to konkrete ting, der skal overvejes.

For det første bør virksomheder ikke bygge en promptstandard uden at vide, hvilken model eller platform den skal bruges i. En god promptskabelon i ChatGPT er ikke automatisk den bedste i Claude, Gemini, Copilot eller en agent bygget oven på flere modeller.

For det andet bør virksomheder være varsomme med brede regler som "alle prompts skal være engelske" eller "alt skal være dansk". For oftest er det mere situationsbestemt, og hvis man er i tvivl vil vi anbefale at man til normalt brug (f.eks. ChatGPT, Copilot og Claude), benytter det sprog, som man føler sig mest tryg og hjemme i.

Heatmap for dansk vs engelsk AI der viser tokenforskel på tværs af 14 modelspor og tre opgavetyper

Kvaliteten holdt sig høj

En sprogtest er ikke meget værd, hvis man kun måler tokens.

Derfor scorede vi også outputtet på kvalitet. Kvalitet er delvist subjektivt, så denne del skal tages med et gran salt. De svar, der lå nede på 3-4, havde flere generelle fejl, for eksempel ordstilling og direkte dansk/engelske oversættelser. Det havde mindre med promptsproget at gøre og mere med modellens generelle evner på dansk.

I testen lå den gennemsnitlige kvalitetsscore på 4,5 ud af 5. Sprogcompliance lå på 4,99 ud af 5. Det betyder, at testen ikke viser et generelt kvalitetskollaps, når man sammenligner dansk og engelsk prompt.

Dansk er ikke "dårligt". Engelsk er ikke "fantastisk". Begge kan fungere godt. Det rigtige spørgsmål er, hvor sproget skal ligge i arbejdsgangen.

Søjlediagram for dansk vs engelsk AI der viser fordelingen af kvalitetsscorer fra 1 til 5

Sprogvalget skal følge arbejdsgangen

Hvis man kun læser overskriften, kan man få lyst til at lave en hurtig regel: "Skriv på engelsk."

Det er at forsimple situationen for meget.

I praksis bør danske virksomheder skelne mellem 5 situationer, og her afhænger det selvfølgelig stadig af den enkelte medarbejders evne på engelsk:

  1. Brug som udgangspunkt dansk prompt til dansk output i almindelig medarbejderchat, HR, intern kommunikation og kunde-nær tekst. Her betyder præcision, tryghed, nuance og adoption typisk mest.

  2. Brug engelsk prompt, når opgaven er teknisk, international eller tæt på kode og engelske kilder. Terminologien er ofte allerede engelsk, og modellen kan svare mere kompakt.

  3. Test dansk mod ”hybrid”, når opgaven bygger på dansk kildemateriale og skal ende i et dansk forretningsoutput. Kildeteksten fylder ofte mest, så kvalitet og faktuel nuance bør afgøre valget.

  4. Benchmark dansk, engelsk og hybrid pr. workflow i gentagne agent- og API-processer. Små forskelle kan blive relevante ved høj gentagelse, men kun hvis kvaliteten holder.

  5. Brug dansk til gennemgang, dokumenterede skabeloner og godkendte modeller i regulerede eller følsomme workflows. Ansvar, kontrol og dokumentation er vigtigere end ren effektivitet.

Et godt AI setup kan sagtens være hybrid.

Medarbejderen skriver på dansk. Den faste systemprompt bagved kan være engelsk. Outputtet kommer tilbage på dansk. Et ”reviewlag” sikrer, at faglige og juridiske begreber passer til dansk kontekst.

Regionalt perspektiv: dansk er ikke bare en oversættelse af engelsk

Når vi taler om "regionalt" i denne undersøgelse, handler det ikke om forskelle mellem danske landsdele. Testen er ikke lavet som en geografisk måling af København, Aarhus, Odense eller bestemte brancheregioner.

Den regionale pointe er sproglig og markedsmæssig: Danmark er et lille sprogområde i en AI verden, hvor meget teknologi, dokumentation, træningsdata og terminologi oftest foregår meget på engelsk.

Det skaber et dilemma for danske virksomheder.

På den ene side kan engelsk være mere kompakt og naturligt i tekniske prompts. På den anden side arbejder danske virksomheder med danske medarbejdere, danske kunder, danske regler, danske aftaler, danske møder og danske begreber.

Ord som "udbud", "forankring", "tillidsrepræsentant", "arbejdsmiljø", "kommunal sagsbehandling", "ledelsesret", "samarbejdsudvalg" og "borgerkontakt" er danske ord med betydning, der afhænger af branche, rolle og situation.

Hvis den kontekst forsvinder, kan outputtet stadig se pænt ud, men miste noget af det, medarbejderen faktisk skulle bruge.

I praksis handler sprogvalget om arbejdspraksis: hvem der skriver inputtet, hvem der skal bruge svaret, og hvilke begreber der ikke må glide.

Hvad betyder det for almindelig ChatGPT, Copilot og Claude-brug?

For almindelige medarbejdere er vores anbefaling klar:

Start på det sprog, hvor opgaven kan beskrives mest præcist.

I mange danske virksomheder er svaret dansk.

Skal en medarbejder skrive til en dansk kunde, opsummere et dansk møde, lave en intern besked eller forstå et dansk dokument, er det sjældent klogt at presse opgaven gennem engelsk først. Det er samme erfaring, vi peger på i ChatGPT i praksis: værdien opstår, når brugen bliver til en arbejdsform og ikke kun et enkelt prompt.

Det betyder ikke, at engelsk aldrig skal bruges. Det skal bare bruges bevidst.

Brug engelsk, når opgaven handler om kode, international research eller engelske kilder. Det samme gælder, når værktøjets dokumentation allerede er engelsk, når outputtet skal bruges internationalt, eller når en fast promptskabelon faktisk er testet bedre på engelsk.

Brug dansk, når:

  • Brugeren skal forklare en kompleks lokal situation.

  • Outputtet skal bruges af danske kunder, borgere, medarbejdere eller ledere.

  • Nuance, tone og organisatorisk forståelse er vigtigt.

  • Målet er bred adoption, ikke specialistoptimering.

  • Opgaven kræver dansk fagterminologi eller dansk juridisk/kulturel kontekst.

Hvad betyder det for AI agenter og automationer?

Når vi snakker AI agenter og AI automation, ændres dette ret markant, fordi de gentager de samme opgaver igen og igen.

En medarbejder, der bruger ChatGPT manuelt, laver måske få prompts om dagen. En agent kan køre mange gange i timen. En API-baseret arbejdsgang kan behandle store mængder ensartet information.

I den situation bør virksomheden ikke bare kopiere medarbejderens prompt ind i en automation. Den bør designe workflowet og skelne mellem fast prompt, brugerinput, kildedata, modelvalg, review og de steder, hvor mennesker skal godkende output. Der skal også tages stilling til, hvad der skal være dansk for at bevare nuance, og hvad der kan ligge på engelsk bag kulissen.

I flere lange opgaver viste testen, at kildematerialet betyder mere end promptsproget. Det er et vigtigt fund for agentarbejde. Hvis en agent får alt for meget rå tekst, bliver gevinsten ved at oversætte den faste prompt hurtigt lille.

Her er det ofte mere effektivt at gøre systemprompten kortere, fjerne gentagelser uden effekt, strukturere kildedata bedre og dele opgaven op i mindre trin.

Test dansk og engelsk i jeres egne AI prompts

Hvis I vil teste jeres sprogvalg, så behøver I ikke at starte stort.

Start med tre arbejdsgange: en almindelig medarbejderopgave som mail, mødenote eller opsummering, en gentagen workflow-opgave som kundeservice, tilbud, contentbrief eller interne rapporter, og en lang kildeopgave som referat, politik, kontraktuddrag, vidensartikel eller lignende.

Test hver opgave i mindst tre varianter. Først dansk prompt til dansk output. Så engelsk prompt til dansk output. Til sidst en hybrid, hvor faste prompts er engelske, mens brugerinput og output er dansk.

Mål ikke kun tokens. Kig også på, om medarbejderen forstår prompten, om outputtet kan bruges uden tung omskrivning, om faglige begreber bevares korrekt, om svaret følger jeres tone og format, om modellen holder sig til dansk, og om eventuelle fejl er acceptable i jeres proces.

Det er især vigtigt at teste med de mennesker, der faktisk skal bruge workflowet. En prompt, der ser elegant ud for en AI specialist, kan være dårlig i hænderne på en travl medarbejder, hvis den er svær at forstå eller føles fremmed.

Begrænsninger i undersøgelsen

Ingen enkelt test kan afgøre, hvordan alle modeller og alle virksomheder bør arbejde.

Derfor er det vigtigt at læse testen med de rigtige ”briller på”:

  • Testen bruger syntetiske danske forretningsscenarier, ikke kundedata.

  • Testen måler udvalgte modelspor på et bestemt tidspunkt.

  • Modeller, tokenizere og outputadfærd ændrer sig løbende.

  • Testen er ikke en fuld modelrangliste.

  • Testen viser mønstre, som virksomheder bør bruge til egne benchmarks, ikke generelle regler der altid gælder.

Du kan læse mere om metode, kvalitetstjek og begrænsninger i den separate metodeoversigt.

Med det sagt er vi overbeviste om at testen er vigtig og giver værdi, ligesom vi får nuanceret spørgsmålet: "Skal vi altid bruge engelsk?"

Vi mener på baggrund af vores viden, at spørgsmålet i stedet bør være: "Hvor i vores AI arbejdsgange giver dansk, engelsk eller hybrid bedst kvalitet og effektivitet?"

HverdagsAIs anbefaling

Hvis vi skal koge undersøgelsen ned til én konkret anbefaling, er den her:

Brug dansk, hvor mennesker skal tænke, forklare, vurdere og bruge outputtet i en dansk kontekst. Test engelsk eller hybrid, hvor prompten er fast, teknisk og gentages ofte.

FAQ: dansk, engelsk og AI prompts

Er danske prompts altid længere end engelske?

Stort set altid, så længe det er større udenlandske modeller, men der kan være undtagelser. I vores test brugte danske prompts i gennemsnit flere tokens end tilsvarende engelske prompts, men forskellen varierede mellem modeller og opgavetyper. I lange opgaver med dansk kildemateriale var forskellen lille.

Bør danske medarbejdere prompte på engelsk?

Ikke som standard. Hvis medarbejderen arbejder med danske kunder, danske dokumenter eller dansk intern kommunikation, er dansk ofte det bedste udgangspunkt. Brug engelsk, når opgaven, kilderne eller den faste logik i workflowet faktisk peger den vej.

Hvornår er engelsk det bedste valg?

Engelsk er ofte stærkest i kodearbejde, international research, faste systemprompts og gentagne workflows, men kun når I har testet, at kvaliteten ikke falder.

Hvad betyder tokens i praksis?

Tænk på tokens som de små tekststykker, modellen læser og skriver med, når den arbejder med din opgave. En token er ikke altid det samme som et ord. Korte ord, tegn, dele af ord og mellemrum kan blive opdelt forskelligt afhængigt af modellen.

Hvorfor betyder dansk kildetekst så meget?

Hvis opgaven indeholder lange danske dokumenter, vil kilden ofte fylde langt mere end prompten. Her har vi set mere effekt af at rydde op i kilden end af at oversætte selve prompten.

Er det her en rangliste for modellerne?

Nej. Tabellen viser, hvordan modelsporene reagerede i denne test. Den siger ikke alene, hvilken model der er bedst for jeres virksomhed. Det kræver test af jeres egne opgaver, kilder og kvalitetskrav.

Få hjælp til at teste jeres AI arbejdsgange

Hvis AI skal bruges ordentligt i virksomheden, skal der være sammenhæng mellem promptskabeloner, modelvalg, datakilder, reviewlag og det at medarbejderne rent faktisk benytter værktøjerne.

Hos HverdagsAI hjælper vi danske virksomheder med AI kurser, AI agenter, AI automation, governance, EU AI Act og de arbejdsgange, der gør AI brugbar i hverdagen.

Vil I finde ud af, hvor dansk, engelsk eller hybrid giver bedst mening hos jer, kan vi hjælpe med at teste konkrete opgaver og omsætte resultaterne til skabeloner, træning og faste arbejdsgange.

Kontakt HverdagsAI om jeres AI arbejdsgange