Spring til indhold
Guide Prompts

Sådan tester og forbedrer du prompts

Prompttest handler om stabilitet på tværs af realistiske inputs. Et enkelt godt svar siger næsten intet om, hvordan prompten fungerer på svære, korte eller mangelfulde cases.

3 min Begynder til øvet Kontrolleret 24. juli 2026

Kort svar: Prompttest handler om stabilitet på tværs af realistiske inputs. Et enkelt godt svar siger næsten intet om, hvordan prompten fungerer på svære, korte eller mangelfulde cases.

En prompt er først god, når den virker på flere cases

En prompt kan ikke vurderes på ét flot eksempel. Brug et lille fast testsæt, definer hvad “godt” betyder, og sammenlign ændringer på de samme cases, så du ved, hvad der faktisk blev bedre.

Byg et eval-sæt før du finpudser formuleringen

En prompt skal udtrække handlinger fra mødereferater. Testsættet har 20 møder: klare handlinger, implicitte forslag, ingen handlinger, flere ejere og manglende deadlines. Hver case vurderes på precision og falske handlinger.

Sammenlign versioner med samme input

  1. 1. Definér opgaven og de vigtigste fejltyper.
  2. 2. Saml 10-50 repræsentative testcases, inklusiv særlige grænsetilfælde.
  3. 3. Skriv evalueringskriterier før du ser output.
  4. 4. Kør samme prompt/modelopsætning på hele sættet.
  5. 5. Gruppér fejl og ændr prompten målrettet.
  6. 6. Regressionstest så en forbedring ikke ødelægger tidligere gode cases.

Lad ikke én flot demo blive din test

  • At udvælge cases efter du har set output.
  • At bruge kun succesfulde, rene inputs.
  • At ændre flere ting samtidig og miste årsagssammenhæng.

Kør en lille A/B-test på egne cases

Lav et testsæt på ti cases til en prompt du bruger ofte. Giv hver case en forventning og en 0/1-godkendelse før du tester.

Log fejltyper og regressions

  • Repræsenterer testsættet virkelige variationer?
  • Er kriterierne observerbare?
  • Gemmer du versioner og regressioner?

Et eval-sæt skal ligne variationen i virkeligheden

Bruger du prompten på kundemails, skal testen ikke bestå af fem næsten identiske pæne mails. Tag korte, lange, tvetydige, mangelfulde og irriterende cases med. Har du kendte fejl fra tidligere, er de ekstra værdifulde som regressionscases.

Score kun kriterier, der kan bedømmes nogenlunde konsekvent. Til klassifikation kan det være korrekt label. Til tekst kan det være faktatrofasthed, komplethed og antal redaktionelle rettelser. “Lyder godt” er et svagt mål, fordi to godkendere let mener forskellige ting.

Frys model, promptversion og testinput under sammenligningen. Ellers ved du ikke, hvilken ændring der gav forskellen.

Fortsæt med agent- og workflow-evaluering

FAQ

Spørgsmål om emnet

Hvad er hovedpointen i “Sådan tester og forbedrer du prompts”?

Prompttest handler om stabilitet på tværs af realistiske inputs. Et enkelt godt svar siger næsten intet om, hvordan prompten fungerer på svære, korte eller mangelfulde cases.

Hvordan kan jeg øve det?

Lav et testsæt på ti cases til en prompt du bruger ofte. Giv hver case en forventning og en 0/1-godkendelse før du tester.

Hvilken fejl bør jeg især undgå?

At udvælge cases efter du har set output.

Hvornår er min løsning god nok til at bruge?

Brug disse kontrolspørgsmål: Repræsenterer testsættet virkelige variationer? Er kriterierne observerbare? Gemmer du versioner og regressioner?

Kilder

Officielle kilder og dokumentation

Dit bibliotek

Byg dit eget AI-bibliotek

Gem prompts og workflows, vælg dine interesser og få en læringssti, der peger videre i stedet for at starte forfra.

Opret profil