
Vil du have styr på din LLM-evaluering i 2025? Hos AIMOJO har vi set alt for mange teams fumle med deres modellanceringer ved at springe de metrikker over, der rent faktisk betyder noget.
Hvis du vil have din AI For at blive betroet af brugere, kunder eller tilsynsmyndigheder – behøver du mere end blot et "vibe-tjek".
Du har brug for hårde tal, klare formler og en solid forståelse af, hvad disse tal betyder.
Denne guide gennemgår de 12 vigtigste LLM-evalueringsmålinger med praktiske formler, kodestykker og eksperttips, så du kan benchmarke, debugge og implementere dine modeller med selvtillid.
Hvorfor LLM-evalueringsmålinger ikke er til forhandling
Store sprogmodeller (LLM'er) kører alt fra chatbots til kodeassistenter, men deres output kan være uforudsigeligt. Derfor er robust evaluering afgørende. De rigtige metrikker hjælper dig med at:

De 12 vigtigste evalueringsmetrikker for LLM (med formler og eksempler)
Her er din liste over de bedste resultater i 2025 – der dækker klassiske NLP-målinger, moderne semantiske scores og det seneste inden for ansvarlig AI.
1. Forvirring
ℹ️ Definition: Måler hvor godt modellen forudsiger det næste ord i en sekvens. Lavere er bedre.
Formel:

Hvor N er antallet af ord, er P (w i ∣w <i ) den forudsagte sandsynlighed for det i -te ord givet de foregående ord.
💡 Brugsscenarie: Forudtræning, finjustering og flydende kontrol i sprogmodeller.
Python-eksempel:
import torch
import torch.nn.functional as F
def calculate_perplexity(logits, targets):
loss = F.cross_entropy(logits, targets)
return torch.exp(loss)
Fortolkning: Lavere perpleksitet betyder, at modellen er mere sikker og præcis i sine forudsigelser.
2. Krydsentropitab
ℹ️ Definition: Måler forskellen mellem den forudsagte sandsynlighedsfordeling og den sande fordeling.
Formel:

Hvor p ( x ) er den sande fordeling, og q ( x ) er den forudsagte fordeling.
💡 Anvendelsesscenarie: Kernetabsfunktion under LLM-træning og -evaluering.
3. BLEU (Tosproget Evalueringsstuderende)
ℹ️ Definition: Præcisionsbaseret metrik for n-gram-overlap mellem genererede og referencetekster.
Formel:

Hvor:
- BP=exp(1−c/r) hvis c
- wnvægt for hvert n-gram (normalt ensartet)
- pnmodificeret n-gram præcision
Eksempel på beregning:
- Reference: “Katten er på måtten”
- Output: “Katten på måtten”
- BLEU ≈ 0.709
Python-eksempel:
from nltk.translate.bleu_score import sentence_bleu
reference = ["The cat is on the mat".split()]
candidate = "The cat on the mat".split()
bleu_score = sentence_bleu(reference, candidate, weights=(0.5, 0.5))
Fortolkning: Scorer går fra 0 til 1; jo højere, jo bedre for oversættelse, opsummering og kodegenerering.
4. ROUGE (Recall-Oriented Understudy for Gisting Evaluation)
ℹ️ Definition: Recall-fokuseret metrik, der måler n-gram-overlap, længste fælles delsekvens og skip-bigrammer.
Nøglevarianter og formler:
\( \text{ROUGE-N} = \frac{\text{\# overlappende n-gram}}{\text{\# n-gram i reference}} \)
- ROUGE-L (LCS)Baseret på længden af den længste fælles delsekvens.
- ROUGE-WVægtet LCS, med kvadratisk vægtning for sammenhængende kampe.
- ROUGE-SOverlap mellem skip-bigram.
Python-eksempel:
from rouge_score import rouge_scorer
scorer = rouge_scorer.RougeScorer(['rouge1', 'rouge2', 'rougeL'], use_stemmer=True)
scores = scorer.score("The cat is on the mat", "The cat on the mat")
Fortolkning: ROUGE > 0.4 er generelt god til opsummeringsopgaver.
5. METEOR (Metrik til evaluering af oversættelse med eksplicit ORDERING)
ℹ️ Definition: Kombinerer præcision, genkendelse, synonym og ordstilling for nuanceret sammenligning.
Formel:

Hvor:
- Fbetyde er den harmoniske middelværdi af præcision og recall (med recall vægtet højere)
- Straffen er baseret på antallet af chunks og matches.
Straffeberegning:

Hvor C er antallet af chunks, M er antallet af matches, og γ og δ er hyperparametre.
Python-eksempel:
from nltk.translate.meteor_score import meteor_score
meteor_score(["The cat is on the mat".split()], "The cat on the mat".split())
Fortolkning: METEOR > 0.4 er solid, især til oversættelse og kreative opgaver.
6. BERTScore
ℹ️ Definition: Bruger kontekstuelle indlejringer fra BERT til at måle semantisk lighed mellem genererede tekster og referencetekster.
Formel: (Forenklet)

Hvor ei og e j er indlejringer fra henholdsvis kandidaten og referencen.
💡 Brugsscenarie: Parafrasedetektion, abstrakt opsummering, kreativ generering.
7. MoverScore
ℹ️ Definition: Måler den semantiske afstand mellem sæt af ordindlejringer, inspireret af jordflytterens afstand.
Formel:

Hvor γ er en flowmatrix, d er afstanden (f.eks. cosinus), og ei , ej er indlejringer.
💡 Anvendelseseksempel: Evaluerer bevarelse af betydning, selv med ordskift.
8. Præcis match (EM)
ℹ️ Definition: Kontrollerer, om det genererede svar matcher referencen nøjagtigt.
Formel:
\( \text{EM} = \frac{\text{\# nøjagtige matches}}{\text{\# samlede prøver}} \)
💡 Brugsscenarie: Uddragende kvalitetssikring, compliance, faktatjek.
9. F1-score
ℹ️ Definition: Harmonisk middelværdi af præcision og genkaldelse for tokenoverlapning.
Formel:
(F_1 = 2 Præcision (Præcision) / Genkaldelse (Præcision + Genkaldelse))
Hvor:
\( \text{Præcision} = \frac{\text{Sande positive}}{\text{Sande positive} + \text{Falske positive}} \)
\( \text{Recall} = \frac{\text{Sande positive}}{\text{Sande positive} + \text{Falske negative}} \)
💡 Brugsscenarie: QA, klassificering, entitetsudtrækning.
10. Bias- og retfærdighedsmålinger
ℹ️ Definition: Kvantificerer forskelle i modeloutput på tværs af demografiske grupper.
Almindelige målinger:
- Demografisk paritet: Lige positive forudsigelsesrater på tværs af grupper.
- Lige muligheder: Lige sande positive rater.
- Uensartet effektforhold: Forholdet mellem positive resultater mellem grupper.
Formel for uensartet påvirkning:
\( \text{Uensartet effekt} = \frac{\text{Pr}(\text{Resultat} \mid \text{Gruppe A})}{\text{Pr}(\text{Resultat} \mid \text{Gruppe B})} \)
💡 Brugsscenarie: Ansættelse, udlån, sundhedspleje , sociale platforme.
11. Toksicitetsdetektion
ℹ️ Definition: Måler tilstedeværelsen af skadeligt, stødende eller upassende indhold.
Almindelige værktøjer: Perspective API, Detoxify.
Metrik: Procentdel af output markeret som giftige.
Formel:
\( \text{Toksicitetshastighed} = \frac{\# \text{ giftige output}}{\# \text{ samlede output}} \)
💡 Brugsscenarie: Chatbots, moderering, kundesupport.
12. Latens og beregningseffektivitet
ℹ️ Definition: Sporer svartid og ressourceforbrug.
Metrics:
- Reaktionstid: Tid pr. svar (i ms eller s).
- gennemløb: Antal udgange pr. sekund.
- Ressource brug: CPU/GPU/hukommelsesforbrug.
Formel for latenstid:
\( \text{Latens} = \frac{\text{Total tid}}{\# \text{ Output}} \)
💡 Brugsscenarie: Realtidssystemer, SaaS , indlejret AI.
Specialiserede målinger for RAG- og Agentic LLM'er
Med fremkomsten af Retrieval-Augmented Generation (RAG) og agentiske LLM-arbejdsgange er der dukket nye målinger op:
1. Trofasthed (RAG)
Definition: Måler faktuel overensstemmelse mellem genereret svar og hentet kontekst.
Formel:
\( \text{Trofasthed} = \frac{\# \text{ udsagn understøttet af kontekst}}{\# \text{ samlede udsagn}} \)
Interval: 0 (værst) til 1 (bedst).
2. Svarets relevans
Definition: I hvilken grad et svar adresserer prompten eller konteksten.
Formel:
\( \text{Svarets relevans} = \frac{\# \text{ relevante svar}}{\# \text{ samlede svar}} \)
3. Kontekstrelevans (RAG)
Definition: Måler, hvor relevant den hentede kontekst er for spørgsmålet.
Formel:
\( \text{Kontekstrelevans} = \frac{\# \text{ relevante kontekstelementer}}{\# \text{ samlede kontekstelementer}} \)
4. Hallucinationsrate
Definition: Andel af output, der indeholder opdigtede eller uunderbyggede oplysninger.
Formel:
\( \text{Hallucinationsrate} = \frac{\# \text{ hallucinerede output}}{\# \text{ samlede output}} \)
Bedste praksis for evaluering af LLM i 2025

Eksempel fra den virkelige verden: Evaluering af en RAG-chatbot
Forestil dig, at du bygger en RAG-chatbot til sundhedsvæsenet . Her er et eksempel på en metrikstak:
| metric | Formel/metode | mål |
|---|---|---|
| rådvildhed | Se ovenfor | <15 |
| ROUGE-L | LCS-baseret overlapning | > 0.4 |
| BERTScore | Integrering af lighed | > 0.85 |
| troskab | Understøttede udsagn/kontekst | > 0.95 |
| hallucination | Se ovenfor | <5% |
| Toksicitetsrate | Se ovenfor | <1% |
| Latency | Tid pr. svar | <1s |
| Bias/Retfærdighed | Uensartet påvirkningsforhold | 0.8-1.25 |
Afsluttende tanker
Risiker ikke katastrofe AI fiaskoer! De målinger, du lige har opdaget, er ikke bare tal - de er dit hemmelige våben til at dominere AI landskabet i 2025. Mens dine konkurrenter kæmper med hallucinerende modeller og vrede brugere, vil du implementere fejlfrie LLM'er, der rent faktisk leverer resultater.
Hvorfor de fleste hold fejler AI Evaluering (og hvordan du ikke vil)
Husk: Uden ordentlig benchmarking er din banebrydende model blot en dyr hallucinationsmaskine. Anvend disse 12 målinger NU til at:
✅ Brugertillid stiger voldsomt
✅ Reducer udviklingstiden
✅ Eliminer dyre AI brølere
✅ Overgå større konkurrenter
Bliv afstemt til AIMOJO for flere ekspertvejledninger, workflow-hacks og det seneste om LLMops, prompt engineering og AI agent nyheder.


