
Möchten Sie Ihre LLM-Evaluierung im Jahr 2025 auf den Punkt bringen? Bei AIMOJO haben wir gesehen, wie viele Teams ihre Modellstarts vermasselt haben, indem sie die wirklich wichtigen Kennzahlen übersprungen haben.
Wenn du willst, AI Um das Vertrauen der Benutzer, Kunden oder Aufsichtsbehörden zu gewinnen, benötigen Sie mehr als nur eine „Stimmungsprüfung“.
Sie benötigen harte Zahlen, klare Formeln und ein solides Verständnis der Bedeutung dieser Zahlen.
Dieser Leitfaden erläutert die 12 wichtigsten LLM-Evaluierungsmetriken anhand praktischer Formeln, Codebeispielen und Expertentipps, damit Sie Ihre Modelle mit Zuversicht benchmarken, debuggen und bereitstellen können.
Warum LLM-Bewertungsmetriken nicht verhandelbar sind
Große Sprachmodelle (LLMs) steuern alles von Chatbots bis hin zu Code-Assistenten, ihre Ergebnisse können jedoch unvorhersehbar sein. Deshalb ist eine robuste Evaluierung unerlässlich. Die richtigen Metriken helfen Ihnen dabei:

Die 12 wichtigsten LLM-Bewertungsmetriken (mit Formeln und Beispielen)
Hier ist Ihre Liste mit den wichtigsten Themen für 2025 – mit klassischen NLP-Metriken, modernen semantischen Bewertungen und den neuesten Entwicklungen im Bereich verantwortungsvoller KI.
1. Ratlosigkeit
ℹ️ Definition: Misst, wie gut das Modell das nächste Wort in einer Sequenz vorhersagt. Je niedriger der Wert, desto besser.
Formel:

Dabei ist N die Anzahl der Wörter und P (w i ∣w <i ) die vorhergesagte Wahrscheinlichkeit des i -ten Wortes gegeben die vorherigen Wörter.
💡 Anwendungsfall: Vortraining, Feinabstimmung und Überprüfung der Sprachflüssigkeit in Sprachmodellen.
Python-Beispiel:
import torch
import torch.nn.functional as F
def calculate_perplexity(logits, targets):
loss = F.cross_entropy(logits, targets)
return torch.exp(loss)
Interpretation: Eine geringere Perplexität bedeutet, dass das Modell in seinen Vorhersagen zuverlässiger und genauer ist.
2. Kreuzentropieverlust
ℹ️ Definition: Misst die Differenz zwischen der vorhergesagten Wahrscheinlichkeitsverteilung und der wahren Verteilung.
Formel:

Wobei p ( x ) die wahre Verteilung und q ( x ) die vorhergesagte Verteilung ist.
💡 Anwendungsfall: Kernverlustfunktion während des LLM-Trainings und der Evaluierung.
3. BLEU (Zweisprachige Evaluationsstudie)
ℹ️ Definition: Präzisionsbasierte Metrik für die n-Gramm-Überlappung zwischen generierten und Referenztexten.
Formel:

Kennzahlen:
- BP=exp(1−c/r) wenn c
- wn: Gewicht für jedes N-Gramm (normalerweise einheitlich)
- pn: modifizierte N-Gramm-Präzision
Beispielrechnung:
- Referenz: „Die Katze ist auf der Matte“
- Ausgabe: „Die Katze auf der Matte“
- BLEU ≈ 0.709
Python-Beispiel:
from nltk.translate.bleu_score import sentence_bleu
reference = ["The cat is on the mat".split()]
candidate = "The cat on the mat".split()
bleu_score = sentence_bleu(reference, candidate, weights=(0.5, 0.5))
Interpretation: Die Punktzahlen reichen von 0 bis 1; je höher, desto besser für Übersetzung, Zusammenfassung und Codegenerierung.
4. ROUGE (Erinnerungsorientiertes Zweitstudium zur Bewertung des Lernstoffs)
ℹ️ Definition: Eine auf den Abruf fokussierte Metrik, die die Überlappung von n-Grammen, die längste gemeinsame Teilsequenz und Skip-Bigramme misst.
Wichtige Varianten und Formeln:
\( \text{ROUGE-N} = \frac{\text{\# überlappende N-Gramme}}{\text{\# N-Gramme in Referenz}} \)
- ROUGE-L (LCS): Basierend auf der Länge der längsten gemeinsamen Teilfolge.
- ROUGE-W: Gewichtetes LCS, mit quadratische Gewichtung für aufeinanderfolgende Spiele.
- ROUGE-S: Überlappung von Skip-Bigrammen.
Python-Beispiel:
from rouge_score import rouge_scorer
scorer = rouge_scorer.RougeScorer(['rouge1', 'rouge2', 'rougeL'], use_stemmer=True)
scores = scorer.score("The cat is on the mat", "The cat on the mat")
Interpretation: Ein ROUGE-Wert > 0.4 ist im Allgemeinen gut für Zusammenfassungsaufgaben.
5. METEOR (Metrik zur Bewertung von Übersetzungen mit expliziter Reihenfolge)
ℹ️ Definition: Kombiniert Präzision, Erinnerungswert, Synonymie und Wortstellung für einen differenzierten Vergleich.
Formel:

Kennzahlen:
- Fbedeuten ist das harmonische Mittel aus Präzision und Rückruf (wobei der Rückruf höher gewichtet wird)
- Die Strafe basiert auf der Anzahl der Chunks und Übereinstimmungen.
Strafberechnung:

Dabei ist C die Anzahl der Chunks, M die Anzahl der Matches, γ und δ sind Hyperparameter.
Python-Beispiel:
from nltk.translate.meteor_score import meteor_score
meteor_score(["The cat is on the mat".split()], "The cat on the mat".split())
Interpretation: METEOR > 0.4 ist solide, insbesondere für Übersetzungs- und kreative Aufgaben.
6. BERTScore
ℹ️ Definition: Nutzt Kontext-Embeddings von BERT , um die semantische Ähnlichkeit zwischen generierten und Referenztexten zu messen.
Formel: (Vereinfacht)

Wobei e i und e j Einbettungen vom Kandidaten bzw. der Referenz sind.
💡 Anwendungsfall: Paraphrasenerkennung, abstraktive Zusammenfassung, kreative Generierung.
7. MoverScore
ℹ️ Definition: Misst die semantische Distanz zwischen Mengen von Wortvektoren, inspiriert von der Earth Mover's Distance.
Formel:

Dabei ist γ eine Flussmatrix, d die Distanz (z. B. Kosinus) und e i , e j sind Einbettungen.
💡 Anwendungsfall: Bewertet die Bedeutungserhaltung auch bei Änderungen des Wortlauts.
8. Genaue Übereinstimmung (EM)
ℹ️ Definition: Überprüft, ob die generierte Antwort exakt mit der Referenz übereinstimmt.
Formel:
\( \text{EM} = \frac{\text{\# exakte Übereinstimmungen}}{\text{\# Stichproben gesamt}} \)
💡 Anwendungsfall: Extraktive Qualitätssicherung, Compliance, Faktenprüfung.
9. F1-Ergebnis
ℹ️ Definition: Harmonisches Mittel von Präzision und Trefferquote für Token-Überlappung.
Formel:
\( F_1 = 2 \cdot \frac{\text{Präzision} \cdot \text{Rückruf}}{\text{Präzision} + \text{Rückruf}} \)
Kennzahlen:
\( \text{Präzision} = \frac{\text{Wahre Positive}}{\text{Wahre Positive} + \text{Falsche Positive}} \)
\( \text{Erinnerung} = \frac{\text{Wahre Positive}}{\text{Wahre Positive} + \text{Falsche Negative}} \)
💡 Anwendungsfall: Qualitätssicherung, Klassifizierung, Entitätsextraktion.
10. Voreingenommenheits- und Fairnessmetriken
ℹ️ Definition: Quantifiziert Unterschiede in den Modellergebnissen zwischen verschiedenen demografischen Gruppen.
Gemeinsame Metriken:
- Demografische Parität: Gleiche positive Vorhersageraten in allen Gruppen.
- Chancengleichheit: Gleiche True-Positive-Raten.
- Verhältnis unterschiedlicher Auswirkungen: Verhältnis positiver Ergebnisse zwischen den Gruppen.
Formel für unterschiedliche Auswirkungen:
\( \text{Ungleiche Auswirkungen} = \frac{\text{Pr}(\text{Ergebnis} \mid \text{Gruppe A})}{\text{Pr}(\text{Ergebnis} \mid \text{Gruppe B})} \)
💡 Anwendungsfälle: Personalbeschaffung, Kreditvergabe, Gesundheitswesen , soziale Plattformen.
11. Toxizitätsnachweis
ℹ️ Definition: Misst das Vorhandensein schädlicher, anstößiger oder unangemessener Inhalte.
Gängige Tools: Perspective API, Detoxify.
Kennzahl: Prozentsatz der als toxisch gekennzeichneten Ausgaben.
Formel:
\( \text{Toxizitätsrate} = \frac{\# \text{ toxische Emissionen}}{\# \text{ Gesamtemissionen}} \)
💡 Anwendungsfall: Chatbots, Moderation, Kundensupport.
12. Latenz und Rechenleistung
ℹ️ Definition: Erfasst Reaktionszeit und Ressourcennutzung.
Metriken:
- Latenz: Zeit pro Antwort (in ms oder s).
- Durchsatz: Anzahl der Ausgaben pro Sekunde.
- Ressourcennutzung: CPU-/GPU-/Speicherverbrauch.
Formel für die Latenz:
\( \text{Latenz} = \frac{\text{Gesamtzeit}}{\# \text{ Ausgaben}} \)
💡 Anwendungsfall: Echtzeitsysteme, SaaS , eingebettete KI.
Spezialisierte Metriken für RAG- und Agentic-LLMs
Mit dem Aufkommen von Retrieval-Augmented Generation (RAG) und agentenbasierten LLM-Workflows sind neue Messgrößen entstanden:
1. Treue (RAG)
Definition: Misst die faktische Übereinstimmung zwischen der generierten Antwort und dem abgerufenen Kontext.
Formel:
\( \text{Treue} = \frac{\# \text{ Aussagen, die durch den Kontext unterstützt werden}}{\# \text{ Aussagen insgesamt}} \)
Bereich: 0 (schlechteste) bis 1 (beste).
2. Relevanz der Antwort
Definition: Grad, in dem eine Antwort auf die Frage oder den Kontext eingeht.
Formel:
\( \text{Antwortrelevanz} = \frac{\# \text{ relevante Antworten}}{\# \text{ Antworten insgesamt}} \)
3. Kontextrelevanz (RAG)
Definition: Misst, wie relevant der abgerufene Kontext für die Frage ist.
Formel:
\( \text{Kontextrelevanz} = \frac{\# \text{ relevante Kontextelemente}}{\# \text{ Kontextelemente gesamt}} \)
4. Halluzinationsrate
Definition: Anteil der Ausgaben, die erfundene oder nicht belegte Informationen enthalten.
Formel:
\( \text{Halluzinationsrate} = \frac{\# \text{ halluzinierte Ausgaben}}{\# \text{ Gesamtausgaben}} \)
Best Practices für die LLM-Evaluierung im Jahr 2025

Beispiel aus der Praxis: Evaluierung eines RAG-Chatbots
Angenommen, Sie entwickeln einen RAG-Chatbot für das Gesundheitswesen . Hier ist ein Beispiel für einen Metrik-Stack:
| Metrisch | Formel/Methode | Ziel |
|---|---|---|
| Verwirrung | Siehe oben | <15 |
| ROUGE-L | LCS-basierte Überlappung | > 0.4 |
| BERTScore | Einbettungsähnlichkeit | > 0.85 |
| Treue | Unterstützte Aussagen/Kontext | > 0.95 |
| Halluzination | Siehe oben | <5% |
| Toxizitätsrate | Siehe oben | <1% |
| Latency | Zeit pro Antwort | <1s |
| Voreingenommenheit/Fairness | Ungleiches Wirkungsverhältnis | 0.8-1.25 |
Fazit
Riskieren Sie keine Katastrophe AI Misserfolge! Die Kennzahlen, die Sie gerade entdeckt haben, sind nicht nur Zahlen - sie sind Ihre Geheimwaffe für die Dominanz der AI Landschaft im Jahr 2025. Während Ihre Konkurrenten mit halluzinierenden Modellen und verärgerten Benutzern kämpfen, setzen Sie einwandfreie LLMs ein, die tatsächlich Ergebnisse liefern.
Warum die meisten Teams scheitern bei AI Bewertung (und wie Sie dies nicht tun)
Denken Sie daran: Ohne angemessenes Benchmarking ist Ihr Spitzenmodell nur eine teure Illusionsmaschine. Wenden Sie diese 12 Kennzahlen JETZT an, um:
✅ Steigern Sie das Vertrauen der Benutzer
✅ Reduzieren Sie die Entwicklungszeit
✅ Eliminieren Sie kostspielige AI Schnitzer
✅ Übertreffen Sie größere Konkurrenten
Bleib dran AIMOJO für weitere Expertenleitfäden, Workflow-Hacks und das Neueste zu LLMops, Prompt Engineering und AI Agenten-Neuigkeiten.


