
Vuoi che la tua valutazione LLM sia al top nel 2025? Noi di AIMOJO abbiamo visto troppi team fallire nel lancio dei loro modelli, tralasciando le metriche che contano davvero.
Se vuoi il tuo AI Per ottenere la fiducia degli utenti, dei clienti o degli enti regolatori, è necessario più di un semplice "controllo delle vibrazioni".
Sono necessari numeri concreti, formule chiare e una solida comprensione del significato di quei numeri.
Questa guida illustra le 12 principali metriche di valutazione LLM con formule pratiche, frammenti di codice e consigli di esperti, in modo da poter eseguire benchmark, debug e implementare i modelli con sicurezza.
Perché le metriche di valutazione LLM non sono negoziabili
I Large Language Model (LLM) gestiscono di tutto, dai chatbot agli assistenti di programmazione, ma i loro output possono essere imprevedibili. Ecco perché una valutazione affidabile è essenziale. Le metriche giuste ti aiutano a:

Le 12 principali metriche di valutazione LLM (con formule ed esempi)
Ecco la lista di riferimento per il 2025, che comprende le metriche classiche dell'NLP, i punteggi semantici moderni e le ultime novità in fatto di intelligenza artificiale responsabile.
1. Perplessità
ℹ️ Definizione: Misura la precisione con cui il modello prevede la parola successiva in una sequenza. Un valore inferiore è migliore.
Formula:

Dove N è il numero di parole, P (w i ∣w <i ) è la probabilità prevista della i -esima parola date le parole precedenti.
💡 Caso d'uso: Pre-addestramento, messa a punto e verifiche di fluidità nei modelli linguistici.
Esempio di Python:
import torch
import torch.nn.functional as F
def calculate_perplexity(logits, targets):
loss = F.cross_entropy(logits, targets)
return torch.exp(loss)
Interpretazione: Un livello di perplessità inferiore indica che il modello è più affidabile e preciso nelle sue previsioni.
2. Perdita di entropia incrociata
ℹ️ Definizione: Misura la differenza tra la distribuzione di probabilità prevista e la distribuzione reale.
Formula:

Dove p ( x ) è la distribuzione reale e q ( x ) è la distribuzione prevista.
💡 Caso d'uso: Funzione di perdita principale durante l'addestramento e la valutazione di LLM .
3. BLEU (Sottoscrittore di valutazione bilingue)
ℹ️ Definizione: Metrica basata sulla precisione per la sovrapposizione di n-grammi tra testi generati e testi di riferimento.
Formula:

Dove:
- BP=exp(1−c/r) se c
- wn: peso per ogni n-grammo (solitamente uniforme)
- pn: precisione n-gram modificata
Esempio di calcolo:
- Riferimento: “Il gatto è sullo zerbino”
- Output: “Il gatto sullo stuoia”
- BLU ≈ 0.709
Esempio di Python:
from nltk.translate.bleu_score import sentence_bleu
reference = ["The cat is on the mat".split()]
candidate = "The cat on the mat".split()
bleu_score = sentence_bleu(reference, candidate, weights=(0.5, 0.5))
Interpretazione: I punteggi vanno da 0 a 1; un punteggio più alto indica una migliore qualità per la traduzione, la sintesi e la generazione di codice.
4. ROUGE (Sottotitolo orientato al richiamo per la valutazione del riassunto)
ℹ️ Definizione: Metrica focalizzata sul richiamo che misura la sovrapposizione degli n-grammi, la sottosequenza comune più lunga e i bigrammi skip.
Varianti e formule chiave:
\( \text{ROUGE-N} = \frac{\text{\# n-grammi sovrapposti}}{\text{\# n-grammi nel riferimento}} \)
- ROUGE-L (LCS): In base alla lunghezza della sottosequenza comune più lunga.
- ROUGE-W: LCS ponderato, con ponderazione quadratica per partite consecutive.
- ROSSO-S: Sovrapposizione di bigrammi saltati.
Esempio di Python:
from rouge_score import rouge_scorer
scorer = rouge_scorer.RougeScorer(['rouge1', 'rouge2', 'rougeL'], use_stemmer=True)
scores = scorer.score("The cat is on the mat", "The cat on the mat")
Interpretazione: ROUGE > 0.4 è generalmente un buon risultato per le attività di riassunto.
5. METEOR (Metrica per la valutazione della traduzione con ordinamento esplicito)
ℹ️ Definizione: Combina precisione, richiamo, sinonimia e ordine delle parole per un confronto ricco di sfumature.
Formula:

Dove:
- Fsignificare è la media armonica di precisione e richiamo (con il richiamo ponderato più alto)
- La penalità si basa sul numero di blocchi e di partite.
Calcolo della penalità:

Dove C è il numero di blocchi, M è il numero di corrispondenze, γ e δ sono iperparametri.
Esempio di Python:
from nltk.translate.meteor_score import meteor_score
meteor_score(["The cat is on the mat".split()], "The cat on the mat".split())
Interpretazione: METEOR > 0.4 è un valore solido, soprattutto per la traduzione e i lavori creativi.
6. Punteggio BERT
ℹ️ Definizione: Utilizza gli embedding contestuali di BERT per misurare la somiglianza semantica tra testi generati e testi di riferimento.
Formula: (semplificata)

Dove e i ed e j sono rispettivamente gli embedding del candidato e del riferimento.
💡 Caso d'uso: Rilevamento di parafrasi, riassunto astrattivo, generazione creativa.
7. Punteggio di spostamento
ℹ️ Definizione: Misura la distanza semantica tra insiemi di word embedding, ispirata alla distanza di Earth Mover.
Formula:

Dove γ è una matrice di flusso, d è la distanza (ad esempio, il coseno) ed e i , e j sono gli embedding.
💡 Caso d'uso: Valuta la conservazione del significato anche in caso di modifiche alla formulazione.
8. Corrispondenza esatta (EM)
ℹ️ Definizione: Verifica se la risposta generata corrisponde esattamente al riferimento.
Formula:
\( \text{EM} = \frac{\text{\# corrispondenze esatte}}{\text{\# campioni totali}} \)
💡 Caso d'uso: Controllo qualità estrattivo, conformità, verifica dei fatti.
9. Punteggio F1
ℹ️ Definizione: Media armonica di precisione e richiamo per la sovrapposizione dei token.
Formula:
\( F_1 = 2 \cdot \frac{\text{Precisione} \cdot \text{Richiamo}}{\text{Precisione} + \text{Richiamo}} \)
Dove:
\( \text{Precisione} = \frac{\text{Veri positivi}}{\text{Veri positivi} + \text{Falsi positivi}} \)
\( \text{Ricordo} = \frac{\text{Veri positivi}}{\text{Veri positivi} + \text{Falsi negativi}} \)
💡 Caso d'uso: Controllo qualità, classificazione, estrazione di entità.
10. Parametri di parzialità e correttezza
ℹ️ Definizione: Quantifica le disparità nei risultati del modello tra i diversi gruppi demografici.
Metriche comuni:
- Parità demografica: Uguali tassi di previsione positiva nei vari gruppi.
- Pari opportunità: Uguali tassi di veri positivi.
- Rapporto di impatto disparato: Rapporto tra risultati positivi tra i gruppi.
Formula per l'impatto disparato:
\( \text{Impatto disparato} = \frac{\text{Pr}(\text{Risultato} \mid \text{Gruppo A})}{\text{Pr}(\text{Risultato} \mid \text{Gruppo B})} \)
💡 Casi d'uso: assunzioni, prestiti, assistenza sanitaria , piattaforme social.
11. Rilevamento della tossicità
ℹ️ Definizione: Misura la presenza di contenuti dannosi, offensivi o inappropriati.
Strumenti comuni: API Perspective, Detoxify.
Indicatore: Percentuale di output segnalati come tossici.
Formula:
\( \text{Tasso di tossicità} = \frac{\# \text{ emissioni tossici}}{\# \text{ emissioni totali}} \)
💡 Caso d'uso: Chatbot, moderazione, assistenza clienti.
12. Latenza ed efficienza computazionale
ℹ️ Definizione: Tiene traccia del tempo di risposta e dell'utilizzo delle risorse.
Metrica:
- latenza: Tempo per risposta (in ms o s).
- Throughput: Numero di uscite al secondo.
- Utilizzo delle risorse: Consumo di CPU/GPU/memoria.
Formula per la latenza:
\( \text{Latenza} = \frac{\text{Tempo totale}}{\# \text{ Output}} \)
💡 Caso d'uso: sistemi in tempo reale, SaaS , intelligenza artificiale integrata.
Metriche specializzate per RAG e LLM agentici
Con l'avvento dei flussi di lavoro RAG (Retrieval-Augmented Generation) e LLM agentici, sono emerse nuove metriche:
1. Fedeltà (RAG)
Definizione: Misura la coerenza fattuale tra la risposta generata e il contesto recuperato.
Formula:
\( \text{Fedeltà} = \frac{\# \text{ affermazioni supportate dal contesto}}{\# \text{ affermazioni totali}} \)
Intervallo: da 0 (peggiore) a 1 (migliore).
2. Pertinenza della risposta
Definizione: Grado in cui una risposta risponde alla richiesta o al contesto.
Formula:
\( \text{Pertinenza della risposta} = \frac{\# \text{ risposte pertinenti}}{\# \text{ risposte totali}} \)
3. Rilevanza del contesto (RAG)
Definizione: Misura quanto il contesto recuperato sia rilevante per la domanda.
Formula:
\( \text{Rilevanza del contesto} = \frac{\# \text{ elementi di contesto rilevanti}}{\# \text{ elementi di contesto totali}} \)
4. Tasso di allucinazioni
Definizione: Proporzione di output che contengono informazioni inventate o non supportate da prove.
Formula:
\( \text{Tasso di allucinazioni} = \frac{\# \text{ output allucinatori}}{\# \text{ output totali}} \)
Migliori pratiche per la valutazione LLM nel 2025

Esempio pratico: valutazione di un chatbot RAG
Supponiamo che tu stia creando un chatbot RAG per il settore sanitario . Ecco un esempio di stack di metriche:
| Metrico | Formula/Metodo | Obiettivo |
|---|---|---|
| Perplessità | Vedi sopra | <15 |
| ROUGE-L | Sovrapposizione basata su LCS | > 0.4 |
| Punteggio BERTS | Incorporare la somiglianza | > 0.85 |
| Fedeltà | Dichiarazioni/contesto supportati | > 0.95 |
| Allucinazione | Vedi sopra | <5% |
| Tasso di tossicità | Vedi sopra | <1% |
| Latenza | Tempo per risposta | <1s |
| Parzialità/equità | Rapporto di impatto disparato | 0.8-1.25 |
Considerazioni finali
Non rischiare la catastrofe AI fallimenti! Le metriche che hai appena scoperto non sono solo numeri: sono la tua arma segreta per dominare il AI panorama nel 2025. Mentre i tuoi concorrenti lottano con modelli allucinanti e utenti arrabbiati, tu implementerai LLM impeccabili che effettivamente danno risultati.
Perché la maggior parte dei team fallisce AI Valutazione (e come non farla)
Ricorda: senza un benchmarking adeguato, il tuo modello all'avanguardia è solo una costosa macchina delle allucinazioni. Applica subito queste 12 metriche per:
✅ Aumentare alle stelle la fiducia degli utenti
✅ Riduci i tempi di sviluppo
✅ Elimina i costi AI errori
✅ Supera i concorrenti più grandi
Restate sintonizzati per AIMOJO per ulteriori guide esperte, trucchi del flusso di lavoro e le ultime novità su LLMops, ingegneria rapida e AI notizie sugli agenti.


