
¿Buscas perfeccionar tu evaluación de LLM en 2025? En AIMOJO, hemos visto a demasiados equipos fallar en el lanzamiento de sus modelos al omitir las métricas que realmente importan.
Si quieres tu AI Para que los usuarios, los clientes o los reguladores confíen en usted, necesita más que una simple “prueba de vibración”.
Necesita números concretos, fórmulas claras y una comprensión sólida de lo que significan esos números.
Esta guía desglosa las 12 principales métricas de evaluación de LLM con fórmulas prácticas, fragmentos de código y consejos de expertos, para que pueda comparar, depurar e implementar sus modelos con confianza.
Por qué las métricas de evaluación de LLM no son negociables
Los Modelos de Lenguaje Grandes (LLM) gestionan todo, desde chatbots hasta asistentes de código, pero sus resultados pueden ser impredecibles. Por eso, una evaluación robusta es esencial. Las métricas adecuadas te ayudan a:

Las 12 principales métricas de evaluación de LLM (con fórmulas y ejemplos)
Aquí está su lista de referencia para 2025, que cubre métricas clásicas de PNL, puntajes semánticos modernos y lo último en IA responsable.
1. Perplejidad
ℹ️ Definición: Mide la precisión con la que el modelo predice la siguiente palabra en una secuencia. Un valor menor es mejor.
Fórmula:

Donde N es el número de palabras, P (w i ∣w <i ) es la probabilidad predicha de la i -ésima palabra dadas las palabras anteriores.
💡 Caso de uso: Preentrenamiento, ajuste fino y comprobaciones de fluidez en modelos de lenguaje.
Ejemplo de pitón:
import torch
import torch.nn.functional as F
def calculate_perplexity(logits, targets):
loss = F.cross_entropy(logits, targets)
return torch.exp(loss)
Interpretación: Una menor perplejidad significa que el modelo es más fiable y preciso en sus predicciones.
2. Pérdida de entropía cruzada
ℹ️ Definición: Mide la diferencia entre la distribución de probabilidad predicha y la distribución verdadera.
Fórmula:

Donde p ( x ) es la distribución verdadera y q ( x ) es la distribución predicha.
💡 Caso de uso: Función de pérdida principal durante el entrenamiento y la evaluación de LLM .
3. BLEU (Estudiante de Evaluación Bilingüe)
ℹ️ Definición: Métrica basada en la precisión para la superposición de n-gramas entre textos generados y de referencia.
Fórmula:

Lugar:
- BP=exp(1−c/r) si c
- wn: peso para cada n-gramo (normalmente uniforme)
- pn: precisión de n-gramas modificada
Ejemplo de cálculo:
- Referencia: “El gato está en la alfombra”
- Salida: “El gato en la alfombra”
- AZUL ≈ 0.709
Ejemplo de pitón:
from nltk.translate.bleu_score import sentence_bleu
reference = ["The cat is on the mat".split()]
candidate = "The cat on the mat".split()
bleu_score = sentence_bleu(reference, candidate, weights=(0.5, 0.5))
Interpretación: Las puntuaciones van de 0 a 1; cuanto mayor sea la puntuación, mejor será para la traducción, el resumen y la generación de código.
4. ROUGE (Estudio orientado al recuerdo para la evaluación de ideas clave)
ℹ️ Definición: Métrica centrada en la recuperación que mide la superposición de n-gramas, la subsecuencia común más larga y los bigramas salteados.
Variantes y fórmulas clave:
\( \text{ROUGE-N} = \frac{\text{\# n-gramas superpuestos}}{\text{\# n-gramas en referencia}} \)
- ROJO-L (LCS):Basado en la longitud de la subsecuencia común más larga.
- ROJO-W:LCS ponderado, con ponderación cuadrática para partidos consecutivos.
- ROJO-S:Superposición de bigramas salteados.
Ejemplo de pitón:
from rouge_score import rouge_scorer
scorer = rouge_scorer.RougeScorer(['rouge1', 'rouge2', 'rougeL'], use_stemmer=True)
scores = scorer.score("The cat is on the mat", "The cat on the mat")
Interpretación: Un valor de ROUGE > 0.4 suele ser bueno para tareas de resumen.
5. METEOR (Métrica para la evaluación de la traducción con ordenamiento explícito)
ℹ️ Definición: Combina precisión, exhaustividad, sinonimia y orden de las palabras para una comparación matizada.
Fórmula:

Lugar:
- Fmean es la media armónica de precisión y recuperación (con la recuperación ponderada más alta)
- La penalización se basa en el número de fragmentos y coincidencias.
Cálculo de la penalización:

Donde C es el número de fragmentos, M es el número de coincidencias, y γ y δ son hiperparámetros.
Ejemplo de pitón:
from nltk.translate.meteor_score import meteor_score
meteor_score(["The cat is on the mat".split()], "The cat on the mat".split())
Interpretación: METEOR > 0.4 es un resultado sólido, especialmente para tareas de traducción y creación.
6. Puntuación BERTS
ℹ️ Definición: Utiliza incrustaciones contextuales de BERT para medir la similitud semántica entre textos generados y de referencia.
Fórmula: (Simplificada)

Donde e i y e j son incrustaciones del candidato y de la referencia, respectivamente.
💡 Caso de uso: Detección de paráfrasis, resumen abstracto, generación creativa.
7. Puntuación de movimiento
ℹ️ Definición: Mide la distancia semántica entre conjuntos de incrustaciones de palabras, inspirada en la distancia de los transportadores de tierra.
Fórmula:

Donde γ es una matriz de flujo, d es la distancia (por ejemplo, coseno) y e i , e j son incrustaciones.
💡 Caso de uso: Evalúa la preservación del significado incluso con cambios en la redacción.
8. Coincidencia exacta (EM)
ℹ️ Definición: Comprueba si la respuesta generada coincide exactamente con la referencia.
Fórmula:
\( \text{EM} = \frac{\text{\# coincidencias exactas}}{\text{\# muestras totales}} \)
💡 Caso de uso: Control de calidad extractivo, cumplimiento normativo, verificación de hechos.
9. Puntuación F1
ℹ️ Definición: Media armónica de precisión y exhaustividad para la superposición de tokens.
Fórmula:
\( F_1 = 2 \cdot \frac{\text{Precisión} \cdot \text{Recuperación}}{\text{Precisión} + \text{Recuperación}} \)
Lugar:
\( \text{Precisión} = \frac{\text{Verdaderos positivos}}{\text{Verdaderos positivos} + \text{Falsos positivos}} \)
\( \text{Recordar} = \frac{\text{Verdaderos positivos}}{\text{Verdaderos positivos} + \text{Falsos negativos}} \)
💡 Caso de uso: Control de calidad, clasificación, extracción de entidades.
10. Métricas de sesgo y equidad
ℹ️ Definición: Cuantifica las disparidades en los resultados del modelo entre los distintos grupos demográficos.
Métricas comunes:
- Paridad demográfica: Tasas de predicción positiva iguales en todos los grupos.
- Igualdad de oportunidades: Tasas iguales de verdaderos positivos.
- Relación de impacto dispar: Relación de resultados positivos entre los grupos.
Fórmula para el impacto dispar:
\( \text{Impacto dispar} = \frac{\text{Pr}(\text{Resultado} \mid \text{Grupo A})}{\text{Pr}(\text{Resultado} \mid \text{Grupo B})} \)
💡 Casos de uso: Contratación, préstamos, atención médica , plataformas sociales.
11. Detección de toxicidad
ℹ️ Definición: Mide la presencia de contenido dañino, ofensivo o inapropiado.
Herramientas comunes: API de Perspective, Detoxify.
Métrica: Porcentaje de productos clasificados como tóxicos.
Fórmula:
\( \text{Tasa de toxicidad} = \frac{\# \text{ salidas tóxicas}}{\# \text{ salidas totales}} \)
💡 Caso de uso: Chatbots, moderación, atención al cliente.
12. Latencia y eficiencia computacional
ℹ️ Definición: Realiza un seguimiento del tiempo de respuesta y el uso de recursos.
Métrica:
- Estado latente: Tiempo por respuesta (en ms o s).
- rendimiento: Número de salidas por segundo.
- El uso de recursos: Consumo de CPU/GPU/memoria.
Fórmula para la latencia:
\( \text{Latencia} = \frac{\text{Tiempo total}}{\# \text{Salidas}} \)
💡 Caso de uso: Sistemas en tiempo real, SaaS , IA integrada.
Métricas especializadas para RAG y LLM de Agentic
Con el auge de la Generación Aumentada por Recuperación (RAG) y los flujos de trabajo LLM agentes, han surgido nuevas métricas:
1. Fidelidad (RAG)
Definición: Mide la coherencia fáctica entre la respuesta generada y el contexto recuperado.
Fórmula:
\( \text{Fidelidad} = \frac{\# \text{ afirmaciones respaldadas por el contexto}}{\# \text{ total de afirmaciones}} \)
Rango: 0 (peor) a 1 (mejor).
2. Relevancia de la respuesta
Definición: Grado en que una respuesta aborda la pregunta o el contexto.
Fórmula:
\( \text{Relevancia de la respuesta} = \frac{\# \text{ respuestas relevantes}}{\# \text{ respuestas totales}} \)
3. Relevancia del contexto (RAG)
Definición: Mide la relevancia del contexto recuperado para la pregunta.
Fórmula:
\( \text{Relevancia del contexto} = \frac{\# \text{ elementos de contexto relevantes}}{\# \text{ elementos de contexto totales}} \)
4. Tasa de alucinaciones
Definición: Proporción de resultados que contienen información inventada o sin fundamento.
Fórmula:
\( \text{Tasa de alucinaciones} = \frac{\# \text{ resultados alucinados}}{\# \text{ resultados totales}} \)
Mejores prácticas para la evaluación de maestrías en derecho en 2025

Ejemplo del mundo real: evaluación de un chatbot de RAG
Supongamos que estás creando un chatbot RAG para el sector sanitario . Aquí tienes un ejemplo de pila de métricas:
| Métrico | Fórmula/Método | Objetivo |
|---|---|---|
| Perplexity | Consultar más arriba | <15 |
| ROJO-L | Superposición basada en LCS | > 0.4 |
| BERTpuntuación | Incorporación de similitud | > 0.85 |
| Fidelidad | Declaraciones respaldadas/contexto | > 0.95 |
| Alucinación | Consultar más arriba | <5% |
| Tasa de toxicidad | Consultar más arriba | <1% |
| Estado latente | Tiempo por respuesta | <1 s |
| Sesgo/Justicia | Relación de impacto dispar | 0.8-1.25 |
Conclusión
No te arriesgues a una catástrofe AI ¡Fracasos! Las métricas que acabas de descubrir no son solo números: son tu arma secreta para dominar el... AI paisaje en 2025. Mientras sus competidores luchan con modelos alucinantes y usuarios enojados, usted implementará LLM impecables que realmente cumplan.
¿Por qué la mayoría de los equipos fracasan? AI Evaluación (y cómo no la harás)
Recuerde: sin una evaluación comparativa adecuada, su modelo de vanguardia es solo una costosa máquina de alucinaciones. Aplique estas 12 métricas AHORA a:
✅ Aumenta la confianza de los usuarios
✅ Reducir el tiempo de desarrollo
✅ Eliminar costosas AI errores
✅ Superar a competidores más grandes
Estén atentos a AIMOJO Para obtener más guías de expertos, trucos de flujo de trabajo y lo último sobre LLMops, ingeniería rápida y AI Noticias del agente.


