Las 12 principales métricas y fórmulas de evaluación de LLM para AI Ventajas

Principales métricas y fórmulas de evaluación de LLM

¿Buscas perfeccionar tu evaluación de LLM en 2025? En AIMOJO, hemos visto a demasiados equipos fallar en el lanzamiento de sus modelos al omitir las métricas que realmente importan.

Si quieres tu AI Para que los usuarios, los clientes o los reguladores confíen en usted, necesita más que una simple “prueba de vibración”.

Necesita números concretos, fórmulas claras y una comprensión sólida de lo que significan esos números.

Esta guía desglosa las 12 principales métricas de evaluación de LLM con fórmulas prácticas, fragmentos de código y consejos de expertos, para que pueda comparar, depurar e implementar sus modelos con confianza.

Por qué las métricas de evaluación de LLM no son negociables

Los Modelos de Lenguaje Grandes (LLM) gestionan todo, desde chatbots hasta asistentes de código, pero sus resultados pueden ser impredecibles. Por eso, una evaluación robusta es esencial. Las métricas adecuadas te ayudan a:

Cuantificar el rendimiento:Sepa exactamente cómo se compara su modelo.
Encuentra debilidades:Detecta alucinaciones, sesgos o ineficiencia antes que los usuarios.
Cumplir con el cumplimiento:Cumplir con los estándares legales, éticos y de la industria.
Generar confianza:Métricas confiables = usuarios y partes interesadas más felices.
Evaluación de LLM y sus métricas

Las 12 principales métricas de evaluación de LLM (con fórmulas y ejemplos)

Aquí está su lista de referencia para 2025, que cubre métricas clásicas de PNL, puntajes semánticos modernos y lo último en IA responsable.

1. Perplejidad

ℹ️ Definición: Mide la precisión con la que el modelo predice la siguiente palabra en una secuencia. Un valor menor es mejor.

Fórmula:

Fórmula de perplejidad de las métricas de evaluación de LLM

Donde N es el número de palabras, P (w i ∣w <i ) es la probabilidad predicha de la i -ésima palabra dadas las palabras anteriores.

💡 Caso de uso: Preentrenamiento, ajuste fino y comprobaciones de fluidez en modelos de lenguaje.

Ejemplo de pitón:

import torch
import torch.nn.functional as F

def calculate_perplexity(logits, targets):
    loss = F.cross_entropy(logits, targets)
    return torch.exp(loss)

Interpretación: Una menor perplejidad significa que el modelo es más fiable y preciso en sus predicciones.


2. Pérdida de entropía cruzada

ℹ️ Definición: Mide la diferencia entre la distribución de probabilidad predicha y la distribución verdadera.

Fórmula:

Métricas de evaluación de LLM: fórmula de pérdida de entropía cruzada

Donde p ( x ) es la distribución verdadera y q ( x ) es la distribución predicha.

💡 Caso de uso: Función de pérdida principal durante el entrenamiento y la evaluación de LLM .


3. BLEU (Estudiante de Evaluación Bilingüe)

ℹ️ Definición: Métrica basada en la precisión para la superposición de n-gramas entre textos generados y de referencia.

Fórmula:

Métricas de evaluación de LLM - Fórmula BLEU

Lugar:

  • BP=exp(1−c/r) si c
  • wn: peso para cada n-gramo (normalmente uniforme)
  • pn: precisión de n-gramas modificada

Ejemplo de cálculo:

  • Referencia: “El gato está en la alfombra”
  • Salida: “El gato en la alfombra”
  • AZUL ≈ 0.709

Ejemplo de pitón:

from nltk.translate.bleu_score import sentence_bleu
reference = ["The cat is on the mat".split()]
candidate = "The cat on the mat".split()
bleu_score = sentence_bleu(reference, candidate, weights=(0.5, 0.5))

Interpretación: Las puntuaciones van de 0 a 1; cuanto mayor sea la puntuación, mejor será para la traducción, el resumen y la generación de código.


4. ROUGE (Estudio orientado al recuerdo para la evaluación de ideas clave)

ℹ️ Definición: Métrica centrada en la recuperación que mide la superposición de n-gramas, la subsecuencia común más larga y los bigramas salteados.

Variantes y fórmulas clave:

\( \text{ROUGE-N} = \frac{\text{\# n-gramas superpuestos}}{\text{\# n-gramas en referencia}} \)

  • ROJO-L (LCS):Basado en la longitud de la subsecuencia común más larga.
  • ROJO-W:LCS ponderado, con ponderación cuadrática para partidos consecutivos.
  • ROJO-S:Superposición de bigramas salteados.

Ejemplo de pitón:

from rouge_score import rouge_scorer
scorer = rouge_scorer.RougeScorer(['rouge1', 'rouge2', 'rougeL'], use_stemmer=True)
scores = scorer.score("The cat is on the mat", "The cat on the mat")

Interpretación: Un valor de ROUGE > 0.4 ​​suele ser bueno para tareas de resumen.


5. METEOR (Métrica para la evaluación de la traducción con ordenamiento explícito)

ℹ️ Definición: Combina precisión, exhaustividad, sinonimia y orden de las palabras para una comparación matizada.

Fórmula:

Métricas de evaluación de LLM: Fórmula METEOR

Lugar:

  • Fmean es la media armónica de precisión y recuperación (con la recuperación ponderada más alta)
  • La penalización se basa en el número de fragmentos y coincidencias.

Cálculo de la penalización:

Métricas de evaluación de LLM: fórmula para el cálculo de penalizaciones

Donde C es el número de fragmentos, M es el número de coincidencias, y γ y δ son hiperparámetros.

Ejemplo de pitón:

from nltk.translate.meteor_score import meteor_score
meteor_score(["The cat is on the mat".split()], "The cat on the mat".split())

Interpretación: METEOR > 0.4 ​​es un resultado sólido, especialmente para tareas de traducción y creación.


6. Puntuación BERTS

ℹ️ Definición: Utiliza incrustaciones contextuales de BERT para medir la similitud semántica entre textos generados y de referencia.

Fórmula: (Simplificada)

Métricas de evaluación de LLM: fórmula BERTScore

Donde e i y e j son incrustaciones del candidato y de la referencia, respectivamente.

💡 Caso de uso: Detección de paráfrasis, resumen abstracto, generación creativa.


7. Puntuación de movimiento

ℹ️ Definición: Mide la distancia semántica entre conjuntos de incrustaciones de palabras, inspirada en la distancia de los transportadores de tierra.

Fórmula:

Métricas de evaluación de LLM: fórmula MoverScore

Donde γ es una matriz de flujo, d es la distancia (por ejemplo, coseno) y e i , e j son incrustaciones.

💡 Caso de uso: Evalúa la preservación del significado incluso con cambios en la redacción.


8. Coincidencia exacta (EM)

ℹ️ Definición: Comprueba si la respuesta generada coincide exactamente con la referencia.

Fórmula:

\( \text{EM} = \frac{\text{\# coincidencias exactas}}{\text{\# muestras totales}} \)

💡 Caso de uso: Control de calidad extractivo, cumplimiento normativo, verificación de hechos.


9. Puntuación F1

ℹ️ Definición: Media armónica de precisión y exhaustividad para la superposición de tokens.

Fórmula:

\( F_1 = 2 \cdot \frac{\text{Precisión} \cdot \text{Recuperación}}{\text{Precisión} + \text{Recuperación}} \)

Lugar:

\( \text{Precisión} = \frac{\text{Verdaderos positivos}}{\text{Verdaderos positivos} + \text{Falsos positivos}} \)

\( \text{Recordar} = \frac{\text{Verdaderos positivos}}{\text{Verdaderos positivos} + \text{Falsos negativos}} \)

💡 Caso de uso: Control de calidad, clasificación, extracción de entidades.


10. Métricas de sesgo y equidad

ℹ️ Definición: Cuantifica las disparidades en los resultados del modelo entre los distintos grupos demográficos.

Métricas comunes:

  • Paridad demográfica: Tasas de predicción positiva iguales en todos los grupos.
  • Igualdad de oportunidades: Tasas iguales de verdaderos positivos.
  • Relación de impacto dispar: Relación de resultados positivos entre los grupos.

Fórmula para el impacto dispar:

\( \text{Impacto dispar} = \frac{\text{Pr}(\text{Resultado} \mid \text{Grupo A})}{\text{Pr}(\text{Resultado} \mid \text{Grupo B})} \)

💡 Casos de uso: Contratación, préstamos, atención médica , plataformas sociales.


11. Detección de toxicidad

ℹ️ Definición: Mide la presencia de contenido dañino, ofensivo o inapropiado.

Herramientas comunes: API de Perspective, Detoxify.

Métrica: Porcentaje de productos clasificados como tóxicos.

Fórmula:

\( \text{Tasa de toxicidad} = \frac{\# \text{ salidas tóxicas}}{\# \text{ salidas totales}} \)

💡 Caso de uso: Chatbots, moderación, atención al cliente.


12. Latencia y eficiencia computacional

ℹ️ Definición: Realiza un seguimiento del tiempo de respuesta y el uso de recursos.

Métrica:

  • Estado latente: Tiempo por respuesta (en ms o s).
  • rendimiento: Número de salidas por segundo.
  • El uso de recursos: Consumo de CPU/GPU/memoria.

Fórmula para la latencia:

\( \text{Latencia} = \frac{\text{Tiempo total}}{\# \text{Salidas}} \)

💡 Caso de uso: Sistemas en tiempo real, SaaS , IA integrada.


Métricas especializadas para RAG y LLM de Agentic

Con el auge de la Generación Aumentada por Recuperación (RAG) y los flujos de trabajo LLM agentes, han surgido nuevas métricas:

1. Fidelidad (RAG)

Definición: Mide la coherencia fáctica entre la respuesta generada y el contexto recuperado.

Fórmula:

\( \text{Fidelidad} = \frac{\# \text{ afirmaciones respaldadas por el contexto}}{\# \text{ total de afirmaciones}} \)

Rango: 0 (peor) a 1 (mejor).

2. Relevancia de la respuesta

Definición: Grado en que una respuesta aborda la pregunta o el contexto.

Fórmula:

\( \text{Relevancia de la respuesta} = \frac{\# \text{ respuestas relevantes}}{\# \text{ respuestas totales}} \)

3. Relevancia del contexto (RAG)

Definición: Mide la relevancia del contexto recuperado para la pregunta.

Fórmula:

\( \text{Relevancia del contexto} = \frac{\# \text{ elementos de contexto relevantes}}{\# \text{ elementos de contexto totales}} \)

4. Tasa de alucinaciones

Definición: Proporción de resultados que contienen información inventada o sin fundamento.

Fórmula:

\( \text{Tasa de alucinaciones} = \frac{\# \text{ resultados alucinados}}{\# \text{ resultados totales}} \)

Mejores prácticas para la evaluación de maestrías en derecho en 2025

Utilice conjuntos de datos de referencia y personalizados:GLUE, SuperGLUE, SQuAD y corpus específicos del dominio.
Automatizar controles rutinarios, muestras para revisión humana:Especialmente para sesgo, alucinación y seguridad.
Monitorear en producción:Realice el seguimiento de la deriva y vuelva a entrenar según sea necesario.
Personalízalo para tu caso de usoNo persiga puntuaciones en la clasificación: alinee con las necesidades del negocio y de los usuarios.

Ejemplo del mundo real: evaluación de un chatbot de RAG

Supongamos que estás creando un chatbot RAG para el sector sanitario . Aquí tienes un ejemplo de pila de métricas:

MétricoFórmula/MétodoObjetivo
PerplexityConsultar más arriba<15
ROJO-LSuperposición basada en LCS> 0.4
BERTpuntuaciónIncorporación de similitud> 0.85
FidelidadDeclaraciones respaldadas/contexto> 0.95
AlucinaciónConsultar más arriba<5%
Tasa de toxicidadConsultar más arriba<1%
Estado latenteTiempo por respuesta<1 s
Sesgo/JusticiaRelación de impacto dispar0.8-1.25

Conclusión

No te arriesgues a una catástrofe AI ¡Fracasos! Las métricas que acabas de descubrir no son solo números: son tu arma secreta para dominar el... AI paisaje en 2025. Mientras sus competidores luchan con modelos alucinantes y usuarios enojados, usted implementará LLM impecables que realmente cumplan.

¿Por qué la mayoría de los equipos fracasan? AI Evaluación (y cómo no la harás)

Recuerde: sin una evaluación comparativa adecuada, su modelo de vanguardia es solo una costosa máquina de alucinaciones. Aplique estas 12 métricas AHORA a:

✅ Aumenta la confianza de los usuarios
✅ Reducir el tiempo de desarrollo
✅ Eliminar costosas AI errores
✅ Superar a competidores más grandes

Estén atentos a AIMOJO Para obtener más guías de expertos, trucos de flujo de trabajo y lo último sobre LLMops, ingeniería rápida y AI Noticias del agente.

Deje un comentario

Su dirección de correo electrónico no será publicada. Las areas obligatorias están marcadas como requeridas *

Este sitio utiliza Akismet para reducir el spam. Descubre cómo se procesan los datos de tus comentarios.

Únete a los Aimojo ¡Tribu!

¡Únase a más de 76,000 miembros para recibir consejos exclusivos cada semana! 
🎁 BONUS: Obtenga nuestros $200 “AI “Mastery Toolkit” ¡GRATIS cuando te registras!

Tendencias AI Accesorios
Grok Bot

Siempre estás conectado AI Fuerza laboral que termina el trabajo Plataforma de agentes autónomos para la productividad empresarial y la automatización de tareas.

Hyper3D

Convierte cualquier imagen o texto en recursos 3D de calidad profesional en segundos. El AI Generador de modelos 3D diseñado para desarrolladores de videojuegos, equipos de producto y cineastas.

Mapificar

Convierte cualquier contenido en mapas mentales estructurados en segundos con IA. El más listo AI Herramienta de creación de mapas mentales y resúmenes para profesionales y estudiantes.

Zazu

El AI Asistente familiar que gestiona tu hogar mientras tú gestionas tu vida. Organización familiar inteligente para padres que trabajan, directamente en WhatsApp e iMessage.

EroLove AI

sin filtrar AI Amantes que realmente se acuerdan de ti, noche tras noche. 18+ NSFW AI Chat complementario con memoria editable y salas de grupo

© Copyright 2023 - 2026 | Conviértete en un AI Pro | Hecho con ♥