As 12 principais métricas e fórmulas de avaliação de LLM para AI Prós

Principais métricas e fórmulas para avaliação de LLM

Quer aprimorar sua avaliação de Mestrado em Direito em 2025? Na AIMOJO, vimos muitas equipes fracassarem no lançamento de seus modelos por ignorarem as métricas que realmente importam.

Se você quiser o seu AI para ser confiável - por usuários, clientes ou reguladores - você precisa de mais do que apenas uma "verificação de vibração".

Você precisa de números concretos, fórmulas claras e uma compreensão sólida do que esses números significam.

Este guia detalha as 12 principais métricas de avaliação do LLM com fórmulas práticas, trechos de código e dicas de especialistas, para que você possa comparar, depurar e implantar seus modelos com confiança.

Por que as métricas de avaliação do LLM não são negociáveis

Grandes Modelos de Linguagem (LLMs) executam tudo, de chatbots a assistentes de código, mas seus resultados podem ser imprevisíveis. É por isso que uma avaliação robusta é essencial. As métricas certas ajudam você a:

Quantificar o desempenho: Saiba exatamente como seu modelo se compara.
Encontre fraquezas: Identifique alucinações, preconceitos ou ineficiência antes que os usuários o façam.
Atender a conformidade: Atender aos padrões legais, éticos e do setor.
Ganhar confiança: Métricas confiáveis ​​= usuários e partes interessadas mais felizes.
Avaliação de LLM e suas métricas

As 12 principais métricas de avaliação de LLM (com fórmulas e exemplos)

Esta é sua lista de referência para 2025, abrangendo métricas clássicas de PNL, pontuações semânticas modernas e o que há de mais recente em IA responsável.

1. Perplexidade

ℹ️ Definição: Mede a precisão com que o modelo prevê a próxima palavra em uma sequência. Quanto menor, melhor.

Fórmula:

Fórmula de Perplexidade das Métricas de Avaliação do LLM

Onde N é o número de palavras, P (w i ∣w <i ) é a probabilidade prevista da i -ésima palavra dadas as palavras anteriores.

💡 Caso de uso: Pré-treinamento, ajuste fino e verificação de fluência em modelos de linguagem.

Exemplo de Python:

import torch
import torch.nn.functional as F

def calculate_perplexity(logits, targets):
    loss = F.cross_entropy(logits, targets)
    return torch.exp(loss)

Interpretação: Menor perplexidade significa que o modelo tem mais confiança e precisão em suas previsões.


2. Perda de entropia cruzada

ℹ️ Definição: Mede a diferença entre a distribuição de probabilidade prevista e a distribuição verdadeira.

Fórmula:

Métricas de Avaliação LLM - Fórmula de Perda de Entropia Cruzada

Onde p ( x ) é a distribuição verdadeira e q ( x ) é a distribuição prevista.

💡 Caso de uso: Função de perda principal durante o treinamento e avaliação do LLM .


3. BLEU (Estudante de Avaliação Bilíngue)

ℹ️ Definição: Métrica baseada na precisão para sobreposição de n-gramas entre textos gerados e de referência.

Fórmula:

Métricas de Avaliação de LLM - Fórmula BLEU

Onde:

  • BP=exp(1−c/r) se c
  • wn: peso para cada n-grama (geralmente uniforme)
  • pn: precisão de n-grama modificada

Exemplo de Cálculo:

  • Referência: “O gato está no tapete”
  • Saída: “O gato no tapete”
  • AZUL ≈ 0.709

Exemplo de Python:

from nltk.translate.bleu_score import sentence_bleu
reference = ["The cat is on the mat".split()]
candidate = "The cat on the mat".split()
bleu_score = sentence_bleu(reference, candidate, weights=(0.5, 0.5))

Interpretação: As pontuações variam de 0 a 1; quanto maior, melhor para tradução, sumarização e geração de código.


4. ROUGE (Estudo orientado à recordação para avaliação de significado)

ℹ️ Definição: Métrica focada em recall que mede a sobreposição de n-gramas, a maior subsequência comum e os skip-bigramas.

Principais variantes e fórmulas:

\( \text{ROUGE-N} = \frac{\text{\# n-gramas sobrepostos}}{\text{\# n-gramas em referência}} \)

  • ROUGE-L (LCS):Com base no comprimento da maior subsequência comum.
  • ROUGE-W: LCS ponderado, com ponderação quadrática para partidas consecutivas.
  • VERMELHO-S: Sobreposição de bigramas saltados.

Exemplo de Python:

from rouge_score import rouge_scorer
scorer = rouge_scorer.RougeScorer(['rouge1', 'rouge2', 'rougeL'], use_stemmer=True)
scores = scorer.score("The cat is on the mat", "The cat on the mat")

Interpretação: ROUGE > 0.4 ​​geralmente é bom para tarefas de sumarização.


5. METEOR (Métrica para Avaliação de Tradução com Ordenação Explícita)

ℹ️ Definição: Combina precisão, memorização, sinonímia e ordem das palavras para uma comparação mais precisa.

Fórmula:

Métricas de Avaliação de LLM - Fórmula METEOR

Onde:

  • Fsignificar é a média harmônica de precisão e recall (com recall ponderado mais alto)
  • A penalidade é baseada no número de blocos e correspondências.

Cálculo de penalidade:

Métricas de Avaliação de LLM - Fórmula de Cálculo de Penalidade

Onde C é o número de blocos, M é o número de correspondências, γ e δ são hiperparâmetros.

Exemplo de Python:

from nltk.translate.meteor_score import meteor_score
meteor_score(["The cat is on the mat".split()], "The cat on the mat".split())

Interpretação: METEOR > 0.4 ​​é sólido, especialmente para traduções e trabalhos criativos.


6. Pontuação BERTS

ℹ️ Definição: Utiliza embeddings contextuais do BERT para medir a similaridade semântica entre textos gerados e de referência.

Fórmula: (Simplificada)

Métricas de Avaliação de LLM - Fórmula BERTScore

Onde e i e e j são incorporações do candidato e da referência, respectivamente.

💡 Caso de uso: Detecção de paráfrases, sumarização abstrativa, geração criativa.


7. Pontuação do Mover

ℹ️ Definição: Mede a distância semântica entre conjuntos de representações vetoriais de palavras, inspirada na distância de deslocamento de terra.

Fórmula:

Métricas de Avaliação de LLM - Fórmula MoverScore

Onde γ é uma matriz de fluxo, d é a distância (por exemplo, cosseno) e e i , e j são imersões.

💡 Caso de uso: Avalia a preservação do significado mesmo com alterações na redação.


8. Correspondência exata (EM)

ℹ️ Definição: Verifica se a resposta gerada corresponde exatamente à referência.

Fórmula:

\( \text{EM} = \frac{\text{\# correspondências exatas}}{\text{\# amostras totais}} \)

💡 Caso de uso: Garantia de qualidade extrativa, conformidade, verificação de fatos.


9. Pontuação F1

ℹ️ Definição: Média harmônica da precisão e da revocação para sobreposição de tokens.

Fórmula:

\( F_1 = 2 \cdot \frac{\text{Precisão} \cdot \text{Recall}}{\text{Precisão} + \text{Recall}} \)

Onde:

\( \text{Precisão} = \frac{\text{Verdadeiros Positivos}}{\text{Verdadeiros Positivos} + \text{Falsos Positivos}} \)

\( \text{Recall} = \frac{\text{Verdadeiros Positivos}}{\text{Verdadeiros Positivos} + \text{Falsos Negativos}} \)

💡 Caso de uso: Controle de qualidade, classificação, extração de entidades.


10. Métricas de Viés e Imparcialidade

ℹ️ Definição: Quantifica as disparidades nos resultados do modelo entre grupos demográficos.

Métricas comuns:

  • Paridade Demográfica: Taxas de previsão positiva iguais entre os grupos.
  • Oportunidade igual: Taxas iguais de verdadeiros positivos.
  • Taxa de Impacto Disparada: Proporção de resultados positivos entre grupos.

Fórmula para Impacto Disparado:

\( \text{Impacto Disparado} = \frac{\text{Pr}(\text{Resultado} \mid \text{Grupo A})}{\text{Pr}(\text{Resultado} \mid \text{Grupo B})} \)

💡 Casos de uso: Contratação, empréstimos, saúde , plataformas sociais.


11. Detecção de toxicidade

ℹ️ Definição: Mede a presença de conteúdo prejudicial, ofensivo ou inadequado.

Ferramentas comuns: API Perspective, Detoxify.

Métrica: Percentagem de produtos sinalizados como tóxicos.

Fórmula:

\( \text{Taxa de toxicidade} = \frac{\# \text{ saídas tóxicas}}{\# \text{ saídas totais}} \)

💡 Caso de uso: Chatbots, moderação, suporte ao cliente.


12. Latência e Eficiência Computacional

ℹ️ Definição: Monitora o tempo de resposta e o uso de recursos.

Métricas:

  • latência: Tempo por resposta (em ms ou s).
  • Taxa de transferência: Número de saídas por segundo.
  • Uso de recursos: Consumo de CPU/GPU/memória.

Fórmula para Latência:

\( \text{Latência} = \frac{\text{Tempo total}}{\# \text{Saídas}} \)

💡 Caso de uso: Sistemas em tempo real, SaaS , IA embarcada.


Métricas especializadas para RAG e LLMs Agentic

Com o surgimento da Geração Aumentada de Recuperação (RAG) e dos fluxos de trabalho de LLM agênticos, novas métricas surgiram:

1. Fidelidade (RAG)

Definição: Mede a consistência factual entre a resposta gerada e o contexto recuperado.

Fórmula:

\( \text{Fidelidade} = \frac{\# \text{afirmações apoiadas pelo contexto}}{\# \text{total de afirmações}} \)

Intervalo: 0 (pior) a 1 (melhor).

2. Relevância da resposta

Definição: Grau em que uma resposta aborda a questão ou o contexto.

Fórmula:

\( \text{Relevância da resposta} = \frac{\# \text{ respostas relevantes}}{\# \text{ total de respostas}} \)

3. Relevância do Contexto (RAG)

Definição: Mede a relevância do contexto recuperado para a questão.

Fórmula:

\( \text{Relevância do contexto} = \frac{\# \text{itens de contexto relevantes}}{\# \text{total de itens de contexto}} \)

4. Taxa de alucinação

Definição: Proporção de resultados que contêm informações inventadas ou sem fundamento.

Fórmula:

\( \text{Taxa de alucinação} = \frac{\# \text{saídas alucinadas}}{\# \text{saídas totais}} \)

Melhores práticas para avaliação de LLM em 2025

Use benchmark e conjuntos de dados personalizados: GLUE, SuperGLUE, SQuAD e corpora específicos de domínio.
Automatize verificações de rotina, amostra para revisão humana:Especialmente para preconceito, alucinação e segurança.
Monitor em produção: Monitore o desvio e retreine conforme necessário.
Personalize para seu caso de uso: Não persiga pontuações de classificação; alinhe-se às necessidades da empresa e dos usuários.

Exemplo do mundo real: avaliando um chatbot RAG

Suponha que você esteja criando um chatbot RAG para o setor de saúde . Aqui está um exemplo de conjunto de métricas:

métricoFórmula/MétodoMeta
PerplexidadeVeja acima<15
ROUGE-LSobreposição baseada em LCS> 0.4
BERTScoreIncorporando similaridade> 0.85
FidelidadeDeclarações/contexto apoiados> 0.95
AlucinaçãoVeja acima<% 5
Taxa de toxicidadeVeja acima<% 1
LatênciaTempo por resposta<1s
Preconceito/JustiçaTaxa de Impacto Dispar0.8-1.25

Considerações finais da análise do Fortune Dragon

Não arrisque uma catástrofe AI falhas! As métricas que você acabou de descobrir não são apenas números - elas são sua arma secreta para dominar o AI cenário em 2025. Enquanto seus concorrentes lutam com modelos alucinantes e usuários irritados, você implementará LLMs impecáveis ​​que realmente entregam resultados.

Por que a maioria das equipes falha em AI Avaliação (e como você não fará isso)

Lembre-se: sem um benchmarking adequado, seu modelo de ponta é apenas uma máquina de alucinações cara. Aplique estas 12 métricas AGORA para:

✅ Aumenta a confiança dos usuários
✅ Reduza o tempo de desenvolvimento
✅ Elimine custos AI erros
✅ Supere concorrentes maiores

Fique ligado para AIMOJO para mais guias de especialistas, dicas de fluxo de trabalho e as últimas novidades sobre LLMops, engenharia de prompt e AI notícias do agente.

Deixa um comentário

Seu endereço de e-mail não será publicado. Os campos obrigatórios estão marcados com um *

Este site utiliza o Akismet para reduzir spam. Saiba como seus dados de comentários são processados.

Participe no Aimojo Tribo!

Junte-se a mais de 76,000 membros para receber dicas privilegiadas toda semana! 
🎁 BONUS: Receba nossos $ 200 “AI “Kit de ferramentas de domínio” GRÁTIS ao se inscrever!

Tendência AI Ferramentas
Grok Bot

Você está sempre online AI Força de trabalho que conclui o trabalho Plataforma de Agentes Autônomos para Produtividade Empresarial e Automação de Tarefas

Hiper3D

Transforme qualquer imagem ou texto em recursos 3D de nível profissional em segundos. O AI Gerador de modelos 3D desenvolvido para desenvolvedores de jogos, equipes de produto e cineastas.

mapear

Transforme qualquer conteúdo em mapas mentais estruturados em segundos com IA. O menor AI Ferramenta de mapeamento mental e resumo para profissionais e estudantes.

Zazu

O AI Assistente familiar que administra sua casa enquanto você administra sua vida. Organização familiar inteligente para pais que trabalham, diretamente no WhatsApp e no iMessage.

EroLove IA

Não filtrado AI Amantes que realmente se lembram de você, noite após noite. 18+ NSFW AI Bate-papo complementar com memória editável e salas de grupo

© Copyright 2023 - 2026 | Torne-se um AI Pro | Feito com ♥