
Quer aprimorar sua avaliação de Mestrado em Direito em 2025? Na AIMOJO, vimos muitas equipes fracassarem no lançamento de seus modelos por ignorarem as métricas que realmente importam.
Se você quiser o seu AI para ser confiável - por usuários, clientes ou reguladores - você precisa de mais do que apenas uma "verificação de vibração".
Você precisa de números concretos, fórmulas claras e uma compreensão sólida do que esses números significam.
Este guia detalha as 12 principais métricas de avaliação do LLM com fórmulas práticas, trechos de código e dicas de especialistas, para que você possa comparar, depurar e implantar seus modelos com confiança.
Por que as métricas de avaliação do LLM não são negociáveis
Grandes Modelos de Linguagem (LLMs) executam tudo, de chatbots a assistentes de código, mas seus resultados podem ser imprevisíveis. É por isso que uma avaliação robusta é essencial. As métricas certas ajudam você a:

As 12 principais métricas de avaliação de LLM (com fórmulas e exemplos)
Esta é sua lista de referência para 2025, abrangendo métricas clássicas de PNL, pontuações semânticas modernas e o que há de mais recente em IA responsável.
1. Perplexidade
ℹ️ Definição: Mede a precisão com que o modelo prevê a próxima palavra em uma sequência. Quanto menor, melhor.
Fórmula:

Onde N é o número de palavras, P (w i ∣w <i ) é a probabilidade prevista da i -ésima palavra dadas as palavras anteriores.
💡 Caso de uso: Pré-treinamento, ajuste fino e verificação de fluência em modelos de linguagem.
Exemplo de Python:
import torch
import torch.nn.functional as F
def calculate_perplexity(logits, targets):
loss = F.cross_entropy(logits, targets)
return torch.exp(loss)
Interpretação: Menor perplexidade significa que o modelo tem mais confiança e precisão em suas previsões.
2. Perda de entropia cruzada
ℹ️ Definição: Mede a diferença entre a distribuição de probabilidade prevista e a distribuição verdadeira.
Fórmula:

Onde p ( x ) é a distribuição verdadeira e q ( x ) é a distribuição prevista.
💡 Caso de uso: Função de perda principal durante o treinamento e avaliação do LLM .
3. BLEU (Estudante de Avaliação Bilíngue)
ℹ️ Definição: Métrica baseada na precisão para sobreposição de n-gramas entre textos gerados e de referência.
Fórmula:

Onde:
- BP=exp(1−c/r) se c
- wn: peso para cada n-grama (geralmente uniforme)
- pn: precisão de n-grama modificada
Exemplo de Cálculo:
- Referência: “O gato está no tapete”
- Saída: “O gato no tapete”
- AZUL ≈ 0.709
Exemplo de Python:
from nltk.translate.bleu_score import sentence_bleu
reference = ["The cat is on the mat".split()]
candidate = "The cat on the mat".split()
bleu_score = sentence_bleu(reference, candidate, weights=(0.5, 0.5))
Interpretação: As pontuações variam de 0 a 1; quanto maior, melhor para tradução, sumarização e geração de código.
4. ROUGE (Estudo orientado à recordação para avaliação de significado)
ℹ️ Definição: Métrica focada em recall que mede a sobreposição de n-gramas, a maior subsequência comum e os skip-bigramas.
Principais variantes e fórmulas:
\( \text{ROUGE-N} = \frac{\text{\# n-gramas sobrepostos}}{\text{\# n-gramas em referência}} \)
- ROUGE-L (LCS):Com base no comprimento da maior subsequência comum.
- ROUGE-W: LCS ponderado, com ponderação quadrática para partidas consecutivas.
- VERMELHO-S: Sobreposição de bigramas saltados.
Exemplo de Python:
from rouge_score import rouge_scorer
scorer = rouge_scorer.RougeScorer(['rouge1', 'rouge2', 'rougeL'], use_stemmer=True)
scores = scorer.score("The cat is on the mat", "The cat on the mat")
Interpretação: ROUGE > 0.4 geralmente é bom para tarefas de sumarização.
5. METEOR (Métrica para Avaliação de Tradução com Ordenação Explícita)
ℹ️ Definição: Combina precisão, memorização, sinonímia e ordem das palavras para uma comparação mais precisa.
Fórmula:

Onde:
- Fsignificar é a média harmônica de precisão e recall (com recall ponderado mais alto)
- A penalidade é baseada no número de blocos e correspondências.
Cálculo de penalidade:

Onde C é o número de blocos, M é o número de correspondências, γ e δ são hiperparâmetros.
Exemplo de Python:
from nltk.translate.meteor_score import meteor_score
meteor_score(["The cat is on the mat".split()], "The cat on the mat".split())
Interpretação: METEOR > 0.4 é sólido, especialmente para traduções e trabalhos criativos.
6. Pontuação BERTS
ℹ️ Definição: Utiliza embeddings contextuais do BERT para medir a similaridade semântica entre textos gerados e de referência.
Fórmula: (Simplificada)

Onde e i e e j são incorporações do candidato e da referência, respectivamente.
💡 Caso de uso: Detecção de paráfrases, sumarização abstrativa, geração criativa.
7. Pontuação do Mover
ℹ️ Definição: Mede a distância semântica entre conjuntos de representações vetoriais de palavras, inspirada na distância de deslocamento de terra.
Fórmula:

Onde γ é uma matriz de fluxo, d é a distância (por exemplo, cosseno) e e i , e j são imersões.
💡 Caso de uso: Avalia a preservação do significado mesmo com alterações na redação.
8. Correspondência exata (EM)
ℹ️ Definição: Verifica se a resposta gerada corresponde exatamente à referência.
Fórmula:
\( \text{EM} = \frac{\text{\# correspondências exatas}}{\text{\# amostras totais}} \)
💡 Caso de uso: Garantia de qualidade extrativa, conformidade, verificação de fatos.
9. Pontuação F1
ℹ️ Definição: Média harmônica da precisão e da revocação para sobreposição de tokens.
Fórmula:
\( F_1 = 2 \cdot \frac{\text{Precisão} \cdot \text{Recall}}{\text{Precisão} + \text{Recall}} \)
Onde:
\( \text{Precisão} = \frac{\text{Verdadeiros Positivos}}{\text{Verdadeiros Positivos} + \text{Falsos Positivos}} \)
\( \text{Recall} = \frac{\text{Verdadeiros Positivos}}{\text{Verdadeiros Positivos} + \text{Falsos Negativos}} \)
💡 Caso de uso: Controle de qualidade, classificação, extração de entidades.
10. Métricas de Viés e Imparcialidade
ℹ️ Definição: Quantifica as disparidades nos resultados do modelo entre grupos demográficos.
Métricas comuns:
- Paridade Demográfica: Taxas de previsão positiva iguais entre os grupos.
- Oportunidade igual: Taxas iguais de verdadeiros positivos.
- Taxa de Impacto Disparada: Proporção de resultados positivos entre grupos.
Fórmula para Impacto Disparado:
\( \text{Impacto Disparado} = \frac{\text{Pr}(\text{Resultado} \mid \text{Grupo A})}{\text{Pr}(\text{Resultado} \mid \text{Grupo B})} \)
💡 Casos de uso: Contratação, empréstimos, saúde , plataformas sociais.
11. Detecção de toxicidade
ℹ️ Definição: Mede a presença de conteúdo prejudicial, ofensivo ou inadequado.
Ferramentas comuns: API Perspective, Detoxify.
Métrica: Percentagem de produtos sinalizados como tóxicos.
Fórmula:
\( \text{Taxa de toxicidade} = \frac{\# \text{ saídas tóxicas}}{\# \text{ saídas totais}} \)
💡 Caso de uso: Chatbots, moderação, suporte ao cliente.
12. Latência e Eficiência Computacional
ℹ️ Definição: Monitora o tempo de resposta e o uso de recursos.
Métricas:
- latência: Tempo por resposta (em ms ou s).
- Taxa de transferência: Número de saídas por segundo.
- Uso de recursos: Consumo de CPU/GPU/memória.
Fórmula para Latência:
\( \text{Latência} = \frac{\text{Tempo total}}{\# \text{Saídas}} \)
💡 Caso de uso: Sistemas em tempo real, SaaS , IA embarcada.
Métricas especializadas para RAG e LLMs Agentic
Com o surgimento da Geração Aumentada de Recuperação (RAG) e dos fluxos de trabalho de LLM agênticos, novas métricas surgiram:
1. Fidelidade (RAG)
Definição: Mede a consistência factual entre a resposta gerada e o contexto recuperado.
Fórmula:
\( \text{Fidelidade} = \frac{\# \text{afirmações apoiadas pelo contexto}}{\# \text{total de afirmações}} \)
Intervalo: 0 (pior) a 1 (melhor).
2. Relevância da resposta
Definição: Grau em que uma resposta aborda a questão ou o contexto.
Fórmula:
\( \text{Relevância da resposta} = \frac{\# \text{ respostas relevantes}}{\# \text{ total de respostas}} \)
3. Relevância do Contexto (RAG)
Definição: Mede a relevância do contexto recuperado para a questão.
Fórmula:
\( \text{Relevância do contexto} = \frac{\# \text{itens de contexto relevantes}}{\# \text{total de itens de contexto}} \)
4. Taxa de alucinação
Definição: Proporção de resultados que contêm informações inventadas ou sem fundamento.
Fórmula:
\( \text{Taxa de alucinação} = \frac{\# \text{saídas alucinadas}}{\# \text{saídas totais}} \)
Melhores práticas para avaliação de LLM em 2025

Exemplo do mundo real: avaliando um chatbot RAG
Suponha que você esteja criando um chatbot RAG para o setor de saúde . Aqui está um exemplo de conjunto de métricas:
| métrico | Fórmula/Método | Meta |
|---|---|---|
| Perplexidade | Veja acima | <15 |
| ROUGE-L | Sobreposição baseada em LCS | > 0.4 |
| BERTScore | Incorporando similaridade | > 0.85 |
| Fidelidade | Declarações/contexto apoiados | > 0.95 |
| Alucinação | Veja acima | <% 5 |
| Taxa de toxicidade | Veja acima | <% 1 |
| Latência | Tempo por resposta | <1s |
| Preconceito/Justiça | Taxa de Impacto Dispar | 0.8-1.25 |
Considerações finais da análise do Fortune Dragon
Não arrisque uma catástrofe AI falhas! As métricas que você acabou de descobrir não são apenas números - elas são sua arma secreta para dominar o AI cenário em 2025. Enquanto seus concorrentes lutam com modelos alucinantes e usuários irritados, você implementará LLMs impecáveis que realmente entregam resultados.
Por que a maioria das equipes falha em AI Avaliação (e como você não fará isso)
Lembre-se: sem um benchmarking adequado, seu modelo de ponta é apenas uma máquina de alucinações cara. Aplique estas 12 métricas AGORA para:
✅ Aumenta a confiança dos usuários
✅ Reduza o tempo de desenvolvimento
✅ Elimine custos AI erros
✅ Supere concorrentes maiores
Fique ligado para AIMOJO para mais guias de especialistas, dicas de fluxo de trabalho e as últimas novidades sobre LLMops, engenharia de prompt e AI notícias do agente.


