
გსურთ, რომ თქვენი LLM შეფასების თამაში 2025 წელს სათანადო დონეზე იყოს? AIMOJO-ში ძალიან ბევრ გუნდს უწევს შეცდომაში შეყვანა მოდელების გამოშვებაში იმ მეტრიკის გამოტოვებით, რაც რეალურად მნიშვნელოვანია.
თუ გინდა შენი AI მომხმარებლების, კლიენტების ან მარეგულირებლების ნდობის მოსაპოვებლად, თქვენ უბრალოდ „ვიბრაციის შემოწმებაზე“ მეტი რამ გჭირდებათ.
თქვენ გჭირდებათ ზუსტი რიცხვები, მკაფიო ფორმულები და ამ რიცხვების მნიშვნელობის მყარი გაგება.
ეს სახელმძღვანელო პრაქტიკული ფორმულების, კოდის ფრაგმენტებისა და ექსპერტების რჩევების გამოყენებით აანალიზებს LLM-ის შეფასების ტოპ 12 მეტრიკას , რათა თქვენ შეძლოთ თქვენი მოდელების ეტალონური ანალიზი, გამართვა და გამოყენება თავდაჯერებულად.
რატომ არის LLM შეფასების მეტრიკა შეუთანხმებელი
დიდი ენობრივი მოდელები (LLM) ყველაფერს იყენებს, ჩატბოტებიდან დაწყებული კოდის ასისტენტებით დამთავრებული, თუმცა მათი შედეგები შეიძლება არაპროგნოზირებადი იყოს. სწორედ ამიტომ არის აუცილებელი ზუსტი შეფასება. სწორი მეტრიკა დაგეხმარებათ:

LLM-ის შეფასების ტოპ 12 მეტრიკა (ფორმულებითა და მაგალითებით)
აქ მოცემულია 2025 წლისთვის სასურველი ვარიანტების სია, რომლებიც მოიცავს კლასიკურ NLP მეტრიკას, თანამედროვე სემანტიკურ ქულებს და პასუხისმგებლიანი ხელოვნური ინტელექტის უახლეს მიღწევებს.
1. გაურკვევლობა
ℹ️ განმარტება: ზომავს, თუ რამდენად კარგად პროგნოზირებს მოდელი შემდეგ სიტყვას თანმიმდევრობაში. რაც უფრო დაბალია, მით უკეთესი.
ფორმულა:

სადაც N სიტყვების რაოდენობაა, P (w i ∣w <i ) წინა სიტყვების გათვალისწინებით i- ური სიტყვის პროგნოზირებული ალბათობაა .
💡 გამოყენების შემთხვევა: ენობრივი მოდელების წინასწარი ტრენინგი, დახვეწა და თავისუფლად საუბრის შემოწმება.
Python-ის მაგალითი:
import torch
import torch.nn.functional as F
def calculate_perplexity(logits, targets):
loss = F.cross_entropy(logits, targets)
return torch.exp(loss)
ინტერპრეტაცია: დაბალი დაბნეულობა ნიშნავს, რომ მოდელი უფრო თავდაჯერებული და ზუსტია თავის პროგნოზებში.
2. ჯვარედინი ენტროპიის დანაკარგი
ℹ️ განმარტება: ზომავს პროგნოზირებულ ალბათურ განაწილებასა და ნამდვილ განაწილებას შორის სხვაობას.
ფორმულა:

სადაც p ( x ) არის ნამდვილი განაწილება და q ( x ) არის პროგნოზირებული განაწილება.
💡 გამოყენების შემთხვევა: ბირთვის დაკარგვის ფუნქცია LLM ტრენინგისა და შეფასების დროს.
3. BLEU (ორენოვანი შეფასების სტუდენტი)
ℹ️ განმარტება: გენერირებულ და საცნობარო ტექსტებს შორის n-გრამის გადაფარვის სიზუსტეზე დაფუძნებული მეტრიკა.
ფორმულა:

სად:
- BP=exp(1−c/r) თუ c
- wn: წონა თითოეული n-გრამისთვის (ჩვეულებრივ ერთგვაროვანი)
- pn: შეცვლილი n-გრამის სიზუსტე
გაანგარიშების მაგალითი:
- მინიშნება: „კატა ხალიჩაზეა“
- შედეგი: „კატა ხალიჩაზე“
- ლურჯი ≈ 0.709
Python-ის მაგალითი:
from nltk.translate.bleu_score import sentence_bleu
reference = ["The cat is on the mat".split()]
candidate = "The cat on the mat".split()
bleu_score = sentence_bleu(reference, candidate, weights=(0.5, 0.5))
ინტერპრეტაცია: ქულები მერყეობს 0-დან 1-მდე; რაც უფრო მაღალია, მით უკეთესია თარგმანის, შეჯამებისა და კოდის გენერირებისთვის.
4. ROUGE (გახსენებაზე ორიენტირებული ქვეტექსტი ენობრივი შეფასებისთვის)
ℹ️ განმარტება: გახსენებაზე ორიენტირებული მეტრიკა, რომელიც ზომავს n-გრამის გადაფარვას, ყველაზე გრძელ საერთო ქვემიმდევრობას და გამოტოვებულ ბიგრამებს.
ძირითადი ვარიანტები და ფორმულები:
\( \text{ROUGE-N} = \frac{\text{\# გადაფარვის n-გრამი}}{\text{\# n-გრამი მითითებაში}} \)
- ROUGE-L (LCS): დაფუძნებულია ყველაზე გრძელი საერთო ქვემიმდევრობის სიგრძეზე.
- რუჟ-ვ: შეწონილი LCS, კვადრატული წონა ზედიზედ მატჩებისთვის.
- ROUGE-S: ბიგრამის გადაფარვის გამოტოვება.
Python-ის მაგალითი:
from rouge_score import rouge_scorer
scorer = rouge_scorer.RougeScorer(['rouge1', 'rouge2', 'rougeL'], use_stemmer=True)
scores = scorer.score("The cat is on the mat", "The cat on the mat")
ინტერპრეტაცია: ROUGE > 0.4 ზოგადად კარგია შეჯამების ამოცანებისთვის.
5. METEOR (თარგმანის შეფასების მეტრიკა აშკარა თანმიმდევრობით)
ℹ️ განმარტება: ნიუანსირებული შედარებისთვის აერთიანებს სიზუსტეს, დამახსოვრებას, სინონიმობას და სიტყვათა თანმიმდევრობას.
ფორმულა:

სად:
- Fნიშნავს არის სიზუსტისა და დამახსოვრების ჰარმონიული საშუალო (მახსოვრების უფრო მაღალი წონით)
- ჯარიმა დაფუძნებულია დარტყმებისა და მატჩების რაოდენობაზე.
ჯარიმის გაანგარიშება:

სადაც C არის ბლოკების რაოდენობა, M არის შესაბამისობების რაოდენობა, γ და δ ჰიპერპარამეტრებია.
Python-ის მაგალითი:
from nltk.translate.meteor_score import meteor_score
meteor_score(["The cat is on the mat".split()], "The cat on the mat".split())
ინტერპრეტაცია: METEOR > 0.4 საკმაოდ კარგია, განსაკუთრებით თარგმანისა და შემოქმედებითი ამოცანებისთვის.
6. BERTScore
ℹ️ განმარტება: იყენებს BERT- ის კონტექსტუალურ ჩანერგვებს გენერირებულ და საცნობარო ტექსტებს შორის სემანტიკური მსგავსების გასაზომად.
ფორმულა: (გამარტივებული)

სადაც e i და e j , შესაბამისად, კანდიდატისა და მითითების ჩასმაა.
💡 გამოყენების შემთხვევა: პარაფრაზის ამოცნობა, აბსტრაქტული შეჯამება, შემოქმედებითი გენერირება.
7. MoverScore
ℹ️ განმარტება: ზომავს სიტყვათა ჩასმის ნაკრებებს შორის სემანტიკურ მანძილს, რომელიც შთაგონებულია დედამიწის მტვერსასრუტის მანძილით.
ფორმულა:

სადაც γ არის ნაკადის მატრიცა, d არის მანძილი (მაგ., კოსინუსი) და e i , e j არის ჩანერგვები.
💡 გამოყენების შემთხვევა: აფასებს მნიშვნელობის შენარჩუნებას ფორმულირების ცვლილებების მიუხედავად.
8. ზუსტი დამთხვევა (EM)
ℹ️ განმარტება: ამოწმებს, ზუსტად ემთხვევა თუ არა გენერირებული პასუხი მითითებას.
ფორმულა:
\( \text{EM} = \frac{\text{\# ზუსტი დამთხვევები}}{\text{\# ნიმუშების ჯამი}} \)
💡 გამოყენების შემთხვევა: ექსტრაქციული ხარისხის კონტროლი, შესაბამისობა, ფაქტების შემოწმება.
9. F1 ქულა
ℹ️ განმარტება: ტოკენების გადაფარვის სიზუსტისა და დამახსოვრების ჰარმონიული საშუალო.
ფორმულა:
( F_1 = 2 \cdot \frac{\text{სიზუსტე} \cdot \text{გახსენება}}{\text{სიზუსტე} + \text{გახსენება}} \)
სად:
\( \text{სიზუსტე} = \frac{\text{ჭეშმარიტი დადებითი}}{\text{ჭეშმარიტი დადებითი} + \text{ცრუ დადებითი}} \)
\( \text{გახსენება} = \frac{\text{ჭეშმარიტი დადებითი}}{\text{ჭეშმარიტი დადებითი} + \text{ცრუ უარყოფითი}} \)
💡 გამოყენების შემთხვევა: ხარისხის კონტროლი, კლასიფიკაცია, ერთეულის ამოღება.
10. მიკერძოებისა და სამართლიანობის მაჩვენებლები
ℹ️ განმარტება: განსაზღვრავს მოდელის შედეგებში არსებულ დისპროპორციებს დემოგრაფიულ ჯგუფებს შორის.
საერთო მეტრიკები:
- დემოგრაფიული პარიტეტი: ჯგუფებს შორის დადებითი პროგნოზირების თანაბარი მაჩვენებლები.
- Თანაბარი შესაძლებლობა: თანაბარი ნამდვილი დადებითი მაჩვენებლები.
- განსხვავებული ზემოქმედების თანაფარდობა: ჯგუფებს შორის დადებითი შედეგების თანაფარდობა.
არათანაბარი ზემოქმედების ფორმულა:
\( \text{განსხვავებული ზემოქმედება} = \frac{\text{Pr}(\text{შედეგი} \mid \text{ჯგუფი A})}{\text{Pr}(\text{შედეგი} \mid \text{ჯგუფი B})} \)
💡 გამოყენების შემთხვევები: დაქირავება, სესხების გაცემა, ჯანდაცვა , სოციალური პლატფორმები.
11. ტოქსიკურობის გამოვლენა
ℹ️ განმარტება: ზომავს მავნე, შეურაცხმყოფელი ან შეუფერებელი კონტენტის არსებობას.
გავრცელებული ინსტრუმენტები: Perspective API, Detoxify.
მეტრიკა: ტოქსიკურად მონიშნული გამომავალი მონაცემების პროცენტული მაჩვენებელი.
ფორმულა:
ტოქსიკურობის მაჩვენებელი = ტოქსიკური გამოსავლები (ტოქსიური გამოსავლები)
💡 გამოყენების შემთხვევები: ჩატბოტები, მოდერაცია, მომხმარებელთა მხარდაჭერა.
12. შეყოვნება და გამოთვლითი ეფექტურობა
ℹ️ განმარტება: აკონტროლებს რეაგირების დროს და რესურსების გამოყენებას.
მეტრიკა:
- ლატენტობა: თითო პასუხის დრო (მილიწამში ან წამში).
- გამტარუნარიანობა: გამომავალი სიგნალების რაოდენობა წამში.
- Რესურსების გამოყენება: CPU/GPU/მეხსიერების მოხმარება.
შეყოვნების ფორმულა:
\( \text{შეყოვნება} = \frac{\text{საერთო დრო}}{\# \text{გამომავალი}} \)
💡 გამოყენების შემთხვევა: რეალურ დროში მომუშავე სისტემები, SaaS , ჩაშენებული ხელოვნური ინტელექტი.
სპეციალიზებული მეტრიკები RAG და Agentic LLM-ებისთვის
გაძლიერებული მოძიების გენერაციის (RAG) და აგენტური LLM სამუშაო პროცესების აღზევებასთან ერთად, გაჩნდა ახალი მეტრიკები:
1. ერთგულება (RAG)
განმარტება: ზომავს ფაქტობრივ თანმიმდევრულობას გენერირებულ პასუხსა და მოძიებულ კონტექსტს შორის.
ფორმულა:
\( \text{ერთგულება} = \frac{\# \text{ კონტექსტით დადასტურებული დებულებები}}{\# \text{ სულ დებულებები}} \)
დიაპაზონი: 0 (ყველაზე ცუდი) 1-დან (საუკეთესო).
2. პასუხის შესაბამისობა
განმარტება: ხარისხი, რომლითაც პასუხი ეხება მოთხოვნას ან კონტექსტს.
ფორმულა:
\( \text{პასუხის შესაბამისობა} = \frac{\# \text{შესაბამისი პასუხები}}{\# \text{სულ პასუხები}} \)
3. კონტექსტის შესაბამისობა (RAG)
განმარტება: ზომავს, თუ რამდენად რელევანტურია მოძიებული კონტექსტი კითხვასთან.
ფორმულა:
\( \text{კონტექსტის შესაბამისობა} = \frac{\# \text{რელევანტური კონტექსტური ელემენტები}}{\# \text{კონტექსტური ელემენტების ჯამი}} \)
4. ჰალუცინაციების სიხშირე
განმარტება: გამომავალი მონაცემების წილი, რომელიც შეიცავს შეთითხნილ ან დაუსაბუთებელ ინფორმაციას.
ფორმულა:
ჰალუცინაციების სიხშირე = ჰალუცინირებული გამომავალი მონაცემები}}{ სულ გამომავალი მონაცემები})
LLM შეფასების საუკეთესო პრაქტიკა 2025 წელს

რეალური მაგალითი: RAG ჩატბოტის შეფასება
დავუშვათ, რომ თქვენ ქმნით ჯანდაცვის RAG ჩატბოტს . აქ მოცემულია მეტრიკის დასტის ნიმუში:
| Metric | ფორმულა/მეთოდი | სამიზნე |
|---|---|---|
| Perplexity | Იხილეთ ზემოთ | <15 |
| ROUGE-L | LCS-ზე დაფუძნებული გადაფარვა | > 0.4 |
| BERTScore | მსგავსების ჩასმა | > 0.85 |
| ერთგულება | მხარდაჭერილი განცხადებები/კონტექსტი | > 0.95 |
| ჰალუცინაცია | Იხილეთ ზემოთ | <5% |
| ტოქსიკურობის მაჩვენებელი | Იხილეთ ზემოთ | <1% |
| შეყოვნება | დრო თითო პასუხზე | <1 წ |
| მიკერძოება/სამართლიანობა | განსხვავებული ზემოქმედების თანაფარდობა | 0.8-1.25 |
საბოლოო ფიქრები
კატასტროფული რისკის ქვეშ ნუ აღმოჩნდებით AI წარუმატებლობები! თქვენ მიერ აღმოჩენილი მაჩვენებლები მხოლოდ ციფრები არ არის - ისინი თქვენი საიდუმლო იარაღია დომინირებისთვის AI ლანდშაფტი 2025 წელს. სანამ თქვენი კონკურენტები ჰალუცინაციების მომგვრელი მოდელებითა და გაბრაზებული მომხმარებლებით იბრძვიან, თქვენ გამოიყენებთ უნაკლო, მაგრამ შედეგიან LLM-ებს.
რატომ ამთავრებენ გუნდების უმეტესობა წარუმატებლობას AI შეფასება (და როგორ არ გააკეთებთ ამას)
გახსოვდეთ: სათანადო ბენჩმარკინგის გარეშე, თქვენი უახლესი მოდელი მხოლოდ ძვირადღირებული ჰალუცინაციების მანქანაა. გამოიყენეთ ეს 12 მეტრიკა ახლავე:
✅ მომხმარებლის ნდობის მკვეთრი ზრდა
✅ სლეშის შემუშავების დრო
✅ ძვირადღირებული ნივთების მოშორება AI შეცდომების
✅ გაუსწარით უფრო დიდ კონკურენტებს
იყავი თვალყური აიმოჯო მეტი ექსპერტის სახელმძღვანელოსთვის, სამუშაო პროცესის ჰაკებისთვის და LLMops-ის, სწრაფი ინჟინერიის და სხვა სიახლეებისთვის AI აგენტის ამბები.


