RAG Evaluation Metrics and Test Sets
توسعه عاملهای هوشمند (Agentic Ai) با Langchain و Langgraph
- Create a representative question-answer-source dataset.
- Measure retrieval recall, citation correctness, answer groundedness, latency, and cost.
- Interpret tradeoffs among quality, latency, and cost.
چرا ارزیابی RAG لازم است؟
**اصل اصلی**
پاسخ درست، بهتنهایی نشان نمیدهد که retrieval و citation درست بودهاند.
```mermaid
flowchart LR
Q["پرسش"] --> R["بازیابی اسناد"]
R --> A["پاسخ و citation"]
A --> E["ارزیابی جداگانه"]
E --> D["تصمیم درباره کیفیت، هزینه و سرعت"]
```
ساخت test set نماینده
**یک رکورد پاسخپذیر و بیپاسخ**
پرسش اول: «مهلت بازگشت کالا چند روز است؟»؛ پاسخ مرجع: «۳۰ روز»؛ منبع: \(S_1=\\{d_2,c_4\\}\) .
پرسش دوم: «آیا ارسال بینالمللی دارید؟»؛ پاسخ مرجع: «در اسناد موجود مشخص نیست»؛ منبع: \(S_2=\\varnothing\) .
```mermaid
flowchart TD
U["سؤالهای واقعی"] --> C["تنوع موضوع و شکل"]
C --> L["برچسب پاسخ مرجع"]
L --> S["شناسه منابع مرجع"]
S --> P["تقسیم dev و test"]
```
معیارهای retrieval و citation
**محاسبه مرحلهبهمرحله**
برای پرسشهای ۱، ۳ و ۴، اشتراک منبع مرجع با نتایج Top-2 ناتهی است؛ بنابراین سه hit داریم. برای پرسش ۲ اشتراک تهی است؛ بنابراین یک miss داریم. نتیجه: \(Recall@2=3/4=0.75\) . از پنج citation نیز چهار مورد پشتیباناند: \(CC=4/5=0.80\) .
```mermaid
flowchart LR
S["منبع مرجع"] --> M{"در Top-k؟"}
M -->|بله| H["recall hit"]
M -->|خیر| X["recall miss"]
C["Citation"] --> V{"پشتیبان ادعا؟"}
V -->|بله| Y["correct"]
V -->|خیر| Z["incorrect"]
```
Groundedness، latency و cost
**هزینهٔ یک پرسش**
بخش ورودی: \(2000/1000000\\times2=0.004\) دلار. بخش خروجی: \(500/1000000\\times8=0.004\) دلار. جمع: \(Cost_i=0.004+0.004=0.008\) دلار.
**چرا سه معیار؟**
Groundedness کیفیت پشتیبانی ادعاها را نشان میدهد؛ latency و cost نشان میدهند این کیفیت با چه زمان و هزینهای به دست آمده است.
مقایسهٔ دو پیکربندی
**محاسبه اختلافها**
Config B نسبت به A، recall را \(0.15\)، groundedness را \(0.08\)، latency را \(0.7\) ثانیه و cost/query را \(0.005\) دلار افزایش میدهد. citation correctness فقط \(0.01\) بیشتر میشود.
**نکتهٔ تصمیمگیری**
یک امتیاز کلی کافی نیست؛ کیفیت را همراه با زمان و هزینه گزارش و تفسیر کنید.
Back to course