返回 AI 应用工程 思维导图
中文·English
🤖 AI 应用工程ID: rag-triad-evaluation

RAG 三元组评估 (Ragas/TruLens)

RAG Triad Evaluation (Ragas)
🎯核心定义
RAG 三元组评估体系 (RAG Triad Metrics,由 TruLens 与 Ragas 框架确立的工业界黄金评估标准) 是一种将 RAG 系统拆解为查询 QQ、检索上下文 CC 与生成回答 AA 三大要素,并在三者之间构建 3 个无监督独立质量闭环指标的评测架构:1) 检索相关度 (Context Relevance: 评估 CC 中有效支撑信息的占比,度量检索精准度);2) 真实忠实度 (Groundedness / Faithfulness: 评估 AA 中的每个事实断言是否完全能从 CC 中找到依据,度量有无幻觉);3) 回答相关度 (Answer Relevance: 评估 AA 是否精准切题回答了原始问题 QQ,度量是否跑题)。
💡使用场景
企业级 RAG 生产上线前的全面自动化质量打分、检索与生成模块独立故障归因、以及持续回归基准测试。
解决的核心痛点
传统端到端评测只看最终回答,当回答不合格时无法判断到底是“检索没召回到正确文档”还是“检索对了但大模型自己生成幻觉”;RAG 三元组指标实现了检索层与生成层的精准故障定界与独立归因优化。
🎯5 个高频面试考点 (Exam Points)
1
详细推导 Ragas 中 Context Relevance(从上下文提取与 Query 相关句子的比例)的计算公式与 Prompt 实现?
2
Faithfulness(忠实度指标)如何通过“声明拆解 (Claim Extraction) + 事实蕴含 (NLI Entailment)”计算分数 S=VTS = \frac{|V|}{|T|}
3
Answer Relevance 如何通过反向推导(由模型回答 AA 反向生成若干个潜在问题 qiq_i 并计算与原问题 QQ 的余弦相似度)进行无参考打分?
4
针对超长召回上下文 (Context > 10K tokens),如何降低 Ragas 计算三元组指标所需的 LLM API 评测成本与延迟?
5
在生产监控看板中,如何将 RAG 三元组指标与用户真实点击/点赞点踩 (Feedback Signals) 进行相关性校验?
📖 关联深度指南:📄 llm-as-a-judge
更新于 2026-08-14
🎯
检验攻克程度:针对「RAG 三元组评估 (Ragas/TruLens)」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点Pairwise A/B 对比评估范式下一个知识点Position Bias 位置偏置消除

🔗 更多 AI 应用工程 知识点卡片

向量距离度量与 L2 归一化SQ8/SQ4 标量量化PQ 乘积量化与码本聚类ADC 非对称距离计算