1详细剖析 RAGAS 四大指标(Faithfulness、Answer Relevance、Context Precision、Context Recall)的数学计算逻辑与如何利用 LLM-as-a-Judge 自动化打分?
2LLM-as-a-Judge 的三大固有偏置(位置偏置 Position Bias、长度偏置 Verbosity Bias、自偏好偏置 Self-Enhancement Bias)与如何通过交换候选顺序消除?
3SWE-bench (以及 SWE-bench Lite) 的测试环境搭建与 Docker 隔离执行沙箱设计?
4单元测试与回归测试在 CI/CD 中如何与大模型 Eval 结合(如使用 DeepEval / Promptfoo 实现 PR 触发自动化拦截)?
5合成评估数据集生成 (Synthetic Testset Generation): 如何基于企业知识库通过演化策略 (Evol-Instruct) 自动生成上千条覆盖多跳推理的黄金 Q&A 测试对?