M7-057M7: Retrieval, Ranking & RecSysRecommender Systems FoundationsHard
Mastery:
Recommender Systems Foundations: 解释推荐系统的评估指标与业务目标。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 离线用 Recall@k/NDCG/AUC;在线用 CTR/时长/GMV;两者需对齐,且需护栏指标防短期损害长期。
📌 Key Takeaways
- •离线:Recall@k(召回)、NDCG(排序)、AUC/GAUC(CTR 预估)
- •在线:CTR、停留时长、GMV、留存(业务目标)
- •对齐:离线指标需与在线指标相关;护栏指标防短期损害长期
📐 Mathematical Derivations
数学机理:<strong>离线指标</strong>——(a) <strong>召回阶段</strong>——<strong>Recall@k</strong>(相关物品是否在 top-k)、<strong>覆盖率</strong>(覆盖多少物品)、<strong>新颖性</strong>;(b) <strong>排序阶段</strong>——<strong>NDCG@k</strong>(排序质量,考虑位置)、<strong>MAP</strong>、<strong>AUC</strong>(CTR 预估的排序能力);(c) <strong>AUC 与 GAUC</strong>——(i) <strong>AUC</strong>——全局的排序能力(正样本得分高于负样本的概率);(ii) <strong>GAUC(Group AUC)</strong>——<strong>按用户分组</strong>算 AUC 再加权平均;<strong>为什么用 GAUC</strong>——因为推荐是'<strong>每个用户内部排序</strong>'(不同用户的分数不可比);全局 AUC 会被'用户间的差异'混淆;故 GAUC 更贴近真实目标(工业界标准)。(d) <strong>校准</strong>——若需'概率'(如出价),需评估校准(预测 CTR vs 实际 CTR)。<strong>在线指标</strong>——(a) <strong>参与度</strong>——CTR、点击率、停留时长、会话深度;(b) <strong>转化</strong>——CVR、GMV、订单量;(c) <strong>留存</strong>——次日/次周留存、DAU/MAU;(d) <strong>生态</strong>——内容供给、创作者活跃;(e) <strong>成本</strong>——延迟、算力。<strong>为什么离线与在线不一致</strong>——(a) <strong>特征偏斜</strong>(技术);(b) <strong>位置偏置</strong>(历史数据有偏);(c) <strong>目标错配</strong>(NDCG ≠ CTR);(d) <strong>用户反应</strong>(行为随推荐变化);(e) <strong>长期效应</strong>(离线无法捕捉)。<strong>护栏指标(guardrail metrics)</strong>——用来'防止短期优化损害长期'的指标:(a) <strong>用户体验类</strong>——负反馈率(不感兴趣/举报)、加载延迟;(b) <strong>生态类</strong>——内容多样性、长尾曝光、创作者留存;(c) <strong>业务类</strong>——留存、卸载率;(d) <strong>安全类</strong>——违规内容率。<strong>为什么必需</strong>——(a) 只优化 CTR 会'标题党'(短期涨、长期跌);(b) 护栏指标'一票否决'(若恶化则回滚)。<strong>对齐离线与在线</strong>——(a) <strong>验证相关性</strong>(用历史 A/B 结果 vs 离线指标,看是否相关);(b) <strong>用在线代理指标</strong>(如'预测的 CTR'作为离线指标);(c) <strong>多指标评估</strong>(不只看单一);(d) <strong>长期实验</strong>(捕捉长期效应)。<strong>实践建议</strong>——(a) <strong>离线用 GAUC/NDCG/Recall@k</strong>(分阶段);(b) <strong>在线用 CTR + 业务指标 + 护栏</strong>;(c) <strong>验证离线-在线相关性</strong>(关键!);(d) <strong>离线只做粗筛、A/B 定胜负</strong>;(e) <strong>监控护栏指标</strong>(防短期损害长期);(f) <strong>长期实验</strong>(月度/季度)。<strong>度量</strong>——(a) 离线指标;(b) 在线指标;(c) 护栏指标;(d) 离线-在线相关性。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'GAUC 优于 AUC'是推荐的关键细节</strong>——因为推荐是'用户内排序';面试中能指出这一点是深度理解的标志。② <strong>'离线-在线相关性需验证'</strong>——若离线指标与在线不相关,则离线优化无意义;这是评估体系的核心纪律。③ <strong>'护栏指标防短期损害长期'</strong>——只优化 CTR 会'标题党';故需护栏。④ <strong>'离线只做粗筛'</strong>——离线快但不可靠(偏置);A/B 是最终验证。⑤ <strong>'校准 vs 排序'</strong>——AUC 衡量排序,但若需概率(出价)则需校准(预测 CTR 的准确性);两者不同。⑥ <strong>面试要点</strong>——被问'推荐怎么评估',应给出'<strong>离线(GAUC/NDCG/Recall@k)+ 在线(CTR/GMV/留存)+ 护栏 + 离线-在线相关性验证</strong>'与'<strong>GAUC 优于 AUC</strong>';能指出'离线只做粗筛'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕只看离线 NDCG 决定上线(可能与在线不符)
- ✕只看 CTR 不看护栏(短期损害长期)
🎯 Interviewer Follow-ups
- ?为什么离线指标与在线不一致?
- ?GAUC 与 AUC 的差异?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.