M7-081M7: Retrieval, Ranking & RecSysMulti-Objective Ranking & OptimizationHard
Mastery:
Multi-Objective Ranking & Optimization: 解释在线实验评估多目标的难点。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 多目标实验的'胜出'定义模糊(A 在某目标好、B 在另一目标好);需'主指标 + 护栏'框架、帕累托比较与多重比较校正。
📌 Key Takeaways
- •难点:多目标无'全序'(A 在目标 1 好、B 在目标 2 好)
- •做法:'主指标 + 护栏'框架(主指标定胜负、护栏一票否决)
- •多目标比较:帕累托、多指标联合、多重比较校正
📐 Mathematical Derivations
数学机理:<strong>多目标实验的难点</strong>——(1) <strong>无全序(no total order)</strong>——(a) 单目标实验:A 的 CTR > B 的 CTR → A 胜(全序);(b) <strong>多目标</strong>:A 的 CTR 高但多样性低、B 反之 → <strong>无法直接比较</strong>(帕累托不可比);(c) 这使'定胜负'成为'价值判断'(需业务权衡)。(2) <strong>多重比较(multiple comparisons)</strong>——(a) 若同时检验 10 个指标,每个用 α=0.05,则'至少一个假阳性'的概率约 1−0.95¹⁰≈40%;(b) <strong>后果</strong>——'某个指标显著'可能是偶然(假阳性);(c) <strong>对策</strong>——(i) <strong>Bonferroni</strong>(α/m);(ii) <strong>FDR(Benjamini-Hochberg)</strong>(控制假发现率,比 Bonferroni 宽松);(iii) <strong>预注册主指标</strong>(只对主指标做检验);(iv) <strong>分层检验</strong>(先主指标、通过再看次要)。(3) <strong>指标间的相关性</strong>——多目标间常相关(如 CTR 与时长);故'独立检验'的假设不成立(需考虑相关性)。(4) <strong>样本量与功效</strong>——每个指标都需要足够样本才能检出效应;多目标会'分散'样本(或需更大样本)。(5) <strong>长期 vs 短期</strong>——短期指标(CTR)可测、长期(留存)需长周期;两者可能冲突。<strong>做法</strong>——(1) <strong>'主指标 + 护栏'框架(最实用)</strong>——(a) <strong>主指标(primary metric)</strong>——<strong>唯一定胜负</strong>的指标(如'人均时长'或'GMV');(b) <strong>护栏指标(guardrail metrics)</strong>——必须<strong>不恶化</strong>的指标(如负反馈率、留存、延迟);(c) <strong>规则</strong>——'主指标显著提升 <strong>且</strong> 所有护栏不显著恶化' → 上线;否则不上(或进一步分析);(d) <strong>优点</strong>——简单明确(避免'多目标无全序'的困境)。(2) <strong>帕累托比较</strong>——(a) 若 A 在<strong>所有</strong>目标都不差且至少一个更好 → A 支配 B(明确胜出);(b) 若不可比 → 需业务判断;(c) 用'帕累托前沿'可视化。(3) <strong>多指标联合检验</strong>——(a) 用'复合指标'(如把多目标加权成一个'总体指标');(b) 用'多变量检验'(考虑指标相关性);(c) <strong>注意</strong>——复合指标的权重仍需业务定。(4) <strong>多重比较校正</strong>——(a) FDR/Bonferroni;(b) 预注册主指标;(c) 分层检验。(5) <strong>长期实验</strong>——(a) 长周期 A/B;(b) holdout 组。<strong>与其他问题的关系</strong>——(a) 与'帕累托最优'(不可比的处理);(b) 与'护栏指标'(在线指标题);(c) 与'统计显著性'(多重比较)。<strong>实践建议</strong>——(a) <strong>预注册主指标</strong>(避免'挑指标');(b) <strong>用'主指标 + 护栏'框架</strong>(最实用);(c) <strong>多重比较校正</strong>(FDR);(d) <strong>帕累托比较</strong>(处理不可比);(e) <strong>长期实验</strong>(捕捉长期效应);(f) <strong>业务方参与决策</strong>(不可比的取舍)。<strong>度量</strong>——(a) 主指标的显著性与效应量;(b) 护栏指标的恶化程度;(c) 多重比较的校正;(d) 长期指标。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'多目标无全序'是根本难点</strong>——故需'主指标 + 护栏'框架把问题简化;面试中能指出这一点是深度理解的标志。② <strong>'预注册主指标'避免'挑指标'</strong>——若事后挑'最好的指标'报告,会引入选择偏差。③ <strong>'多重比较必须校正'</strong>——10 个指标同时检验时假阳性率约 40%;这是易被忽视的统计陷阱。④ <strong>'护栏指标一票否决'</strong>——这是'多目标'的实用简化(把'必须不恶化'的目标作为约束)。⑤ <strong>'不可比时业务决策'</strong>——算法提供数据、业务做价值判断;这是正确分工。⑥ <strong>面试要点</strong>——被问'多目标实验怎么做',应给出'<strong>主指标 + 护栏框架 + 帕累托比较 + 多重比较校正 + 长期实验 + 业务决策</strong>'与'<strong>多目标无全序</strong>';能指出'多重比较的假阳性率'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕事后挑'最好'的指标报告(选择偏差)
- ✕同时检验多指标不做校正(假阳性)
🎯 Interviewer Follow-ups
- ?为什么'多目标'难以定胜负?
- ?多重比较问题?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.