1推导 Elo 积分期望胜率公式与更新公式,并分析当弱模型爆冷战胜极强模型时的积分跃迁幅度?
2Bradley-Terry 最大似然估计 (MLE) 与在线 Elo 算法在全量历史对战数据下收敛到全局稳定积分的差异?
3引导式自助抽样法 (Bootstrapping with 1000 resamples) 如何为每个模型的 Elo 积分计算 95% 置信区间 (95% CI)?
4针对特定垂直领域(如 Coding Arena, Hard Prompts, Multi-turn Arena),如何构建分领域垂直 Elo 天梯榜单?
5如何利用 Glicko-2 算法引入评分波动度 (Rating Deviation, RD) 与评分波动率以解决新接入冷启动模型的积分震荡?