1从自回归 Transformer 注意力机制的角度,解释为什么生成中间 CoT Token 能够等价于为难题增加了计算量 (Test-Time Compute)?
2Self-Consistency (自洽性采样 / 多数投票 CoT) 是如何通过采样多条不同推理链并对最终答案取众数提升准确率的?
3当 CoT 中间步骤出现“看似合理实则逻辑矛盾 (Faithfulness & Hallucination in CoT)”时,如何进行单步中间状态验证 (Process Supervision)?
4Least-to-Most Prompting 与分层规划 (Hierarchical Planning) 在处理 5 步以上极长逻辑链问题时的优势?
5在生产 API 响应中,如何通过 XML 标签(如 `<thought>...</thought><answer>...</answer>`)将思考过程与最终用户答案结构化隔离?