1详细梳理 Reflexion 系统的三大核心模块(Actor 动作执行者、Evaluator 奖励评估器、Self-Reflection 反思生成器)的协作流?
2Reflexion 反思记忆缓冲池 (Memory Buffer) 的 FIFO 滑动窗口淘汰与向量检索检索机制?
3为什么在代码生成基准 (HumanEval / LeetCode) 上,结合单元测试反馈的 Reflexion 能够将 pass@1 从 60% 提升至 90%+?
4防止模型生成“空洞敷衍的无效反思 (Vague / Hallucinated Reflections)”的 Prompt 架构设计与强制证据引用约束?
5Reflexion 与传统强化学习 (RL / PPO / DPO) 在样本效率、推理成本与冷启动难度上的综合对比?