返回 AI 应用工程 思维导图
中文·English
🤖 AI 应用工程ID: reflexion-self-correction

Reflexion 自我反思与反思记忆

Reflexion Self-Correction
🎯核心定义
Reflexion(自我反思与强化自愈 Agent 架构)是一种通过“口头自省反思反馈 (Verbal Self-Reflection)”而非传统强化学习权重更新来迭代提升任务成功率的先进 Agent 设计范式;当 Agent 执行完一轮完整轨迹并在评估器 (Evaluator) 中被判定为失败(如测试用例未通过、目标未达成)时,自我反思模块 (Self-Reflection Model) 介入分析完整历史轨迹,自主撰写一份包含“为什么失败、哪一步出现误判、下次尝试应如何修正”的自然语言反思日志 (Reflection Memory);该反思日志被永久追加到 Agent 的工作记忆缓冲区中,在开启下一轮试验 (Next Trial) 时作为显式提示词指引 Agent 避开前序陷阱。
💡使用场景
复杂代码生成与单元测试自动修复 (HumanEval/SWE-bench)、多步科学推理推导以及决策博弈模拟。
解决的核心痛点
传统 ReAct Agent 在某步走入死胡同后,容易在同一错误逻辑内打转、即使重试也会反复犯相同的错误;Reflexion 通过将过往失败教训外化为显式反思记忆,使模型具备跨轮次自我纠偏与持续进化能力。
🎯5 个高频面试考点 (Exam Points)
1
详细梳理 Reflexion 系统的三大核心模块(Actor 动作执行者、Evaluator 奖励评估器、Self-Reflection 反思生成器)的协作流?
2
Reflexion 反思记忆缓冲池 (Memory Buffer) 的 FIFO 滑动窗口淘汰与向量检索检索机制?
3
为什么在代码生成基准 (HumanEval / LeetCode) 上,结合单元测试反馈的 Reflexion 能够将 pass@1 从 60% 提升至 90%+?
4
防止模型生成“空洞敷衍的无效反思 (Vague / Hallucinated Reflections)”的 Prompt 架构设计与强制证据引用约束?
5
Reflexion 与传统强化学习 (RL / PPO / DPO) 在样本效率、推理成本与冷启动难度上的综合对比?
📖 关联深度指南:📄 agent-design-patterns
更新于 2026-08-14
🎯
检验攻克程度:针对「Reflexion 自我反思与反思记忆」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点ReAct 思考-动作-观察模式下一个知识点Plan-and-Execute 任务规划解构

🔗 更多 AI 应用工程 知识点卡片

向量距离度量与 L2 归一化SQ8/SQ4 标量量化PQ 乘积量化与码本聚类ADC 非对称距离计算