1详细剖析 Self-RAG 中 4 类反思 Token (`[Retrieve]`, `[IsREL]`, `[IsSUP]`, `[IsUSE]`) 的生成时机与各自的评判维度?
2Self-RAG 训练管道中批评模型 (Critic Model) 与生成器模型 (Generator Model) 的数据标注生成与微调流程?
3在推理生成阶段,如何结合反思 Token 的 Logits 概率加权执行段落级束搜索 (Segment-level Beam Search)?
4对比 Self-RAG (模型内生反思) 与 LangGraph/Agentic RAG (外置循环状态机反思) 在延时开销与灵活性上的差异?
5当检索返回的文档与模型内生预训练记忆产生事实冲突时,`[IsSUP]` 如何强制引导模型基于权威文档生成?