返回 AI 应用工程 思维导图
中文·English
🤖 AI 应用工程ID: swe-bench-agent-eval

SWE-bench 代码与 Agent 评估

SWE-bench Agent Evaluation
🎯核心定义
软件工程智能体真实基准评测 (SWE-bench / SWE-bench Verified) 是当前全球衡量自主 AI Agent(如 Claude 3.5 Sonnet, Codex, Devin, Cursor Agent)在真实复杂 GitHub 开源软件仓库中自主排障、定位 Bug、跨文件修改代码并通过全套回归单元测试的终极黄金评测基准;基准精选了 2294 个(Verified 版为 500 个严格人工核验实例)源自 Django, SymPy, scikit-learn, pytest 等顶级 Python 仓库的真实 GitHub Issue;系统为 Agent 提供隔离的 Git 仓库与 Docker 沙箱,由 Agent 自主检索代码、编辑文件并生成 Git Patch,最终在沙箱中运行项目的真实测试套件验证 `Resolved` 解决率。
💡使用场景
评估 Coding Agent、代码助手、自治软件工程师 (Autonomous Software Engineer) 的真实工程落地能力。
解决的核心痛点
传统代码评测(如 HumanEval)仅能测试单函数 10 行独立算法题,与真实工业级软件工程(数万行代码、复杂依赖、多文件跨模块调用)严重脱节;SWE-bench 将评测推向了真正的工业级端到端代码修复与架构理解。
🎯5 个高频面试考点 (Exam Points)
1
详细梳理 SWE-bench 评测流水线:Issue 描述输入 -> Agent Docker 沙箱探索 -> Git Patch 提取 -> 运行 PASS_TO_PASS 与 FAIL_TO_PASS 测试?
2
SWE-bench Lite 与 SWE-bench Verified(经过人类专家审查剔除有歧义或测试不完整的实例)在评测置信度上的提升?
3
Agent 在面对数十万行大型仓库时的代码检索与定位策略(Agentic Search / Ripgrep / AST 语义索引)对最终得分的决定性影响?
4
SWE-bench 中 FAIL_TO_PASS(原本失败的测试必须通过)与 PASS_TO_PASS(原本通过的测试不得被破坏)的双向断言验证机制?
5
从单 Agent 盲目编辑到引入 Multi-Agent(定位 Agent + 修复 Agent + 单元测试验证 Agent)在提升 SWE-bench 解决率上的架构演进?
📖 关联深度指南:📄 llm-as-a-judge
更新于 2026-08-14
🎯
检验攻克程度:针对「SWE-bench 代码与 Agent 评估」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点工业标准评测套件 (MMLU/HumanEval)

🔗 更多 AI 应用工程 知识点卡片

向量距离度量与 L2 归一化SQ8/SQ4 标量量化PQ 乘积量化与码本聚类ADC 非对称距离计算