🎯核心定义
软件工程智能体真实基准评测 (SWE-bench / SWE-bench Verified) 是当前全球衡量自主 AI Agent(如 Claude 3.5 Sonnet, Codex, Devin, Cursor Agent)在真实复杂 GitHub 开源软件仓库中自主排障、定位 Bug、跨文件修改代码并通过全套回归单元测试的终极黄金评测基准;基准精选了 2294 个(Verified 版为 500 个严格人工核验实例)源自 Django, SymPy, scikit-learn, pytest 等顶级 Python 仓库的真实 GitHub Issue;系统为 Agent 提供隔离的 Git 仓库与 Docker 沙箱,由 Agent 自主检索代码、编辑文件并生成 Git Patch,最终在沙箱中运行项目的真实测试套件验证 `Resolved` 解决率。