正在加载模式…
SWE-bench 套件
包含 SWE-bench、SWE-bench Verified 和 SWE-bench Live 的软件工程基准测试套件。示例中用于比较的具名模型为历史基线。
30秒速览
- 是什么
- 用热门仓库中真实的 GitHub issue 来评测编码智能体,配有经人工校验的子集和每月更新的实时变体,以衡量其解决问题的能力。
- 何时使用
- 在真实的软件工程任务上比较智能体性能、追踪其随时间的进步,或验证智能体在没有训练数据污染的情况下确实能解决问题。
- 注意
- 结果高度依赖于纳入了哪些仓库和 issue 类型;在 SWE-bench 上的表现未必能迁移到你自己代码库的模式或技术栈。
向AI专家咨询此模式
打开助手并预填您的问题,发送前可先确认。
SWE-bench 套件: 概览
包含 SWE-bench、SWE-bench Verified 和 SWE-bench Live 的软件工程基准测试套件。示例中用于比较的具名模型为历史基线。
- Real GitHub issues from 12+ popular repositories
- Human-validated problem subset (SWE-bench Verified)
- Live benchmark updated monthly (SWE-bench Live)
- Multimodal variant with visual elements
- Contamination-free evaluation
- Industry standard for coding agents
获取智能体评估实战指南
25 种智能体评估方法浓缩成一份指南:每个基准测量什么、公开分数何时具有误导性、如何用自己的失败构建评估。链接随确认邮件送达,并附每周的 The Agent Architect。
每周一封邮件,一键退订。您的地址仅用于发送简报。
参考资料
该模式所依据的论文、规范和代码仓库。
- SWE-bench: Can Language Models Resolve Real-World GitHub Issues? (ICLR 2024)arXiv:2310.06770
- Introducing SWE-bench Verified - OpenAI (2024)
- swebench.com
由本目录背后的工程师执行
看看你的评测漏掉了什么
评测智能体比做出来更难,多数测试套件一路全绿,线上却在悄悄漂移。我们从头到尾检查你的评测体系:现在测到了什么、还有什么看不见,以及当前套件会放过哪些回归。
€750(原价 €1,500),一周交付,书面报告加讲解通话,9月30日前