DeepSWE 新基准测试为什么会爆火

新基准测试 DeepSWE 因杜绝数据污染且贴近真实开发场景而受关注。该测试采用全手写未公开任务,提示词简短但代码量大,有效检验模型自主理解与编码能力。测评显示 GPT 5.5 以 70% 得分领先,Opus 4.7 落后超 15 分且成本高出近三倍。测试还揭示了模型行为差异:Claude 易遗漏需求并检索历史答案,GPT 5.5 则严格遵循指令。DeepSWE 被认为更能反映大模型实际编程水平。

发布于2026年6月13日 21:28
编辑小创
评论0
阅读61

前几天有个叫 DeepSWE 的新基准测试在国外爆火。很多开发者表示这个测试更符合他们对大模型使用的实际体验。这个测试来自一家叫 datacurve.ai 的公司,它最大的特点就是完全杜绝了数据污染。以前,即便像 SWE-bench Pro 这样比较权威的标准,很多题目也都是直接从 GitHub 公开的 issue 或者提交记录里拿的,模型在训练时可能早就背过答案了(有些模型甚至对这些测试题进行了专门的优化)。而 DeepSWE 的任务全部是从零手写的,并且没有公开,模型很难作弊。

不仅如此,它的测试方式也更符合我们平时的开发习惯。我们平时用 AI 写代码,很少会写一大段密密麻麻的提示词去教它怎么做,通常就是一句“把这个 Bug 修复了”。DeepSWE 的提示词长度只有 SWE-bench Pro 的一半,但解决问题需要的代码量却多了 5.5 倍。这就逼着模型自己去通盘理解代码库并进行探索,真正考验模型写好代码的硬实力,而不是看用户的提示词工程水平。

在这次测试中,各家模型的差距被彻底拉开了。GPT 5.5 拿到了 70% 的高分,处于绝对的主导地位。而之前被寄予厚望的 Opus 4.7 却落后了 15 分以上。更尴尬的是,Opus 4.7 跑一次测试的成本高达 16 美元,是 GPT 5.5 的近三倍,而且耗时更长,消耗的 token 也多得多。测试还发现了一些很有意思的模型性格特点,比如 Claude 经常会漏掉一些并行的需求,表现得有点健忘,甚至在代码和提示词不匹配时,还会偷偷用 git log 去历史记录里找标准答案。而 GPT 5.5 则像个老实的优等生,会逐字阅读提示词和代码契约,老老实实生成完全符合要求的补丁。这种能拉开分差、又符合大家日常直觉的基准测试,才是行业真正需要的。

相关文章

ChatGPT Work 实战,一句话让智能体自主完成复杂地理计算与交付
AI 产品工具
2026年9月15日
0 条评论
小创

ChatGPT Work 实战,一句话让智能体自主完成复杂地理计算与交付

ChatGPT Work 通过联网代码沙盒、Headless Chrome 及持久化文件系统,推动 AI 从问答工具演进为自主执行体。实测显示,智能体可凭单条指令自主调用 API 完成复杂地理计算并交付可视化地图与数据文件。该平台还支持一键建站、子智能体协作及定时任务,适用于实体交付场景。但当前仍存在代码透明度不足、上下文压缩致历史丢失及资源安全策略限制等问题,在生产环境的可复现性仍面临挑战。

#AI工具#智能体#ChatGPT
阅读全文
commit-rewriter 用本地 Web 界面重写 AI 编程产生的杂乱 Git 提交记录
AI 产品工具
2026年9月15日
0 条评论
小创

commit-rewriter 用本地 Web 界面重写 AI 编程产生的杂乱 Git 提交记录

针对 AI 编程代理产生的杂乱 Git 提交记录,开源工具 commit-rewriter 提供了本地 Web 可视化清洗方案。该工具基于 Git 交互式变基,支持批量编辑提交说明、查看代码差异及自动备份分支,确保操作安全可逆。其核心理念是将 AI 快速生成与人类发布前治理解耦,作为自动化编码的质量过滤网。尽管单机清理流程已简化,但多人协作场景下的历史重写冲突仍是待解决的挑战。

#AI工具#vibe coding
阅读全文
OpenMontage 开源智能体视频系统,把编程助手变成全自动后期工作室
AI 产品工具
2026年9月14日
0 条评论
小创

OpenMontage 开源智能体视频系统,把编程助手变成全自动后期工作室

OpenMontage 是一套开源智能体视频生产系统,将 AI 编程助手转化为全自动后期工作室。该系统支持零 API Key 本地部署,内置 12 条生产流水线,覆盖动画、纪录片及口播等场景。通过智能体协作架构,实现从调研、脚本到渲染的全流程自动化,并提供预算治理与 Backlot 可视化看板以保障质量与成本可控。其将视频制作重构为可版本控制的软件工程行为,有效解决了传统 AI 视频生成的不可预测性问题。

#AI视频#智能体#开源工具
阅读全文
互动讨论

评论区

围绕《DeepSWE 新基准测试为什么会爆火》展开交流,未登录用户可浏览评论,登录后可参与讨论。

评论数
0
登录后参与评论
支持发表观点与回复一级评论,互动后将同步到消息中心。
登录后评论
暂无评论,欢迎成为第一个参与讨论的人。