DeepSWE终极指南:如何用113个真实任务评测AI编程能力
DeepSWE终极指南如何用113个真实任务评测AI编程能力【免费下载链接】deep-sweMeasuring frontier coding agents on original, long-horizon engineering tasks项目地址: https://gitcode.com/gh_mirrors/de/deep-sweDeepSWE是一个专门用于评测前沿AI编码代理在真实编程任务中表现的开源基准测试项目。这个项目通过提供113个原创的、长期工程任务全面衡量AI编码代理在实际软件开发场景中的能力帮助开发者了解当前AI在复杂编程挑战中的真实水平。为什么你需要关注DeepSWE在AI编程工具日益普及的今天如何客观评估不同AI编码代理的实际能力成为了一个重要问题。DeepSWE应运而生它不仅仅是另一个测试套件而是一个全面的AI编码评测生态系统。核心价值DeepSWE为AI编码领域提供了客观、可重复的评测基准包含丰富多样的编程任务和标准化的评估方法让你能够清晰地看到不同AI编码代理之间的真实差异。项目架构深度解析DeepSWE采用精心设计的任务结构每个任务都模拟了真实世界中的工程挑战组件功能描述重要性instruction.md任务详细说明和要求核心任务描述task.toml任务元数据和配置信息环境配置基础environment/环境配置文件确保可重复性solution/参考解决方案用于离线验证tests/测试用例和验证器客观评估标准这种结构确保了每个任务都能在隔离的环境中运行同时提供一致的评估标准。113个任务全景概览DeepSWE包含了113个精心设计的编程任务覆盖了TypeScript、Go、Python、JavaScript和Rust等主流编程语言。这些任务涵盖了从基础算法到复杂系统设计的各个方面典型任务示例drizzle-orm-window-function-builders实现Drizzle ORM的窗口函数构建器fastapi-deprecation-response-headers处理FastAPI弃用响应头kysely-window-grouping-helpersKysely窗口分组助手实现prometheus-transactional-reload-statusPrometheus事务性重载状态管理sqlite-utils-safe-import-checkpointsSQLite工具安全导入检查点每个任务都源自活跃的开源仓库确保了任务的真实性和实用性。快速上手5分钟开始评测环境准备首先克隆项目仓库git clone https://gitcode.com/gh_mirrors/de/deep-swe cd deep-swe安装评测框架使用Pier框架来运行基准测试uv tool install datacurve-pier运行你的第一个评测配置API密钥并运行测试# 使用Claude Opus 4.8 export ANTHROPIC_API_KEYyour_key_here pier run -p tasks --agent mini-swe-agent --model anthropic/claude-opus-4-8 # 或者使用GPT-5.5 export OPENAI_API_KEYyour_key_here pier run -p tasks --agent mini-swe-agent --model openai/gpt-5.5选择特定任务如果你想专注于特定类型的任务# 运行随机10个任务的子集 pier run -p tasks --agent mini-swe-agent --n-tasks 10 --sample-seed 0 # 运行单个具体任务 pier run -p tasks/drizzle-orm-window-function-builders --agent mini-swe-agent评测流程详解DeepSWE的评测流程经过精心设计确保结果的可靠性和可重复性环境隔离每个任务在独立的Docker容器中运行任务执行AI代理在隔离环境中完成任务结果提取通过pre_artifacts.sh脚本提取工作成果验证评估在干净环境中应用补丁并运行验证器结果输出生成结构化的评分报告验证器输出结构每个评测运行都会生成以下输出文件verifier/ ├── reward.json # 结构化评分二进制奖励通过率 ├── ctrf.json # 机器可读的测试报告 ├── test-stdout.txt # 原始测试输出和失败原因 ├── run.log # 运行过程中的原始输出 └── reports/ # 框架原生报告文件应用场景与价值对于AI开发者如果你是AI编码工具的开发者DeepSWE提供了丰富的测试用例来改进算法和模型客观的性能对比基准识别模型在特定类型任务上的弱点跟踪AI编程能力的演进趋势对于软件工程师对于普通开发者DeepSWE可以帮助你了解不同AI编程助手的实际能力选择最适合你工作流的AI工具学习AI如何解决复杂编程问题提高自己的编程技能对于研究人员学术研究人员可以利用DeepSWE进行AI编程能力的量化研究探索AI在软件工程中的潜力分析不同模型架构的优劣推动AI编程领域的发展进阶使用技巧自定义评测配置你可以在task.toml文件中调整任务配置包括内存和时间限制网络访问权限依赖安装策略评分标准权重结果分析与对比使用Pier的分析工具深入理解AI代理的表现pier critique run run_id这个命令会提供详细的轨迹分析帮助你理解AI在解决问题时的思考过程。扩展任务集如果你想为DeepSWE贡献新的任务可以参考官方文档中的贡献指南。新任务需要源自活跃的开源项目包含明确的功能需求提供可验证的测试用例在隔离环境中可重复运行常见问题解答Q: DeepSWE支持哪些AI模型A: 支持Claude Opus、GPT系列、Gemini等多种主流模型通过mini-swe-agent适配器实现模型无关性。Q: 如何解读评测结果A: 主要关注reward.json中的二进制奖励和通过率同时查看ctrf.json了解具体的测试失败原因。Q: 任务难度如何分级A: 任务难度从简单到复杂不等覆盖了从bug修复到功能实现的各个层次。Q: 需要多少计算资源A: 单个任务通常在几分钟内完成内存需求根据任务复杂度而异一般在1-4GB之间。资源汇总快速开始指南README.md任务目录tasks/官方文档PROVENANCE.md数据集配置tasks/dataset.toml任务清单tasks/manifest.json开始你的AI编程评测之旅DeepSWE不仅是一个评测工具更是了解AI编程能力发展的重要窗口。无论你是AI研究者、工具开发者还是想要提高编程效率的工程师这个项目都能为你提供宝贵的见解。通过113个真实任务的全面测试你将能够客观评估不同AI编码代理的能力发现最适合你需求的AI编程助手跟踪AI编程技术的发展趋势在实际项目中更有效地利用AI工具现在就开始探索DeepSWE解锁AI编程的无限可能吧【免费下载链接】deep-sweMeasuring frontier coding agents on original, long-horizon engineering tasks项目地址: https://gitcode.com/gh_mirrors/de/deep-swe创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

PCSX2模拟器VC++运行时库完整修复指南:5分钟解决启动崩溃问题

PCSX2模拟器VC++运行时库完整修复指南:5分钟解决启动崩溃问题

PCSX2模拟器VC运行时库完整修复指南:5分钟解决启动崩溃问题 【免费下载链接】pcsx2 PCSX2 - The Playstation 2 Emulator 项目地址: https://gitcode.com/GitHub_Trending/pc/pcsx2 当你准备在电脑上重温经典PS2游戏时,PCSX2模拟器启动崩溃或闪退…

2026/10/8 16:25:43 阅读更多 →
Unity游戏集成Qwen3-ASR-0.6B模型实现本地中文语音控制

Unity游戏集成Qwen3-ASR-0.6B模型实现本地中文语音控制

1. 项目概述:当Unity角色“听懂”你的声音 最近在捣鼓一个独立游戏的原型,核心想法是让玩家能通过语音直接指挥游戏里的角色,比如喊一声“前进”,角色就往前走,说“攻击”,角色就挥剑。这听起来像是未来游戏…

2026/10/11 0:08:33 阅读更多 →
【单片机毕设案例分享】基于嵌入式平台的环境温湿度智能调控系统 按键交互式 STM32 温湿度监测风扇控制系统(018501)

【单片机毕设案例分享】基于嵌入式平台的环境温湿度智能调控系统 按键交互式 STM32 温湿度监测风扇控制系统(018501)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于单片机,STM32单片机,51单片机,J…

2026/9/27 22:46:58 阅读更多 →

最新新闻

从环境到上线:Vue项目实战与踩坑全指南

从环境到上线:Vue项目实战与踩坑全指南

干 Vue 这些年,见得最多的就是新手把环境配到一半就卡住,然后跑来问“为什么我 npm run dev 直接报错”“为什么 devtools 不显示”。其实 Vue 本身不难,难的是把生态里的一堆配套工具摸清楚,再踩过几个经典的坑。这篇文章我就按实…

2026/10/11 8:52:41 阅读更多 →
弹性扩容实战:流量洪峰下如何弹性伸缩与避坑

弹性扩容实战:流量洪峰下如何弹性伸缩与避坑

“老板,客户那边流量爆了,凌晨三点服务器扛不住,赶紧想想办法!”做云渠道这些年,这种电话我接过不止一次。所谓“业务流量洪峰”从来不是某个固定时刻准时到来,它可能来自一次大促、一场直播、一个热点事件…

2026/10/11 8:52:41 阅读更多 →
天地图403排查实战:Vue3部署与Nginx反代避坑指南

天地图403排查实战:Vue3部署与Nginx反代避坑指南

上周把vue3项目部署到线上服务器,第二天同事就找过来:“地图白屏了,控制台一片403。”我看了一眼浏览器Network面板,天地图的瓦片请求齐刷刷返回403 Forbidden。这个场景我太熟了,本地开发时地图还好好的,一…

2026/10/11 8:52:41 阅读更多 →
OpenClaw开源重制引擎:让经典老游戏在现代系统上重生

OpenClaw开源重制引擎:让经典老游戏在现代系统上重生

作为一个从小在街机厅和奔腾MMX电脑前泡大的老玩家,我太清楚那些经典老游戏如今有多难伺候了。系统不兼容、分辨率撕裂、画面抖得像中风,更别提把手里的手柄映射到一堆莫名其妙DirectDraw错误上。今天要聊的OpenClaw(圈子里的朋友们喜欢叫它“…

2026/10/11 8:52:41 阅读更多 →
Unity C#进阶:从缓存、对象池到事件驱动的性能优化实战

Unity C#进阶:从缓存、对象池到事件驱动的性能优化实战

在 Unity 项目里,“代码能跑”和“代码能撑住项目”是两回事。很多人写了一阵子 C# 脚本,功能都做出来了,但项目一到真机就发热、掉帧,或者场景稍微复杂一点就卡顿。这时候回头看代码,往往能找到一堆Update里反复GetCo…

2026/10/11 8:52:41 阅读更多 →
2026年实时数据同步工具怎么选?GoldenGate、Striim、SeaTunnel、FineDataLink 5.0横评

2026年实时数据同步工具怎么选?GoldenGate、Striim、SeaTunnel、FineDataLink 5.0横评

实时数据同步,是这两年企业数据建设里绕不开的一环。业务对实时性的要求越来越高——库存要实时、订单要实时、设备状态要实时,T1 的离线数仓在很多场景下已经不够用了。于是选型的问题摆在了面前:GoldenGate、Striim、SeaTunnel、FineDataLi…

2026/10/11 8:51:41 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 5:23:50 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 21:32:20 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 10:38:42 阅读更多 →