jevgrep 评测全揭秘:SWE-bench 10 任务 8/10 通过、总成本降 25.8% 的完整方法论
jevgrep 评测全揭秘SWE-bench 10 任务 8/10 通过、总成本降 25.8% 的完整方法论【免费下载链接】jevgrepFind code by asking what it does. A CLI for coding agents that uses Jev to discover relevant files and source context.项目地址: https://gitcode.com/gh_mirrors/je/jevgrepjevgrep是一款面向编程 Agent 的代码检索 CLI用自然语言问“这个功能在哪”jg命令就返回相关文件、逐字源码摘录和阅读线索。它的官方评测在SWE-bench的 10 个 Python 任务上与无检索基线正面对比两边都通过 8/10 任务而把 Jev 检索费也算进去后总成本从 $7.62 降到 $5.66降低 25.8%。这篇文章完整拆解这套 jevgrep 评测的方法论、每一笔成本构成以及这些结论的边界。jevgrep 是什么用“问题”而不是“路径”找代码编程 Agent 每接到一个陌生任务都要花一部分时间“找对文件”。jevgrep 给它一个起点把仓库问题交给 Jev 模型在目录、文件、声明三个层级上判断相关性再挑选有用的源码单元和上下文一次性通过 stdout 输出给 Agent。它的工作分三步 分层发现先读目录元数据和内容预览决定往哪些分支探索而不是一上来上传整棵目录树相关文件筛选通过相关性门槛文件准入 0.5保留文件不设固定 Top-N源码优先输出先给摘要和文件列表然后是逐字源码块和行号最后才是详细的声明与调用位置——Python 和 TypeScript/JavaScript 支持声明解析其他文本走有界分片兜底。设计细节见 docs/architecture.md教 Agent 如何使用它的是仓库里的公开技能 skills/jevgrep/SKILL.md。评测方法论SWE-bench 对比怎么做才可信这套 jevgrep SWE-bench 评测的核心原则只有一条让对比无法被事后美化。具体做法如下。任务与评分官方评分器是唯一裁判使用10 个 Python SWE-bench 任务Django、pytest、SymPy、Sphinx 等知名项目通过与否只由SWE-bench 官方行为评分器判定不添加任何补充断言基线不使用 jevgrep 的纯 Agent 运行对每个任务/模型/测试组合只跑一次并冻结绝不重跑来“改善”对比结果。成本口径失败也算钱Jev 也算钱这是方法论里最容易被质疑的部分评测把规则写死在 evals/accounting.md 和 evals/cost-quality-policy.md 中规则说明总成本 Sol Jev编程 Agent 费用和检索费都计入未来所有评测默认如此计完整任务研究、实现、自验证、失败尝试全部计入Token 不混淆Jev token 永不加进 Agent token 总和但检索返回的上下文会计入 Agent 账单缺失即未知任何缺失的用量数据让总成本标记为“未知”而不是记为 0执行器跑真实的已安装包不跑实验代码评测驱动器 evals/implementation/swebench/installed.md 驱动的是真实的jg可执行文件冻结的已发布 npm 包 0.4.3加上 Solopenai/gpt-5.6-sol中强度。每次尝试都有全新的 home/缓存状态、可审计的生命周期回执原始的 Jev 请求/响应体由 gateway_broker.py 完整保留。冻结的基线档案见 fixed-baselines.json评测总入口说明在 evals/README.md。结果拆解25.8% 的节省从哪里来最新一轮含 Jev 的总成本复测evals/results/total-cost-2026-09-28.md逐任务成本如下任务官方结果Sol 成本Jev 成本合计无 jevgrep 基线pydata__xarray-3305✅ pass$0.4309$0.2701$0.7009$0.4937sphinx-doc__sphinx-8638✅ pass$0.3715$0.1678$0.5392$1.0595scikit-learn__scikit-learn-13124✅ pass$0.2129$0.0794$0.2923$0.2944django__django-15629✅ pass$1.1522$0.3515$1.5037$1.5055psf__requests-1142✅ pass$0.3368$0.0128$0.3496$0.2685astropy__astropy-13579✅ pass$0.3436$0.1501$0.4938$0.4286pytest-dev__pytest-6197✅ pass$0.4169$0.1119$0.5289$2.3445sympy__sympy-16792✅ pass$0.2662$0.0930$0.3592$0.5480matplotlib__matplotlib-26466⏸️ 未解决$0.4214$0.1752$0.5966$0.3957pylint-dev__pylint-4604⏸️ 未解决$0.2256$0.0667$0.2923$0.2836合计8/10$4.1780$1.4784$5.6564$7.6221几个值得注意的点 最大的单任务节省来自 pytest基线花了 $2.34 大量摸索用 jevgrep 后 $0.53 搞定——检索直接给了正确文件Agent 少走了弯路单任务均值从 $0.7622 降到 $0.5656按“每解决一个任务的花费”算则是 $0.9528 → $0.7070包含失败任务的花费不是只算成功尝试的平均Django 这类复杂任务基本持平说明节省不是均匀分布的不是每个任务都保证省钱此前的 Sol-only 口径evals/results/relevance-threshold-2026-09-27.md显示编程 Agent 成本从 $7.62 降到 $5.44降幅28.6%即 README 中“~30%”说法的出处。附带收益更快、更省 token独立的 速度研究 还测了本地优化 TypeSafe 原生端点后的效果同一 8/10 通过总耗时12.7% 更快Sol token 用量减少 41.5%581 万 vs 993 万。不过官方口径里时间是诊断性的不是优化目标。诚实的边界这个结果不能证明什么评测自己反复强调的局限性同样值得读者知道这是10 个调优过的 Python 任务不是留出集也不覆盖其他语言和任意仓库每个任务只有一次首次尝试不足以估计方差也不能单独归因到某个参数两个未解决任务Matplotlib、Pylint在两边都未解决——Pylint 的失败源于测试夹具本身的限制两边评分器表现一致Sol 在检索不足时仍可用普通工具补齐所以“为什么补丁通过”不能简单归功检索Jev 成本是按公开价目估算值$0.042 / 百万输入 token不是发票对账。自己动手试试 安装只需三步要求 Node.js 22macOS 或 Linuxnpm install -g dzhng/jevgrep jg auth jg skill然后在任意项目里用自然语言提问jg 数据库连接如何创建、池化和关闭 ./srcjg skill会自动检测你正在用的编程 AgentClaude Code、Codex、OpenCode 等并安装配套技能。认证、缓存和完整参数见 apps/cli/README.md。结语jevgrep 这套 SWE-bench 评测的价值与其说在 25.8% 这个数字本身不如说它示范了一种可复现的编程 Agent 工具评测方法论官方评分器裁决、冻结基线永不重跑、失败尝试全额计费、检索费透明入账。如果你的团队也在为 Coding Agent 选型这套口径可以直接参考 evals/cost-quality-policy.md 照抄。【免费下载链接】jevgrepFind code by asking what it does. A CLI for coding agents that uses Jev to discover relevant files and source context.项目地址: https://gitcode.com/gh_mirrors/je/jevgrep创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

Django+LLM实战:网约车供需平衡预测与调度优化系统

Django+LLM实战:网约车供需平衡预测与调度优化系统

1. 选题定调:为什么偏偏是“滴滴出行供需平衡优化” 每年到了毕业设计开题季,计算机专业的同学基本都会经历一轮“选题焦虑”。尤其是想做应用型、偏数据分析方向的人,很容易被市面上五花八门的题目晃花了眼——什么“基于XX的推荐系统”“基…

2026/9/30 14:58:07 阅读更多 →
OpenStack Nova 16种核心操作全解析:从状态机到运维实战

OpenStack Nova 16种核心操作全解析:从状态机到运维实战

1. 为什么说 Nova 的操作比你想的多得多 做过 OpenStack 运维的人都有这种体会:Nova 表面上是“管虚拟机”的组件,但真正上手之后才发现,它那套操作体系的复杂度远超预期。单说对一个 instance 的管理,官方 API 文档里列出的动作就…

2026/9/30 14:57:00 阅读更多 →
WSL从安装到VS Code开发的全流程实践与踩坑记录

WSL从安装到VS Code开发的全流程实践与踩坑记录

说实话,“配置WSL并在vscode里打开”这个标题看起来属于“十分钟入门”级别,但真正上手操作的时候,翻车的情况比想象中多得多。我从第一次在Windows上搭Linux开发环境到现在,反复折腾过WSL的安装、迁移、崩溃恢复、VS Code连接这些…

2026/9/30 14:57:00 阅读更多 →

最新新闻

电商管理后台和ERP有什么区别?2026年电商商家选型避坑指南

电商管理后台和ERP有什么区别?2026年电商商家选型避坑指南

摘要:2026年最新的电商管理后台选型,先要分清它与ERP的边界才能不踩坑。本文拆解两者差异、误区与选型标准。 做电商的老板几乎都问过:我到底是上一套ERP,还是搞一个电商管理后台?这两个词经常被混着用,结…

2026/9/30 15:43:33 阅读更多 →
TensorFlow安装失败的真相:它不是库而是系统级运行时

TensorFlow安装失败的真相:它不是库而是系统级运行时

1. 这不是“装个库”那么简单:TensorFlow到底在解决什么问题?你搜“tensorflow安装”,点开前五条结果,八成是“pip install tensorflow失败怎么办”“CUDA版本不匹配”“ImportError: DLL load failed”——但真正卡住你的&#x…

2026/9/30 15:43:33 阅读更多 →
Paperclip:AI应用中连接大模型与前端的轻量协议胶水层

Paperclip:AI应用中连接大模型与前端的轻量协议胶水层

1. “Paperclip”不是回形针:一个被误读的AI工程代号 最近在多个技术社区和开发者群聊里,“paperclip”这个词频繁跳出来,夹在Node.js安装教程、React面试题、OpenClaw部署指南和Claude Code配置说明之间,显得格格不入。有人以为是…

2026/9/30 15:43:33 阅读更多 →
JDK17下载安装与配置全攻略:环境变量、IDEA联动与常见坑位

JDK17下载安装与配置全攻略:环境变量、IDEA联动与常见坑位

先说我最近遇到的一件事:一个同事换了新电脑,装完Python和Git之后,顺手解压了一个Eclipse压缩包,双击启动直接弹窗报错——找不到Java运行时环境。他转头问我:“JDK到底有什么用?我是不是少装了什么&#x…

2026/9/30 15:43:33 阅读更多 →
C#预处理指令实战:从条件编译到多框架兼容

C#预处理指令实战:从条件编译到多框架兼容

1. 预处理指令到底是什么:先别急着写代码,把这个问题想清楚很多C#开发者写了两三年代码,可能都没正经用过预处理指令。我第一次接触这东西是在读别人的开源项目,看到一堆#if DEBUG、#region,第一反应是"这玩意儿不…

2026/9/30 15:43:33 阅读更多 →
重学C语言:从九九乘法表到项目实战,那些年没弄懂的编程细节

重学C语言:从九九乘法表到项目实战,那些年没弄懂的编程细节

如果你看到"你过去的C语言"这个标题时心里咯噔了一下,我猜你大概率和我一样:学过C语言,上过大学编程课,在翁恺老师的练习题和PTA上被字符串逆序、55鞍点、冒泡排序这些题目轮流虐过,最后却在某个深夜问自己一…

2026/9/30 15:42:29 阅读更多 →

日新闻

Base64 图片头部特征识别:从文件头到格式判断的完整指南

Base64 图片头部特征识别:从文件头到格式判断的完整指南

1. 项目概述:为什么说看懂 base64 图片头部是基本功这几年跟 base64 打交道的机会越来越多,后端接口返回图片、前端渲染验证码、小程序里存小图、还有一些老系统导出报表,动不动就给你一段长到怀疑人生的 base64 字符串。很多人拿到字符串就直…

2026/9/30 0:00:35 阅读更多 →
Java公交站牌广告管理系统:JSP+Servlet+MySQL实战落地指南

Java公交站牌广告管理系统:JSP+Servlet+MySQL实战落地指南

简介:本资源是一份面向Java初学者与课程设计学生的公交站牌广告灯箱管理系统毕业设计文档,聚焦城市公共广告资源信息化管理痛点,提供从需求分析到技术实现的完整方案。文档采用标准学术论文结构,含摘要、英文摘要、目录及五章正文…

2026/9/30 0:00:35 阅读更多 →
用 Redis Lua 构建大模型 API 多租户原子配额治理体系

用 Redis Lua 构建大模型 API 多租户原子配额治理体系

我去年年底接了一个内部 AI 平台的治理需求,背景很直接:公司把 DeepSeek、MiniMax 这类大模型 API 统一封装成内部网关,开放给几个业务团队用。结果第一个月账单出来,额度直接超了 4 倍。仔细查日志,发现原因并不复杂—…

2026/9/30 0:00:35 阅读更多 →

周新闻

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/9/30 13:14:22 阅读更多 →
SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/9/29 16:41:41 阅读更多 →
FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏 【免费下载链接】FireRed-OpenStoryline FireRed-OpenStoryline is an AI video editing agent that transforms manual editing into intention-driven directing through natural language …

2026/9/30 13:14:49 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/29 19:29:29 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/29 5:58:00 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/30 15:27:04 阅读更多 →