little-coder官方榜单成绩单:Terminal-Bench 2.0达24.6%、GAIA达40%,全靠一块8GB笔记本显卡
little-coder官方榜单成绩单Terminal-Bench 2.0达24.6%、GAIA达40%全靠一块8GB笔记本显卡【免费下载链接】little-coderA harness optimized to smaller LLMs项目地址: https://gitcode.com/gh_mirrors/li/little-coderlittle-coder 是一款专为本地小模型优化的 AI 编码智能体coding agent脚手架。它的官方成绩单相当硬核在 Terminal-Bench 2.0 官方榜单拿到24.6%第120名、GAIA 验证集40.0%——而全部测试只跑在一块8GB 显存的笔记本显卡上零云端推理。下面带你拆解这份成绩单背后的硬件配置、榜单数据与核心机制。一张表看懂 little-coder 的基准测试成绩 little-coder 的四基准基线成绩同一台消费级笔记本i9-14900HX 32GB 内存 RTX 5070 Laptop 8GB 显存版本模型基准测试成绩v0.0.2Qwen3.5-9BAider Polyglot225 题45.56%v0.0.5Qwen3.6-35B-A3BAider Polyglot78.67%v0.1.4Qwen3.6-35B-A3BTerminal-Bench-Core v0.1.180 任务40.0%6小时50分跑完v0.1.13Qwen3.6-35B-A3BTerminal-Bench 2.089 任务 × 5 次 445 试24.6% ± 3.2官方榜单位120v0.1.24Qwen3.5-9BTerminal-Bench 2.09.2% ± 2.4官方榜单位142v0.1.27Qwen3.6-35B-A3BGAIA 验证集165 任务40.00%66/165四个基准覆盖了从短编码练习到交互式终端调试再到多工具在线研究的完整光谱且全部离线完成。8GB 显卡跑 22GB 大模型显存分配是核心技巧这套成绩单最反直觉的一点模型是Qwen3.6-35B-A3B——一个 35B 总参数 / 3B 激活的 MoE 模型Q4 量化后磁盘上约 22.1 GB比 8GB 显存大得多。 秘密在于 llama.cpp 的--n-cpu-moe 999参数专家权重experts放内存RAM只有注意力层和共享专家驻留显存32K 上下文下实测显存占用仅3.8 GB还留有约 4GB 余量配合--flash-attn on实测生成速度约44 tokens/s足以支撑数小时的长任务。换句话说8GB 显卡跑的是35B 模型靠的是 MoE 结构 权重分层的巧妙调度。完整的本地模型服务配置llama.cpp / Ollama / LM Studio 三种方式见 README.md 的 Local model setup 章节模型注册表在 models.json。Terminal-Bench 2.0 官方榜单24.6% 是怎么拿下的 Terminal-Bench 2.0 是目前终端智能体领域最严格的公开榜单之一89 个真实系统任务每个任务跑 5 次共 445 个试验要求提示词全程一致才能提交。little-coder 的提交路径v0.1.13全量跑完 445 个试验提交官方榜单期间发现某任务prove-plus-commCoq 交换律证明出现死亡循环式回归v0.1.24 引入提示词重复机制重新注入工具描述 简洁性指南后试点 4/4 通过榜单按 5 次试验重算后最终定格24.6% ± 3.2位列第 120 名。同期用更小的 Qwen3.5-9B5.3GB 全 GPU 部署单 token 速度快约 2 倍跑同一榜单拿到9.2% ± 2.4第142名——能力差距真实存在但远小于直觉中9B vs 35B的鸿沟。此前在 Terminal-Bench-Core v0.1.180 个任务、单次尝试上little-coder 已拿下40.0%完整复盘见 docs/benchmark-terminal-bench-v0.1.1.md。榜单提交所用的 2.0 适配器在 benchmarks/harbor_adapter/little_coder_agent.py。GAIA 基准测试 40%本地智能体做多工具研究任务GAIA 考的不是写代码而是像研究员一样工作浏览网页、抽取证据、多轮工具调用后给出准确答案。little-coder 在 165 题验证集上答对 66 题40.00%分级表现级别通过率说明L160.4%单步工具任务本地小模型已很能打L237.2%多步推理 工具组合L37.7%长程规划仍是小模型的天花板GAIA 跑法有一个关键设计工具白名单——只开放Read/Bash/Grep/Glob/WebFetch/Browser*/Evidence*刻意屏蔽Write/Edit因为研究任务不需要改代码收窄工具面能显著降低小模型的出错率。评分器忠实还原官方判分逻辑运行入口在 benchmarks/gaia.py。配套技能卡如先取证再作答协议 skills/protocols/cite_before_answer.md让模型学会把网页原文先蒸馏成证据条目避免原始文本污染上下文。成绩从哪来脚手架与模型的匹配才是关键为什么同一块 8GB 显卡上的 9.7B 小模型能拿到这些分数核心结论是脚手架–模型匹配scaffold–model fit比换更大的模型更重要。官方做的同模型对照实验最有说服力Qwen3.5-9B 用原生 Aider 只有19.11%换到 little-coder 脚手架后跳到45.6%——同样的模型权重、同样的测试协议唯一的变量是架构。矩阵里那个蓝色的69就是脚手架红利这 69 道题模型明明有能力做对原生 Aider 做不到little-coder 做到了而反向仅 Aider 通过只有 11 题约 6:1 的净增益比。little-coder pi 智能体内核 30 余个 TypeScript 扩展30 张技能卡按需注入不占冷启动上下文。对新手来说几个最承重的机制Write 守卫对已存在的文件拒绝 Write强制走 Edit杜绝小模型整文件重写翻车读后必改Edit 前必须先 Read 该文件保证编辑匹配文件当前文本质量监控检测空输出/幻觉/死循环并自动发起纠正追问思维预算每回合思考 token 上限防止小模型想跑飞技能注入按错误恢复 最近使用 意图为当前回合挑选工具卡与算法速查表如 skills/knowledge/binary_search.md。在 Aider Polyglot 的 78.67% 高分运行中各语言表现JavaScript89.8%、Python88.2%、C84.6%、Java76.6%、Go74.4%、Rust53.3%——每种语言都比 9B 模型提升 23 个百分点以上。重试机制把测试输出作为上下文再来一轮在 C 上额外挽回13.5pp、Go 上10.3pp——测试输出引导的重试是小模型脚手架的又一杠杆。时间维度上little-coder 通过一题平均176 秒Aider 141 秒但失败题上愿意多探索491s vs 224s——探索更长换来每小时 1.72 倍的通过量。little-coder 安装与本地模型配置步骤✅ 上手只需三步要求 Node.js 22.19# 1. 一键安装 npm install -g little-coder # 2. 本地起模型服务llama.cpp显存技巧见上文 --n-cpu-moe build/bin/llama-server -m ~/models/Qwen3.6-35B-A3B-UD-Q4_K_M.gguf \ --host 127.0.0.1 --port 8888 --jinja -ngl 99 --n-cpu-moe 999 --flash-attn on # 3. 在你的项目目录里启动 little-coder想复现榜单成绩或研究扩展机制可以克隆源码git clone https://gitcode.com/gh_mirrors/li/little-coder cd little-coder npm install基准测试脚本在 benchmarks/ 下Polyglot 驱动 benchmarks/aider_polyglot.py扩展系统详解见 docs/extensions.md。写在最后这份8GB 显卡成绩单传递的信号很清晰小模型 好脚手架可以打到官方榜单的中游水位而且全程免费、离线、隐私可控。little-coder 的项目路线图显示第二阶段将聚焦让本地小模型可靠地运维大型 Markdown 知识库这一日常真实场景——对一个只装在你的笔记本上的 AI 编码智能体来说这或许比榜单分数更实用。项目采用 Apache 2.0 许可证见 LICENSE欢迎直接上手。【免费下载链接】little-coderA harness optimized to smaller LLMs项目地址: https://gitcode.com/gh_mirrors/li/little-coder创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

openrig多卡平台搭建实战:从硬件选型到散热排障全解析

openrig多卡平台搭建实战:从硬件选型到散热排障全解析

做多卡机器这几年,我最大的感悟是:最难的从来不是买显卡,而是怎么把七八张卡稳定、有序、散热良好地装到一起。openrig这个名字,如果你搜过,会发现它指向一套开源的硬件构建框架——核心思路是把过去只存在于老玩家脑子…

2026/10/2 23:02:19 阅读更多 →
openrig玩法解析:从开放式模块化工位到DIY装备方法论

openrig玩法解析:从开放式模块化工位到DIY装备方法论

openrig到底是种什么玩法?从一套开放式模块化工位说起“openrig”这个词我最早是在整理工作室时冒出来的想法。你可以把它理解成一句话:把电脑主机、测试设备、拍摄器材、维修工具这些平时堆在一起的硬件,全部装进一套开放式、可拆装、可复用…

2026/10/2 23:01:19 阅读更多 →
两分钱扎带引发灾难级误报:预测性维护的误判逻辑与排查复盘

两分钱扎带引发灾难级误报:预测性维护的误判逻辑与排查复盘

不知道你有没有被设备半夜的告警电话叫起来过。我做设备状态监测这些年,最怕听到的不是“设备坏了”,而是“系统刚才弹了灾难级告警”。因为这个级别在设定时,基本是给“轴承马上要抱瓦”“转子快要飞车”这类毁机式故障预留的,一…

2026/10/2 23:01:18 阅读更多 →

最新新闻

Windows Server 2019 部署 Oracle 11g/19c 兼容性实战指南

Windows Server 2019 部署 Oracle 11g/19c 兼容性实战指南

简介:本资源是一份面向数据库运维工程师、系统集成人员及Windows平台Oracle初学者的实战部署指南,聚焦Windows Server 2019环境下Oracle 11g与19c服务端及客户端的全流程安装配置。内容覆盖操作系统基础搭建、Oracle双版本服务端部署、NIC网络聚合配置、…

2026/10/2 23:33:55 阅读更多 →
诚信的幕墙维保企业有哪些?华局建工深圳分公司综合实力推荐

诚信的幕墙维保企业有哪些?华局建工深圳分公司综合实力推荐

诚信的幕墙维保企业有哪些?这是深圳众多写字楼物业、商业综合体和小区业委会在面对玻璃自爆、胶缝老化、外墙渗漏时反复追问的问题。幕墙维修行业门槛参差不齐,散工队伍无资质上岗、修完找不到人、报价不透明等现象时有发生,业主最看重的其实是两个字—…

2026/10/2 23:33:55 阅读更多 →
Coze低代码平台二次开发与私有化部署迁移实战

Coze低代码平台二次开发与私有化部署迁移实战

上个月接了个活儿,客户在 Coze 上搭了二十多个工作流,一直跑得好好的,突然提出要“迁到内网”。原因倒也不复杂:知识库里累积了一批敏感业务数据,管理层明确说这些数据不能出内网;同时,他们还想…

2026/10/2 23:33:54 阅读更多 →
TP4056锂电池充电管理芯片:电路设计、优化与创新应用详解

TP4056锂电池充电管理芯片:电路设计、优化与创新应用详解

之前做了一个6槽18650充电座,客户要求低成本又能保证充电一致性,最后方案里选了TP4056做核心充电管理。这颗芯片在DIY圈和产品开发圈里都很常见,淘宝上一板下来几毛钱,外围元件加起来不到十颗,却能完成单节锂电池完整的…

2026/10/2 23:33:54 阅读更多 →
我把 OpenClaw 从聊天工具改造成测试工作流助理:一次完整实操复盘

我把 OpenClaw 从聊天工具改造成测试工作流助理:一次完整实操复盘

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/2 23:33:53 阅读更多 →
Cursor实战案例-图形图像-45-流程图自动绘制:解析Mermaid语法文本并自动导出SVG流程图和拓扑架构图|TaoToken统一Key接入

Cursor实战案例-图形图像-45-流程图自动绘制:解析Mermaid语法文本并自动导出SVG流程图和拓扑架构图|TaoToken统一Key接入

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/2 23:32:53 阅读更多 →

日新闻

从零搭建AI工程化:模型之外的完整闭环

从零搭建AI工程化:模型之外的完整闭环

先搞清楚一件事:从零开始做 AI 工程化,难的从来不是调模型、写提示词,而是把一套原型 Demo 变成长得像是“正经系统”的东西。你手里可能已经有了能跑通的代码,也可能刚读完一些概念,但真到了要把它变成可维护、可观测…

2026/10/2 0:00:20 阅读更多 →
大模型训练显存估计与混合精度训练实战指南

大模型训练显存估计与混合精度训练实战指南

1. 大模型训练显存估计与混合精度训练详解显存不够用,几乎是每个做大模型训练的人都会撞上的第一堵墙。你可能也经历过:模型代码写完了,数据管道跑通了,满心欢喜地按下训练启动脚本,结果几秒钟后终端弹出一行红字——C…

2026/10/2 0:00:20 阅读更多 →
小样本学习数据集选型指南:27个真正可用的高质量数据集

小样本学习数据集选型指南:27个真正可用的高质量数据集

1. 小样本学习的“弹药库”:为什么你总在找数据集,却总找不到真正能用的? 小样本、数据集——这两个词最近半年在我处理的200多个AI项目咨询里,出现频率排进前三。不是模型调不好,不是代码写不对,而是卡在…

2026/10/2 0:00:20 阅读更多 →

周新闻

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/10/1 19:40:48 阅读更多 →
SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/10/1 19:41:40 阅读更多 →
FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏 【免费下载链接】FireRed-OpenStoryline FireRed-OpenStoryline is an AI video editing agent that transforms manual editing into intention-driven directing through natural language …

2026/10/1 20:05:24 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/2 10:36:31 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/2 5:26:06 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/2 6:09:11 阅读更多 →