AllData集成开源项目Coze-Loop,建设大模型评测平台,实现模型自动化测评、效果量化评估,助力 AI 应用落地!
►顶部微信名片可直接添加市场总监商务咨询、方案沟通即时响应►点击链接了解更新详情演示体验、社群咨询、商务采购https://docs.qq.com/doc/DVHlkSEtvVXVCdEFoAllData数据中台集成开源项目Coze-Loop建设大模型评测平台。Coze-Loop是面向AI Agent全生命周期的一站式评测与运维平台集Prompt开发、多维度评测、全链路观测于一体实现智能体从调试、评估到上线监控的闭环管理。Coze-Loop以开源模式向开发者开放核心基础功能模块通过提供可视化Playground、自动化评估引擎和跨语言SDK平台可打通大模型能力与实际业务场景之间的效果验证壁垒把提示词调试、评测实验、线上追踪整合在同一工作台。形成先调试、后评测、再优化的标准化AI应用迭代流程降低智能体效果量化与持续调优的技术门槛为企业智能问答、业务流程自动化、多模型应用接入提供可量化、可持续的AI运维底座。Coze-Loop开源地址 https://github.com/coze-dev/coze-loopCoze-Loop项目文档https://loop.coze.cn/open/docs/cozeloop/大模型评测平台Coze-Loop-功能实操1、使用流程图示2、Prompr项目统一托管所有提示词模板支持检索、新建、版本管理与操作是Prompt资产的总览清单页面。选择列表中项目可查看项目详细内容。编辑更改后需要点击【提交新版本】进行正式保存。 小知识3个模版引擎各自作用以及选型建议● Normal模板引擎(双大括号 {{}}识别变量)轻量化简单模板引擎仅支持纯变量替换。只识别{{变量名}}占位符渲染时直接把变量值替换进模板文本不支持if条件、for循环、过滤器等逻辑代码。适合绝大多数简单Prompt场景上手最简单政务查询这类基础变量注入首选。● Jinja2模板引擎Python生态标准模板引擎支持完整复杂逻辑。除变量替换外支持if条件分支、for循环、数据过滤器、文本格式化。可根据传入数据动态拼接Prompt 文本适合 RAG、多分支智能体、需要动态裁剪内容的复杂提示词场景。语法使用{% %}写逻辑{{}}输出变量。●GoTemplate模板引擎Go语言生态原生模板引擎同样支持条件判断、循环等复杂逻辑。语法风格是Go体系适合后端使用Golang开发的业务系统和Go应用原生兼容适合Go服务通过SDK拉取Prompt并渲染的场景适合技术栈为Go的项目使用。只做变量替换选Normal需要动态分支逻辑、后端Python技术栈选Jinja2后端Go技术栈选GoTemplate。点击【版本记录】可以查看该项目以往版本支持一键还原历史版本。点击【对比模式】可以增加对照组/对比模式核心目的是2-4组对比测试不同Prompt方案用来直观评估修改Prompt之后大模型回答效果好坏是Prompt调优、评测的核心能力。● 对比方式通过输入同一套测试问题、同一批变量并排展示两边大模型输出结果直接横向对比差异快速判断Prompt优化是否有效。对比模式最多可设置4组。3、Playground这里作为临时实验沙箱用于快速写一段System提示词、配置模型参数立刻调试大模型效果。适合快速做一次性实验、临时验证想法快速试不同指令、调参快速看模型输出。使用流程● 步骤1先在Playground快速编写、调试、A/B 对比Prompt验证提示词效果● 步骤2效果满意后点快捷创建把调试好的Prompt直接生成一个Prompt项目● 步骤3在Prompt项目里继续迭代版本、提交、接入SDK、做批量评测上线业务。小帖士Playground就像草稿本随手写草稿测试Prompt项目是归档文档定稿后存起来、可以对外交付使用、记录每一次修改版本。4、评测管理评测管理依托评测集、评估器、实验三大子功能完成大模型效果的配置、批量评估与对照实验量化模型输出质量。4.1 评测集这里是存放批量测试用例的数据集是评测的 “测试题库”。支持手工新增、批量导入测试样例支持版本管理修改后提交新版本● 业务场景把政务资产查询的各类测试问题、边界用例、敏感提问批量录入用来批量验证Prompt/模型效果准备评测原材料只负责管理测试样本不执行评测。点击列表选择评测集可查看评测数据集的编辑管理页维护测试样例本身和查看所有引用了当前这套评测集的评测实验信息。4.2 评估器这里是存放打分规则/评判标准用来自动或者人工判定模型回答的合格程度支持2种选择评估方式大模型自动打分、人工标注打分。● 评估器本质打分规则定义器用来告诉系统怎么评判大模型回答是否合格。自建评估器存放和管理自行编写评估Prompt和自定义评判标准。评估器类型选型建议01 LLM评估器(大模型裁判评测)依靠大模型实现语义类主观质量评测(如幻觉、正确性、相关性等)● 适用场景侧重内容质量、语义理解类评测。● 特点理解自然语言适合模糊、开放类问答评测可以判断逻辑、事实、风格、安全风险。02 Code评估器(代码规则硬校验)通过固定代码规则完成确定性文本与格式硬校验(如JSON、正则、关键词匹配)。● 适用场景格式、文本规则、结构化输出校验。● 特点结果稳定无随机性适合结构化输出、固定格式、关键词强校验场景只做规则比对不理解语义。预设评估器存放平台内置好的通用评估规则,开箱即用无需自行编写Prompt。4.3 实验这里存放和管理执行评测任务把评测集评估器选定 Prompt 项目组合起来批量跑测。平台会自动批量跑全部测试用例调用大模型生成回答并按照评估器规则自动打分生成汇总评测报告、各项指标。可对比多套 Prompt 版本的总分、错误案例判断哪个Prompt效果更好。⚠️ 评估器实验和Prompt项目运行区分Prompt项目单独运行时只是手动单条测试Prompt效果不自动调用评测集、评估器不会批量打分● 运行结果流向单次对话返回仅实时看模型输出不保存为评测实验报告不会流入 “评测实验结果” 模块。结果可在 Prompt 项目页面查看单次调用内容可接入SDK线上调用。评测实验批量评测才会同时加载评测集Prompt项目评估器完成自动化批量评测打分。● 运行结果流向批量执行所有测试样本自动调用评估器(LLM/Code评估器打分结果存入实验模块生成完整评测实验报告(各项指标、分数、样本明细)。5、观测管理存放和管理真实业务上线后每一次大模型请求的完整执行链路。评测管理是事前批量测评观测管理是线上真实调用的事后全链路监控、日志与调用追踪这里是分布式链路追踪记录线上真实业务请求的完整调用过程不是评测实验。点开单条Trace可查看请求时序、各环节耗时、Token消耗、原始问答与异常信息支持业务标签归类统计快速排查线上问题。点击【过滤器】可以按MessageID、耗时、输入输出、首字延迟、Span名称/类型、请求状态等维度精准筛选 Trace链路。6、标签管理可以统一创建、维护业务标签给Prompt项目、Trace调用链路、评测任务打上分类标记。可以按业务场景、用户类型、模型版本等维度打标签后续在观测管理、评测模块中基于标签快速筛选、分组统计实现大模型各类资源与请求的归类管理。

相关新闻

hindsight:轻量级AI工程复盘系统,支持Python/npm/Docker/OpenAI上下文快照

hindsight:轻量级AI工程复盘系统,支持Python/npm/Docker/OpenAI上下文快照

1. 项目概述:hindsight 不是“事后诸葛亮”,而是一套可落地的系统性复盘工程 “hindsight”这个词在日常语境里常被翻译成“后见之明”或“事后诸葛亮”,带点贬义——仿佛只是马后炮式的感慨。但在我过去八年做技术产品交付、AI工具链搭建和D…

2026/9/30 19:57:49 阅读更多 →
头盔检测数据集:8300张YOLO格式图片助力智慧交通目标检测实战

头盔检测数据集:8300张YOLO格式图片助力智慧交通目标检测实战

摩托车头盔戴没戴,现在已经成为很多地方路口执法的重点。以前靠交警肉眼盯监控,费人力不说,效率还低——一个交警同时盯几十路画面,总有漏掉的。这时候就需要算法自动判断“这个人有没有戴头盔”,而调算法的第一步&…

2026/9/30 19:57:49 阅读更多 →
龙架构兼容互认|织灵 Coda Loom 2.0 完成龙芯平台兼容性测试

龙架构兼容互认|织灵 Coda Loom 2.0 完成龙芯平台兼容性测试

近期,可达智灵与龙芯中科技术股份有限公司完成龙架构兼容互认证,获颁《龙架构兼容互认证书》(证书编号:LS06100260319)。经基于龙芯平台的兼容性测试,LoongArch 龙架构与织灵 Coda Loom 系统 V2.0 功能与稳…

2026/9/30 19:56:48 阅读更多 →

最新新闻

同一张切片,同时看蛋白和RNA:空间多组学为什么需要PCF?

同一张切片,同时看蛋白和RNA:空间多组学为什么需要PCF?

更新于2026年9月29日空间多组学的发展,让研究者开始同时关注RNA、蛋白、细胞状态以及组织结构。但在实际研究中,“同时拥有多组学数据”并不一定意味着真正实现了空间上的多模态整合。如果蛋白和RNA分别来自不同组织切片,即使两张切片位置相邻…

2026/9/30 21:23:28 阅读更多 →
视频融合平台:语音对讲、云台控制、电子地图和平台级联功能介绍

视频融合平台:语音对讲、云台控制、电子地图和平台级联功能介绍

国标视频云平台SkeyeVSS平台基于云边端协同架构,可支持多协议、多类型的海量设备接入与分发。平台可提供的视频能力包括:视频监控直播、云端录像、云存储、录像检索与回看、智能告警、平台级联、云台控制、语音对讲、智能分析等。视频融合平台的核心价值…

2026/9/30 21:23:28 阅读更多 →
被开除程序员绝地逆袭 #亿行代码:从开除到总裁的反击 #小艺剧场 #热播短剧

被开除程序员绝地逆袭 #亿行代码:从开除到总裁的反击 #小艺剧场 #热播短剧

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/30 21:23:28 阅读更多 →
SYCL实战入门:从VSCode配置到GPU首程跑通

SYCL实战入门:从VSCode配置到GPU首程跑通

1. 这不是又一本“C语法补习班”,而是一份真正在GPU上跑通第一个SYCL程序的实操手记SYCL这个词最近在高性能计算、AI推理加速和HPC领域出现频率越来越高,但翻遍中文技术社区,你会发现大量内容要么是照搬Khronos官网的抽象定义,要么…

2026/9/30 21:22:26 阅读更多 →
Claude Code与Codex接入Jev:让编程Agent学会自己拿主意

Claude Code与Codex接入Jev:让编程Agent学会自己拿主意

最近 coding agent 圈子里有个话题挺热的:Claude Code 和 Codex 这类工具已经很能打了,但真到了复杂项目里,你总会发现它们“缺了点心眼”——你问它一句,它就老老实实做一步;你少交代一个边界,它就敢往坑里…

2026/9/30 21:22:26 阅读更多 →
Codex接入Jev第三方模型:从配置到排错的完整实战指南

Codex接入Jev第三方模型:从配置到排错的完整实战指南

最近一直有朋友问我,Codex 到底能不能接入第三方模型——尤其是 Jev 这种在开发者圈子里讨论度挺高的服务。我自己的答案很明确:能,而且配好之后体验完全不一样。这篇文章不聊概念,直接把我从安装、配置到排错的全过程拆开讲清楚&…

2026/9/30 21:22:26 阅读更多 →

日新闻

Base64 图片头部特征识别:从文件头到格式判断的完整指南

Base64 图片头部特征识别:从文件头到格式判断的完整指南

1. 项目概述:为什么说看懂 base64 图片头部是基本功这几年跟 base64 打交道的机会越来越多,后端接口返回图片、前端渲染验证码、小程序里存小图、还有一些老系统导出报表,动不动就给你一段长到怀疑人生的 base64 字符串。很多人拿到字符串就直…

2026/9/30 0:00:35 阅读更多 →
Java公交站牌广告管理系统:JSP+Servlet+MySQL实战落地指南

Java公交站牌广告管理系统:JSP+Servlet+MySQL实战落地指南

简介:本资源是一份面向Java初学者与课程设计学生的公交站牌广告灯箱管理系统毕业设计文档,聚焦城市公共广告资源信息化管理痛点,提供从需求分析到技术实现的完整方案。文档采用标准学术论文结构,含摘要、英文摘要、目录及五章正文…

2026/9/30 0:00:35 阅读更多 →
用 Redis Lua 构建大模型 API 多租户原子配额治理体系

用 Redis Lua 构建大模型 API 多租户原子配额治理体系

我去年年底接了一个内部 AI 平台的治理需求,背景很直接:公司把 DeepSeek、MiniMax 这类大模型 API 统一封装成内部网关,开放给几个业务团队用。结果第一个月账单出来,额度直接超了 4 倍。仔细查日志,发现原因并不复杂—…

2026/9/30 0:00:35 阅读更多 →

周新闻

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/9/30 13:14:22 阅读更多 →
SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/9/30 18:13:06 阅读更多 →
FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏 【免费下载链接】FireRed-OpenStoryline FireRed-OpenStoryline is an AI video editing agent that transforms manual editing into intention-driven directing through natural language …

2026/9/30 13:14:49 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/29 19:29:29 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/29 5:58:00 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/30 15:27:04 阅读更多 →