【免费下载链接】Tracely-aiTrace-native CI/CD for AI agents — production failures become regression tests that block the PR. Auto-detect, cluster, freeze into hermetic cases, replay in CI for $0.项目地址https://gitcode.com/gh_mirrors/tra/Tracely-ai点击查看免费下载Tracely 是一款面向 AI 智能体AI Agent的Trace 原生 CI/CD 平台它把生产环境中真实失败的那次运行trace自动检测、聚类并冻结成零成本的回归测试用例在每次代码提交PR时重放并拦截——生产失败直接变成回归测试Production failures become regression tests。本文用零代码门槛的视角带你完整理解 Trace 原生 CI/CD 的每个核心概念Trace、Evaluator、Failure Cluster、Regression Case、CI Gate 以及 Hermetic Replay。上图是 Tracely 的仪表盘左侧四个数字卡片分别回答四个问题——跑了多少Traces、坏了多少Failure Clusters、自动检测到多少失败Auto Failures、已有多少被冻结成测试Regression Cases。这就是Trace 原生 CI/CD想表达的全部。为什么可观测性工具不够用如果你给 AI Agent 做过线上监控大概率经历过这样的循环客户投诉AI 答非所问打开监控面板看到1 次失败的数字然后呢——然后什么也没有。可观测性工具observability tools只负责让你看见不负责让它不再发生。而另一类工具——评测Eval平台——则要求你手工编写数据集自己编问题、写理想答案、随产品演进不断更新。这份数据集本质上只是对什么会坏的猜测。Tracely 的出发点是一句非常简单的论断来自项目总纲 guides/OVERVIEW.md 想象一个回答客户问题的机器人某天它悄悄坏了——它嘴上说查了订单实际上根本没调用工具答案全是编的。大多数工具只会在图表上画一个1 次失败。Tracely 会录下那个坏掉瞬间一键把它变成测试从此每次改代码都离线、确定性地重放那一刻。如果某次改动让 bug 复活Tracely 会在 PR 合并前拦截它。生产环境其实早就把最好的测试样本送给了你那次失败运行的精确输入、精确的工具调用、精确的模型响应。记录下来的运行本身就是测试The recorded runisthe test。核心概念一Trace 是唯一的真相源Tracely 数据模型的第一原则写在设计文档 design/part2-tracely/00-canonical-decisions.md 里Trace 是 source of truth评测分数、失败聚类、回归测试、CI 裁决、质量趋势——全部由它派生。没有手工数据集。理解这个概念先认识几个词概念一句话解释Span运行中的一个步骤一次模型调用、一次工具执行Trace 是一棵 Span 树TraceAgent 的一次完整运行一轮对话Conversation会话线程多轮 Trace 按conversation分组成的完整对话Evaluator评估器一条什么算坏的规则可以是纯代码的结构检查也可以是 LLM 裁判Failure Cluster失败聚类多个相同原因的失败自动归成的一个问题IssueRegression Case回归用例由失败 Trace 一键冻结出的测试带先红后绿契约CI GateCI 门禁PR 上的一次回归重放运行产出 PASS / FAIL可阻断合并与传统做法的对比数据集优先的工具TracelyTrace 原生测试从哪来你手工编写从真实失败 Trace 晋升与生产的保真度猜测与失败运行逐字节一致CI 重放成本真实模型调用$0回放录制的工具/LLM 输出回归发生时面板数字动了PR 被拦截你怎么知道自己去刷面板主动通知——Slack、邮件、Webhook在 Traces 页面里Agent 运行不再是平铺的 Span 列表而是按会话线程分组一行就是一段对话首条用户消息 → 最后一条助手回答失败的线程带红点多轮对话一目了然。这种对话优先的呈现方式让 Agent 语义agent.id、conversation.id、turn成为一等索引列而不是读取时才去解析的字符串——这正是 Trace 原生区别于通用 Span 存储的关键详见 docs/pages/concepts.mdx。核心概念二五步闭环——观察 → 检测 → 分诊 → 冻结 → 拦截Tracely 的产品骨架是一条五步闭环左侧导航栏就是按这五步组织的 观察 OBSERVE ──▶ 检测 DETECT ──▶ 分诊 TRIAGE ──▶ 冻结 TEST ──▶ 拦截 SHIP 生产 Trace 每次运行自动打分 失败归为 Issue 一键变回归测试 阻断 PR 合并第 1 步 · 观察每一次运行都可读Trace 通过标准的 OTLP 协议上报任何语言的 OpenTelemetry 导出器都行Python 用户则用官方 SDK见 sdk/README.md。瀑布图waterfall会展示 agent → thinking → skill → generation → 工具调用 的完整层次失败的那一段标红输入输出就在旁边。除了瀑布图同一个会话还有 Timeline逐步回放和 Replay像看录像一样按倍速回放整段对话两种读法多智能体系统里谁把活儿交给了谁一眼可见。第 2 步 · 检测每次运行落地即自动打分运行一落地约 4 秒防抖后所有已启用的 Evaluator 自动运行并写入分数。内置检查包括Run outcome——任何 Span 报错Tool success——某个工具调用失败定位到具体工具Tool consistency——最阴险的一类模型声称调了工具实际从没执行静默失败纯看日志根本发现不了Latency——超过延迟预算LLM 裁判——答案质量、对话意图等主观评分需要配置模型 Key。其中静默失败是明星能力一次运行零报错却依然坏了——只有把 Trace 里请求的工具和执行的工具逐一对比才能抓住。第 3 步 · 分诊31 个坏运行归成 1 个问题失败不再是一行一行读而是自动聚类上图中 4 个聚类的数字13 / 12 / 12 / 12就是同一个 bug 坏了多少次。Tracely 提供两级聚类签名聚类——即时、免费的结构指纹所以失败页永远不会空嵌入 LLM 语义聚类——点一下 Analyze failures嵌入向量按失败机理而非话题聚簇再由 LLM 写出人类可读的 Issue 标题、描述、严重度和修复建议。每个聚类页还可以一键生成能抓住这个 bug 的评估器代码或直接晋升为回归用例。第 4 步 · 冻结把失败变成先红后绿的测试对坏运行点一次Promote它就从一条日志变成一个测试用例的核心是一个叫fail-to-pass 契约的概念这个用例必须在产生它的那次坏代码上失败红、在修复后的代码上通过绿否则这次晋升不被信任。截图里的no_error: true、required_tools: get_weather就是断言右侧Reference trajectoryAGENT → GENERATION → TOOL是当次运行的参考轨迹。多轮对话的行为则用Scenario场景表达可以是脚本化的多轮对话也可以交给红队模型即兴对抗目标达成 攻击成功 FAIL。第 5 步 · 拦截$0 成本的 CI 门禁CI 里跑tracelyCLIsimulate/replay/gate三个子命令配一个 GitHub Action门禁会回放录制的工具/LLM 输出作为桩stub确定性同样的输入永远得到同样的结果离线不需要 API KeyCI 不花一分钱这就是项目宣称的replay in CI for $0阻断任何用例回归 → 退出码非零 红色 commit status PR 评论。注意截图第一行的NO_COVERAGE一次一个用例都没跑到的门禁运行不算绿——测了个寂寞却放行是最糟糕的假绿色。这是 Tracely 诚实门禁honest gate设计的一部分。概念延伸门禁之外的三个进阶能力能力解决什么概念问题Judge Calibration裁判校准LLM 裁判会错判。让 LLM 裁判阻断 CI 之前先让它对着你的标注做校准一致率、漏判missed failures、误报over-flags分别可见Alerts告警流从你去刷面板变成它来找你触发条件门禁失败 / 新失败模式 / 评分跌破线 可视化流程条件 → LLM 步骤 → Slack / 邮件 / WebhookTrends趋势回归闭环本身的健康度失败率、门禁通过率、MTTR 趋势、逐 Agent 的跨指标相关性分析架构速览概念背后是哪几个组件在干活不用改代码也能理解 Tracely 的分层完整说明见 CLAUDE.md 与 backend/README.md你的 AgentTracely SDK / 任意 OTLP 导出器 │ POST /v1/traces ▼ FastAPI 后端 ── 原始 OTLP 先落 S3/MinIO真相源永不丢──▶ 入队 Redis ▼ Celery Worker解析 → 映射到 Agent 语义列 → 写入 ClickHouseevents scores │ 防抖后自动跑 Evaluator → 失败聚类 ▼ Postgres pgvector注册表Agent / 用例 / 门禁 / 聚类 / 评估器 ▼ Next.js 前端Traces · Clusters · Cases · Gates · Trends概念对应关系一句话总结Trace 与分数在 ClickHouse海量、只追加Agent、用例、门禁、聚类等控制面在 Postgres重放用的录制数据fixture bundle在对象存储——所以重放 $0在架构上是成立的桩数据本来就存在那里。五分钟跑起来亲眼看一遍完整闭环git clone https://gitcode.com/gh_mirrors/tra/Tracely-ai cd Tracely-ai docker compose --profile demo up -d --build --wait # 浏览器打开 http://localhost:3001这条命令会拉起全部依赖ClickHouse、Postgres、Redis、MinIO执行迁移、播种默认项目并填充演示数据——你会直接看到上面这些截图对应的页面而不是空壳。接入自己的 Agent 只需几行 Python完整指南见 docs/pages/quickstart.mdximport tracely_sdk as tracely tracely.init(endpointhttp://localhost:8000, api_keytracely_dev_key, service_namesupport-agent, envprod, instrumentauto) with tracely.trace(agentsupport-agent, conversationconv-1, useru_42): client.chat.completions.create(modelgpt-4o, messages[...])instrumentauto会自动挂上 OpenAI / Anthropic / LangChain 等探针——零 Span 代码正常的 provider 调用就被完整捕获。常见概念疑问 FAQQ这和 LangSmith、Phoenix 那些评测平台有什么区别它们的基本盘是数据集 → 实验 → 打分器测试靠人编数据集行无法表达这条失败轨迹不能再出现。Tracely 把Trace 本身作为主键测试从真实失败中来重放离线免费回归直接拦 PR。Q为什么重放不花一分钱工具输出和 LLM 响应在录制时已存成 fixtureCI 重放时由 SDK 的call_tool/call_llm接缝按序发回连生产上那次工具超时都会如实回放成超时。QLLM 裁判靠不住敢让它拦 CI 吗所以有Judge Calibration先对裁判的裁决做人工 ✓/✗ 标注看一致率与漏判/误报方向校准达标再让裁判进门禁。结构性检查纯代码、无需模型则不受此影响。Q不是 Python 服务也能用吗能。任何语言只要发 OTLP 到POST /v1/traces并带上tracely.*属性即可CI 侧也可以用tracely simulate由 Tracely 直接驱动你的 HTTP 端点CI 里不需要装任何 Agent 代码。结语一张心智模型图学完这篇把下面这张图记住就算入门了生产 Trace真相源 ├─▶ Evaluator 打分 → 失败被自动看见含静默失败 ├─▶ Failure Cluster → 31 个坏运行 1 个 Issue ├─▶ Promote → 坏运行冻结成先红后绿的回归用例 ├─▶ CI Gate$0 重放 → 回归发生的那一刻PR 被拦下 └─▶ Alerts / Trends → 不刷面板主动找上门Trace 原生 CI/CD 的精髓只有八个字记录即测试重放即回归。下一步建议按顺序读 guides/OVERVIEW.md完整产品导览与 guides/EVALUATION_GUIDE.md评估体系或打开docs/pages/下各功能页面对照本文概念逐个上手。赞分享【免费下载链接】Tracely-aiTrace-native CI/CD for AI agents — production failures become regression tests that block the PR. Auto-detect, cluster, freeze into hermetic cases, replay in CI for $0.项目地址https://gitcode.com/gh_mirrors/tra/Tracely-ai点击查看免费下载相关推荐为什么你的AI模型需要CleverHans测试安全评估完整指南为什么你的AI模型需要CleverHans测试安全评估完整指南 在当今AI技术飞速发展的时代机器学习模型的安全性已成为不容忽视的关键问题。CleverHan人工智能模型安全AI评测深度学习Woodpecker CI/CD 入门指南从 CI/CD 概念到首个流水线实战Woodpecker CI/CD 入门指南从 CI/CD 概念到首个流水线实战 Woodpecker 是一个以「轻量、简单、快速」为设计目标的 CI/CD 引CI/CDDevOps为什么你的密码安全检测需要THC-Hydra终极完整指南为什么你的密码安全检测需要THC Hydra终极完整指南 THC Hydra是一款强大的密码安全检测工具能够帮助用户评估系统密码的强度和安全性。无论是个人用网络安全应用安全渗透测试创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考