Laya vs Jev:33ms 跑完决策,成本为零,开源模型正在改写 AI 路由
Laya vs Jev33ms 跑完决策成本为零开源模型正在改写 AI 路由大多数 AI 模型是用来聊天的。你给它提示词它一个 token 一个 token 往外蹦然后你再从一堆文本里解析结果。写文章、写代码、聊天这样没问题。但如果你只是想让模型回答“这封邮件该转给哪个部门”这就太浪费了。Laya 换了个思路。它由 Convai Innovations 开发2026 年 9 月 18 日以 Apache 2.0 协议开源。Laya 不是自回归生成模型而是非自回归决策模型。你给它一段非结构化文本再加一个带类型的问题它直接返回结构化答案和校准过的概率。没有生成没有幻觉不用解析 JSON。下面说说它在实际生产里到底怎么用和 TypeSafe AI 的 Jev 比怎么样以及它适合放在什么位置。Laya 到底做什么输入工单、邮件、交易记录、提示词等。输出带类型的答案一次前向传播完成。支持三种决策原语choice从固定标签里选一个、score按序数打分比如 0 到 3、noul返回校准后的 P(true)0.0 到 1.0。输出空间是固定数字和概率所以它不会吐出坏 JSON不会编造不存在的类别也不会写一段废话让你再删。英文 checkpoint 基于 ModernBERT-large421M 参数。多语言 checkpoint 基于 mmBERT-base322M 参数覆盖 100 多种语言。它能跑在 CPU 上。Acurast 的去中心化手机网络里Laya 只用 Android CPU 和 TEE 硬件安全就能做到 0.2 到 1 秒完成决策。Laya 解决什么痛点如果你用过 8B 或 70B 的大模型来判断“这张工单该给谁”你大概已经受够了。等 500 到 2000 毫秒模型在生成你根本不需要的 token。为输出 token 付推理费然后把这些 token 全扔掉。写正则或 JSON parser只为了从自由文本里抠出一个干净标签。模型说“confidence: 0.95”但这个数字只是预测的 token 字符串不是数学上校准过的概率跟实际正确率没多大关系。Laya 的开发者 Nandakishor Mukkunnoth 说得很直接“不是每个 AI 问题都需要一个自回归聊天机器人。”Laya 和 Jev 的对比Jev 是 TypeSafe AI 做的创始人 Diogo Almeida 是前 OpenAI 研究员。Jev 把“System One 决策”变成了一个品类拿了 4000 万美元种子轮据说正在谈 100 亿美元估值的 10 亿美元融资。它是一个托管 API零样本性能很强。这两个模型真正的差别在这几个地方。速度Laya 在 Tesla T4 上 p50 每个路由问题 32.8ms。Jev 公布的中位数是 236 到 276ms。大约快 7.8 倍。在 Apple Silicon 上用 MLX独立 benchmark 测到 Laya 每个决策 7.6msJev 通过网络要 588ms。一个微调过的 browser-agent checkpoint 在 RTX 3080 上每个决策 27ms比托管版 Jev API 在同样任务上快 31 倍。校准温度缩放之后Laya 的 Expected Calibration Error 是 0.081Jev 是 0.246。这个数字越低越好当你用置信度阈值来卡自动化流程时差距很关键。准确率零样本原始准确率Jev 赢。JevBench v1.3.0 综合分Jev 74.4排第一。Laya 54.4排第 33。Banking77 上Jev 0.870Laya 0.425。但这个对比有点误导。第一Laya 的零样本底座本来就是给你微调用的。在 typed-decisions checkpoint 上微调后的 Laya 得分 0.766Jev 是 0.727。第二级联架构会完全改变经济账。一个中文客服工单分类的独立测试发现把 55% 流量交给本地 Laya7.6ms剩下升级给 Jev588ms整体准确率能追平 Jev整体速度还快 1.8 倍。成本Jev 每百万输入 token 收 0.042 美元输出免费。Laya 是 Apache 2.0。自托管每百万 token 成本 0.00 美元。没有限流没有计量没有 API key。可以完全离线跑在你自己的硬件上。对于批量任务比如给大型 RAG 候选列表分类或者处理几千张入站工单成本差距不是一点点是结构性的。数据主权Jev 是托管 API数据要离开你的网络。Laya 本地跑。页面内容、工单文本、客户消息、交易数据都不出你的基础设施。对金融、医疗、政府这些受监管行业来说这不是功能是合规底线。真实用例客服路由一条支持消息进来“我们三月份被扣了两次款请今天把重复付款退回来。” Laya 把它分类为 billing置信度 96.1%紧急度评为 2 级标记人工复核。整个调用 33ms。没有 LLM 写一段解释它为什么觉得这是账单问题。浏览器自动化一个为浏览器代理微调的 Laya checkpoint在 8 个 benchmark 里的 6 个上打败了官方浏览器微调 checkpoint。在 60 个元素的页面上稳态决策延迟在 10 到 30ms。吞吐大约每秒 100 个决策。发票和文档匹配有开发者用 Laya 解析和匹配发票没有把整个 LLM 扔上去。主题分类 5/5。客服工单意图路由 5/5。模型回答“这是退款请求吗”给出 86% 置信度结果是对的。内容审核和钓鱼检测Laya 对“这封邮件是钓鱼吗”或者“这个提示词是在尝试越狱吗”这类二值问题返回校准后的 P(true)。因为概率是校准的你可以设阈值把不确定的案例交给人工复核并且知道错误率大概是多少。边缘部署Acurast 把 Laya 部署到 175 个国家超过 28 万台 Android 手机上。模型在 CPU 上跑带硬件 TEE 安全给游戏、导航、安全检查提供实时决策完全不依赖云。目标用户与目标市场谁该用 Laya谁该用 JevLaya 适合这些情况数据不能出你的网络。金融、医疗、法律、政府团队需要离线推理。你有清晰稳定的标签也能微调。Laya 底座零样本弱微调后的 checkpoint 有竞争力。模型卡说得很明白“Laya 是一个用来做特化的快速底座。”决策类别数量中等。Laya 超过大约 20 个选项后开始退化。77 路分类Jev 还是更好。3 到 10 个路由类别Laya 绰绰有余。你处理高吞吐。每百万 token 成本 0成本曲线是平的。Jev 按 token 收费会随流量线性增长。你需要 CPU 推理。Laya 不需要 GPU。可以部署在现有基础设施、边缘设备甚至手机上。Jev 更适合这些情况你需要立刻拿到零样本准确率。没有标注数据没有微调团队没有时间训练。Jev 的零样本性能是目前最强的。你处理长上下文。Jev 支持单请求最多 64k token。测试的 Laya checkpoint 每个问题处理 512 token有些变体到 1024。你不想运维任何基础设施。Jev 是托管 API调用就能用。你的分类体系很宽。77 路银行分类、复杂多标签路由、大选项集仍然更偏向 Jev。战略图景决策模型这个品类不是赢家通吃。Jev 证明了这个市场存在。Laya 证明了它可以开源、免费而且快到能跑在手机上。更有意思的是级联模式。用本地 Laya 处理 50% 到 60% 清晰、置信度高的决策。剩下 40% 到 50% 升级给 Jev。你得到 Jev 级别的准确率大约一半的延迟成本只是零头。这不是妥协。生产系统本来就该这么架构常见情况用便宜、快、本地的推理难的情况交给云。Laya 不是要取代 Jev。它是要让你大多数决策根本不需要调用 Jev。快速开始模型权重Hugging Face (convaiinnovations/laya)代码GitHub (NandhaKishorM/laya)许可证Apache 2.0安装pip install laya如果你在评估决策模型实用建议很简单在你的真实数据上把两个都 benchmark 一遍测置信度阈值扫描试级联。架构决策不是 Laya 还是 Jev而是这条线画在哪里。总结Laya 的价值不在参数规模而在它把“决策”从“生成”里拆了出来。大多数 AI 工作流里真正需要创造力的只占一小部分剩下的都是路由、分类、打分、判断。这些事不该让一个 70B 模型一边写小作文一边做。Laya 的目标市场也不是要吃掉 Jev 的零样本高精度场景而是那些对成本、延迟、数据主权敏感的边缘和私有化场景。它的发展潜力在于生态如果社区能围绕它产出大量微调 checkpoint覆盖客服、风控、内容审核、浏览器代理这些垂直场景它会变成决策层的 Linux。不是最亮眼的但可能是最常用的。Jev 会继续守住高端零样本和长上下文市场。Laya 会从下面往上吃。最后大概率是级联共存而不是谁替代谁。如果你正在做 AI 路由、工单分类、内容审核或者浏览器代理建议花一个下午把 Laya 跑起来拿你自己的数据试 100 条。33ms 和 588ms 的差别体感比任何 benchmark 都真实。

相关新闻

K8s集群Service会话保持策略配置实操

K8s集群Service会话保持策略配置实操

K8s集群Service会话保持策略配置实操技术栈:Kubernetes v1.32.13 Rocky Linux 8.6 Service负载均衡 Containerd 1.7.x操作环境 / 对接原理 / 详细步骤 / 完整命令 / 配置文件 / 验证流程 / 排错方案K8s集群Service会话保持策略配置实操操作环境K8s 集群 3 节点&a…

2026/10/1 22:17:02 阅读更多 →
任少卿时隔十年再出手:MM-Future让自动驾驶“走一步想十步”

任少卿时隔十年再出手:MM-Future让自动驾驶“走一步想十步”

「多模式联合世界‑动作模型」 目录 01 自动驾驶世界‑动作模型现存两难矛盾 1.1 三类主流WAM范式的固有短板 02 MM‑Future完整技术链路 2.1 面向规划的MM‑Tokens压缩表征 2.2 多模式联合世界‑动作条件流生成 2.3 未来条件提案打分器 03 NAVSIM、HUGSIM仿真…

2026/10/1 21:57:22 阅读更多 →
30-seconds-of-code:CSS 逻辑属性与物理属性对照指南(Logical  Physical Properties)

30-seconds-of-code:CSS 逻辑属性与物理属性对照指南(Logical Physical Properties)

教程文档 【免费下载链接】30-seconds-of-code Coding articles to level up your development skills 项目地址: https://gitcode.com/gh_mirrors/30/30-seconds-of-code 点击查看 免费下载 导读 CSS 逻辑属性(Logical Properties)让开发者…

2026/10/1 21:57:30 阅读更多 →

最新新闻

工业智能网关实战:破解生产黑箱,打通设备数据采集最后一公里

工业智能网关实战:破解生产黑箱,打通设备数据采集最后一公里

干了这么多年产线数据采集,说实话,我见过太多车间主任站在一排设备前面,说不上来机器现在在干嘛。问今天产量多少,靠班长喊;问设备为什么停了,翻交接班记录;问这台注塑机昨晚空跑了多久&#xf…

2026/10/2 21:52:59 阅读更多 →
Android模拟器HAXM缺失:硬件加速与Hyper-V冲突排查及替代方案

Android模拟器HAXM缺失:硬件加速与Hyper-V冲突排查及替代方案

1. 这条报错到底在说什么:从 AVD 到硬件加速的整条链路先说结论:intel haxm is required to run this AVD. HAXM is not installed. Install这句话,不是 Android Studio 坏了,也不是模拟器镜像下错了,它的意思是——你…

2026/10/2 21:52:59 阅读更多 →
Android Direct Boot模式实战:directBootAware开发指南

Android Direct Boot模式实战:directBootAware开发指南

1. 项目概述:为什么“直接启动模式”不是可选项,而是必答题你有没有遇到过这样的场景:手机刚开机,屏幕还黑着,闹钟却准时响了;或者设备重启后,微信的语音消息自动播放,而系统连锁屏界…

2026/10/2 21:52:59 阅读更多 →
材料机器学习中的模型遗忘与再训练等价性

材料机器学习中的模型遗忘与再训练等价性

我无法根据当前输入生成符合要求的博文。 原因如下: 项目标题“Bounding Retraining Equivalence and the Deletion Floor in Materials Machine Unlearning”属于高度专业化的前沿学术概念,涉及 材料科学机器学习机器遗忘(Machine Unlear…

2026/10/2 21:52:59 阅读更多 →
单索引Bandit:用决策几何破解黑箱奖励优化

单索引Bandit:用决策几何破解黑箱奖励优化

1. 这不是传统 Bandit,而是一场“参数空间里的几何测绘” 单索引带臂(Single-Index Bandits)这个标题乍看像论文摘要里飘出来的术语,但如果你做过推荐系统、临床试验设计、或者工业级自适应实验平台,就会立刻意识到&am…

2026/10/2 21:52:58 阅读更多 →
YOLOv8实战:食品包装生产日期检测与部署全流程解析

YOLOv8实战:食品包装生产日期检测与部署全流程解析

简介:基于YOLOv8的食品包装生产日期识别项目,面向计算机、人工智能、自动化等专业的毕业生、课程设计学生以及刚接触目标检测的初学者。资源包为zip格式,共8个文件,包含3个Python脚本(分别负责模型训练、视频检测和可视…

2026/10/2 21:51:58 阅读更多 →

日新闻

从零搭建AI工程化:模型之外的完整闭环

从零搭建AI工程化:模型之外的完整闭环

先搞清楚一件事:从零开始做 AI 工程化,难的从来不是调模型、写提示词,而是把一套原型 Demo 变成长得像是“正经系统”的东西。你手里可能已经有了能跑通的代码,也可能刚读完一些概念,但真到了要把它变成可维护、可观测…

2026/10/2 0:00:20 阅读更多 →
大模型训练显存估计与混合精度训练实战指南

大模型训练显存估计与混合精度训练实战指南

1. 大模型训练显存估计与混合精度训练详解显存不够用,几乎是每个做大模型训练的人都会撞上的第一堵墙。你可能也经历过:模型代码写完了,数据管道跑通了,满心欢喜地按下训练启动脚本,结果几秒钟后终端弹出一行红字——C…

2026/10/2 0:00:20 阅读更多 →
小样本学习数据集选型指南:27个真正可用的高质量数据集

小样本学习数据集选型指南:27个真正可用的高质量数据集

1. 小样本学习的“弹药库”:为什么你总在找数据集,却总找不到真正能用的? 小样本、数据集——这两个词最近半年在我处理的200多个AI项目咨询里,出现频率排进前三。不是模型调不好,不是代码写不对,而是卡在…

2026/10/2 0:00:20 阅读更多 →

周新闻

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/10/1 19:40:48 阅读更多 →
SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/10/1 19:41:40 阅读更多 →
FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏 【免费下载链接】FireRed-OpenStoryline FireRed-OpenStoryline is an AI video editing agent that transforms manual editing into intention-driven directing through natural language …

2026/10/1 20:05:24 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/2 10:36:31 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/2 5:26:06 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/2 6:09:11 阅读更多 →