Cloudflare 发布 9B 多模态决策模型 Clef-Flash 完整解析单次前向传播从状态到决策零文本生成零输出解析【免费下载链接】clef-flash项目地址: https://ai.gitcode.com/hf_mirrors/Cloudflare/clef-flashClef-Flash 是 Cloudflare 开源的 9B 多模态决策模型它把当前状态文本、JSON、图片或视频与一组带类型的结构化问题一起读入在单次前向传播中为每个问题的所有允许选项直接输出概率——没有自由文本生成也没有输出解析环节中位延迟低至 38.8 毫秒 ⚡ 一、Clef-Flash 是什么把判断从生成中剥离传统做法是让大语言模型生成一段 JSON 答案再用解析器读取。这个过程有两个天然痛点生成要逐 token 等待——哪怕答案只有几个词也要自回归解码完解析可能失败——模型写错格式、多输出一个字整条结果就废了。Clef-Flash 从架构层面绕开了这两个问题它不做任何文本生成模型输出的是每个问题的选项 logit对每个问题做一遍 softmax 就得到概率分布。响应体里output_tokens恒为0这不只是数字游戏而是架构决定的事实。关键属性说明参数规模9B总计 9,409,813,744 参数约 18.8GB bf16 权重基座模型Qwen3.5-9B含视觉编码器后训练输入状态文本 / JSON / 图片 / 视频 结构化问题输出每个问题一个概率分布无任何文本生成API 兼容Jev / SystemOnePOST /v1/systemone许可证Apache-2.0项目入口文档见 README.md模型元信息在 config.json 中声明。 二、输入长什么样状态 三类问题一条记录record由两部分组成state任意字符串或 JSON描述待决策的情形questions问题 ID 到问题的映射支持三种类型。三类问题覆盖了绝大多数系统决策场景类型含义返回内容noul真/假判断true 的概率choice命名多选选中项choice、置信度confidence、全选项probabilitiesscore有序评分期望分score、置信度、量规legend、各档概率一个典型的输入长这样JSON 格式来自 README.md{ state: {invoice: {vendor: Acme, total: 1250.0, currency: USD, status: overdue}}, questions: { status: { type: choice, instructions: What is the invoice status?, criteria: {paid: Invoice is paid., overdue: Invoice is past due., draft: Not sent.} }, large: {type: noul, instructions: Is the total above 1000 USD?} } }所有问题会被联合决策jointly decided模型一次性读取完整状态与完整问题集各问题的答案共享同一份证据理解而不是逐题孤立判断。 三、模型内部9B 主干 轻量联合模式头Clef-Flash 由两部分组成权重分别存放主干Backbone即 Qwen3.5-9B 语言模型加视觉编码器以标准分片 safetensors 保存model-00001-of-00004.safetensors model-00004-of-00004.safetensors权重映射见 model.safetensors.index.json32 层、隐藏维度 4096、词表 248,320、最大位置 262,144256K 上下文采用线性注意力与全注意力混合排布每 4 层中 1 层全注意力兼顾长序列效率视觉编码器 27 层16×16 图像块、时间块为 2支持图片与视频帧输入联合模式头Joint Schema Head这是一个小而精的 Transformer 头权重在 joint_head.safetensors结构超参在 joint_head_config.json宽度 1024、16 头、2 层证据路由 4 层联合评分、前馈 4096。它的工作原理可以概括为三步实现见 joint_schema_model.py#L281-L459读证据主干一次前向得到整条序列的隐藏状态模式头把每个问题的描述位置和每个选项的描述位置分别池化成向量路由2 层交叉注意力EvidenceRoutingLayer见 joint_schema_model.py#L242-L278让各选项向量主动从整段状态中检索、聚合与它相关的证据打分4 层评分网络对所有问题、所有选项联合打分融合词嵌入语义相似度先验与联合证据相似度 残差打分器两路信号带可学习门控最终每个选项得到一个 logit。也就是说一次前向传播 主干理解一遍 模式头给全部问题全部选项打分没有解码循环。文件作用joint_schema_model.py记录编码、批处理、模型本体与systemoneAPIjoint_head.safetensors联合模式头权重joint_head_config.json模式头结构超参tokenizer_config.json、processor_config.json分词器与图片/视频处理器配置chat_template.jinja对话模板LICENSEApache-2.0 许可 四、快速上手三步拿到第一个决策官方测试环境为torch2.11 transformers5.10.2单张 H200 即可运行使用图片/视频输入还需pillow。from huggingface_hub import snapshot_download path snapshot_download(Cloudflare/clef-flash) sys.path.insert(0, path) from joint_schema_model import collate_records, encode_record, load_release_model model, processor load_release_model(path, devicecuda) record { state: Our checkout started returning errors and orders are blocked., questions: { outage: {type: noul, instructions: Is a service down?}, }, } encoded encode_record(processor.tokenizer, record, processorprocessor) batch collate_records([encoded], processor.tokenizer.pad_token_id, torch.device(cuda)) logits model(batch)[0] # 每个问题一组 logitsoftmax 即概率几个实用细节SystemOne 直连joint_schema_model.py#L546-L576 的systemone()直接接收 Jev/SystemOne 的/v1/systemone请求体并返回同结构响应包含model、按问题 ID 索引的answers和usage多模态输入在记录里加入imagesPIL 图片或videos帧数组即可且纯文本与多模态记录可混排在同一个 batch长度控制encode_record支持max_length默认 16,384 tokens与max_state_tokens可为状态部分单独限长。 五、基准成绩准确率全面在线延迟是杀手锏在 Cloudflare 内部运行的 Decision Index 0.2.1 套件中Clef-Flash 在 35 项基准上与更大版本的 Clef、竞品 Jev 等正面对比完整数据见 README.md。挑几个代表性项目基准Clef-FlashJev说明BFCL用例精确率98.895.8函数/工具调用API-Bank准确率93.188.2API 决策家电模拟器用例精确率97.752.3模拟器决策WinoGrande准确率97.592.0常识推理HellaSwag准确率98.694.5常识推理MMLU准确率91.891.7通用知识ForecastBenchBrier越低越好10.617.4概率预测质量中位延迟ms38.8524.1越低越好p95 延迟ms122.4536.0越低越好延迟优势直接来自架构单次前向、零解码。38.8ms 的中位延迟意味着它可以放在在线请求链路里做实时分流、分类与判断而不必像生成式方案那样等待数百毫秒。端到端业务工作流Typesafe Evals四个业务场景上Clef-Flash 同样与更大版本 Clef、Jev 处于同一水平线工作流指标Clef-Flash客服精确动作77.0发票处理精确动作57.1安全事件精确动作61.7Agent 轨迹可观测性主动作69.8✅ 六、总结什么场景该选它Clef-Flash 适合系统需要快速、结构化、可审计的判断的场景实时在线决策客服分流、工单分派、安全事件分级、订单/发票处理——毫秒级响应无需等待文本解码生产级可靠性输出天然结构化不存在JSON 解析失败这类故障模式每个答案自带置信度与完整概率分布️多模态开箱即用同一套接口同时吃文本、JSON、图片和视频且可混合批处理标准 API 兼容与 Jev / SystemOne 接口完全兼容迁移成本低。如果你想要更强的综合推理如 GPQA、BBH 等通用基准可以看同系列更大尺寸的 Clef而 Clef-Flash 的定位很明确——用 9B 的体量把从状态到决策这件事做到又快又稳。output_articles/【免费下载链接】clef-flash项目地址: https://ai.gitcode.com/hf_mirrors/Cloudflare/clef-flash创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考