project
Clef - Cloudflare 开源的决策模型家族
Clef 是 Cloudflare 开源的决策模型家族,为上下文定调,再决定后续动作。与生成开放文本的聊天模型不同,Clef 做的是在请求里临时定义问题、为每个选项打出...
Clef是什么
Clef 是 Cloudflare 开源的决策模型家族,为上下文定调,再决定后续动作。与生成开放文本的聊天模型不同,Clef 是在请求里临时定义问题、为每个选项打出概率,让代码据此完成路由或拦截,无需为新增类别反复重训。Clef 家族中,27B 的 Clef 主打精度,9B 的 Clef-flash 快至 38.8 毫秒中位延迟,适合嵌进 Agent 的热路径。
Clef的主要功能
-
概率化决策:输入 state 与类型化问题,输出每个选项的概率,代码可直接据此路由、拦截或升级人工。
-
三种问题类型:支持 noul、choice、score,单次请求最多 64 问。
-
视觉分类:内置 vision encoder,可嵌入最多 4 张图与文本一起打分。
-
64K 上下文:可容纳长日志、工单、JSON 状态等更完整的输入。
-
Jev API 兼容:请求 schema 与 Jev 对齐,迁移时基本只改端点和模型名。
-
非自回归推理:prefill 一次后对合法选项并行打分,不逐 token 生成文本,延迟远低于通用 LLM。
-
边缘托管低延迟:依托 Workers AI 全球 GPU 网络,Clef 中位 209ms、Clef-flash 仅 38.8ms,可进热路径。
Clef的技术原理
- 非自回归决策架构:Clef 先对输入做一次 prefill-only 前向计算,再对请求中定义的合法 schema 选项并行打分,直接从内部表示推导结构化结果。
- 两阶段注意力路由:每个合法选项先从 prompt 中提取与自身相关的上下文,再让各字段参数互相 cross-attend、回连原始 payload 联合建模,配合 lexical prior 保持跨选项的语义一致性,最终把证据汇总为 schema 约束下的分数。
- 冻结底座 + 轻量适配:底座为 Qwen3.8-27B和 Qwen3.5-9B,冻结主干,仅联合优化 routing head 与 rank-256 LoRA 适配器,用很小的可训练参数量获得决策能力,降低了训练和部署成本。
- 校准导向的训练目标:post-training 采用 label-smoothed cross-entropy 保证输出落在合法 schema 内,叠加 Brier loss 专门校准概率,使输出的概率值本身可信。
- RLCD 强化学习:自研 Reinforcement Learning for Calibrated Decisions 作为二级优化目标,对相邻序数选项给部分分、对精确命中给全分、加 reference penalty 防止分布漂移,提升准确率与泛化。
- 数据策略:训练数据为内部合成数据集,通过置换字段顺序、prompt 与 schema 结构来增强泛化,使模型对问题写法不敏感、能适应请求时临时定义的新类别。
微信关注回复“开源”,加入AI开源项目交流群
如何使用Clef
- 确认账号与权限:注册 Cloudflare 账号,拿到 Account ID 和 API Token,开通 Workers AI。
- 选定模型:按需求选
@cf/cloudflare/clef或@cf/cloudflare/clef-flash。 - 构造请求体:写好
model、state(文本/JSON 状态)和questions(1–64 个 noul/choice/score 类型问题,criteria 边界写清)。 - 发起调用:用 REST POST 到
/accounts/{id}/ai/run/@cf/cloudflare/clef,或在 Worker 里通过env.AI.run()绑定调用。 - 解析概率结果:从
response.answers读取各问题的选项概率/加权分,用”最高选项 + 概率阈值”做路由或拦截。 - 接入图片(可选):需要视觉判定时,将 PNG/JPEG/WebP 字节嵌入请求,不要传远程 URL。
- 上线前压测:用自己的 state 长度和问题数实测延迟与准确率,再决定全量切换或按风险分流 flash/clef。
- 进阶微调(可选):领域标签特殊时,经 AI Gateway 沉淀数据,走 FDE 团队的 RL 微调服务定制模型。
Clef的核心优势
-
速度快:非自回归并行打分 + 边缘 GPU 托管,Clef 中位延迟 209ms、Clef-flash 仅 38.8ms,比 Jev 快 2.5×–13×,能进热路径。
-
精度高:在 Jev Decision Index 上排名第一,官方 10 项决策基准中 7 项最高分,Typesafe 工作流评测 4 项赢 3 项。
-
免重训加类别:类别在请求里临时定义,新增标签不用像传统分类器那样重训模型。
-
概率可校准:Brier loss + RLCD 训练让输出概率本身可信,可直接设阈值做自动化决策。
-
原生多模态:内置 vision encoder 可分类图像,而 Jev 目前只做文本。
-
上下文翻倍:64K 上下文(Jev 为 32K),能塞进更长日志和状态。
-
迁移零成本:Jev API 全兼容,换端点和模型名即可平滑替换。
Clef的项目地址
- 项目官网:https://blog.cloudflare.com/clef-decision-models/
- HuggingFace模型库:
- https://huggingface.co/Cloudflare/clef
- https://huggingface.co/Cloudflare/clef-flash
Clef的同类竞品对比
| 维度 | Clef / Clef-flash(Cloudflare) | Jev (Typesafe AI) |
|---|---|---|
| 品类定位 | 决策模型(概率化分类、Jev API 兼容) | 决策模型(品类开创者) |
| 上下文 | 64K | 32K |
| 视觉输入 | 内置 vision encoder(最多 4 张嵌入图) | 目前仅文本 |
| 中位延迟 | 209.3 ms / 38.8 ms | 524.1 ms |
| p95 延迟 | 238.6 ms / 122.4 ms | 536.0 ms |
| Jev Decision Index | 第一 | 参照基线 |
| 质量基准 | 10 项中 7 项最高分 | 多数项落后 |
| Typesafe 工作流评测 | 4 项赢 3 项(发票/客服/安全事件) | Agent 可观测性 1 项略高 |
| 问题定义方式 | 请求内临时定义,免重训加类别 | 同类机制(API 兼容) |
Clef的应用场景
-
客服工单分诊:输入工单内容与截图,一次请求同时判定是否紧急、该路由到哪个团队、严重度评分,低置信度自动升级人工。
-
威胁情报与反钓鱼:配合 Browser Run 抓取渲染网页,对域名/页面做多标签分类,官方实测全流程仅 2.2 秒。
-
Bot 流量判定:在网关热路径用 Clef-flash 快速判断爬虫是善意还是恶意,毫秒级拦截或放行。
-
Agent 工具调用前置审查:Agent 执行高风险操作前先问 Clef”该不该做、用哪个工具”,按概率阈值决定是否执行或请求确认。