发生了什么:Clef-omni 把决策模型推向多模态
10 月 9 日,Cloudflare 在官方博客发布 Clef-omni,这是其开放权重「决策模型」家族 Clef 的新成员:在文本与图片之外,新增音频(wav 或 mp3)与视频(mp4 或 webm)输入,一次 API 调用可同时传入多类素材,返回带置信度的结构化判定。模型权重在 Hugging Face 开放,接口与 Jev 兼容,可经 AI Gateway 直接调用。
决策模型是介于分类器与大语言模型之间的一类模型:不生成文本,只输出限定在预设选项内的结构化判断,用于智能体工作流里的路由、分类与放行动作。Cloudflare 称 Clef-omni 基于 Qwen3-Omni 的混合专家底座构建,并去掉了语音合成输出组件,以换取更快的响应:官方给出的数据是纯文本决策中位延迟约 130 毫秒,图片约 150 毫秒,一段 21 秒带声音的视频约 1.5 秒完成评分。
降价与上下文窗口收缩同时发生
同一天,Clef-flash 的输入价格从每百万 token 0.09 美元降到 0.038 美元,Clef 维持 0.24 美元,Clef-omni 以 0.15 美元首发。代价是托管版 Clef-flash 的上下文窗口从 64k 缩到 24k。Cloudflare 的解释是其用量数据显示仅 0.24% 的请求超过 24k,更大上下文需求建议改用 Clef;Hugging Face 上的权重按 256k 上下文训练,自托管可保留。托管版 Clef 本体也提速:换用 SGLang 推理后,约 3,400 token 输入的中位响应从 616 毫秒降到 305 毫秒,模型权重本身没有改动。
对企业官网与 AI 接入方意味着什么
其一,智能体做决策的输入面正在从文本扩展到图片、音频、视频。企业官网的内容形态——产品图、演示视频、语音素材——可以被直接送进决策环节,而不必先转写或加字幕为文本。其二,价格与上下文窗口成为一道显性权衡:24k 窗口意味着长文档、长历史场景要切到更贵的模型,接入方应按自己的请求长度分布重新核算成本,而不是照搬宣传价。
注意:上述延迟、基准与用量数据均出自 Cloudflare 官方评测与自家使用数据,只适用于其托管环境;开放权重虽以 Apache 2.0 发布,自托管的性能与成本需自行验证。
Cloudflare 还披露了内部用法:文档仓库用它识别并关闭垃圾 issue,内容管理系统 EmDash 用它审核插件库钓鱼,数据防泄漏团队用它扫描证件类个人信息,威胁情报团队用它辅助识别恶意域名。这些场景的共同点是量大、单价敏感、要求输出稳定——这也是决策模型与企业现有 LLM 调用分工的一个参照。
来源与适用范围
本文适用于:在智能体工作流中评估或使用决策模型(分类、路由、判定类调用)的企业技术团队,以及关注 AI 基础设施定价与能力边界的官网运营负责人。文中全部数字(价格、延迟、上下文窗口、用量占比、基准表现)均为 Cloudflare 官方在博客中给出的口径,反映的是其托管环境(Workers AI)与其自家请求数据,不构成第三方复测结果,也不代表自托管部署的性能。Clef-omni 的基准分数由 Cloudflare 自行运行,与竞品(Jev 等)的对比存在厂商自评偏差,选型时应以自有工作负载实测为准。本文不适用于:讨论该模型对搜索排名、AI 引用或网站流量的影响(官方未给出任何此类数据);亦不构成对任何模型的采购建议。开源权重的商用许可细节以 Hugging Face 仓库实际许可证文本为准。
- Introducing Clef-omni with full multimodality, plus a faster Clef and a cheaper Clef-flashCloudflare Blog · 原始日期 2026.10.09 · 读取核对 2026.10.10
- Introducing Clef: our open-source decision models, and new RL fine-tuning platformCloudflare Blog · 原始日期 2026.10.01 · 读取核对 2026.10.10
不知道先看哪一步?
和真人顾问聊清楚。
告诉我们你的品牌和客户问题,一起确认采样范围与下一步。