互联网

Cloudflare 把决策模型做成多模态:Clef-omni 上线,Clef-flash 输入价降到每百万 token 0.038 美元

来源:Cloudflare Blog    作者:Cloudflare Blog      2026年10月10日 18:09

导语:Cloudflare 在官方博客发布 Clef-omni,把自家的开放权重决策模型家族扩展到音频与视频输入。

摘要

Cloudflare 在官方博客发布 Clef-omni,把自家的开放权重决策模型家族扩展到音频与视频输入。此前 Clef 系列只吃文本、图像和从视频里抽出的连续画面;Clef-omni 直接接收音频(wav、mp3)与完整视频(mp4、webm),一次 API 调用就能对文本、图像、音频、视频做带校准的、受 schema 约束的判断,开发者不必再自己搭语音转写和音视频拆分的级联流水线。模型基于 Qwen3-Omni-30B-A3B-Instruct 的混合专家骨干,去掉语音输出组件,冻结主干后训练低秩适配器(LoRA),用带标签平滑的交叉熵加 Brier 分数校准做后训练;因为不生成文本、跳过输出 token 生成,延迟做到文本约 130 毫秒、图像约 150 毫秒、音频几百毫秒,21 秒带声视频约 1.5 秒。定价上,Clef-flash 输入价从每百万 token 0.09 美元降到 0.038 美元,代价是托管版上下文窗口从 64k 缩到 24k——Cloudflare 给出的理由是用量数据里只有 0.24% 的请求超过 24k,Hugging Face 上的权重未动、仍支持 256k;Clef-omni 定价每百万输入 token 0.15 美元,Clef 维持 0.24 美元。同时 Clef 换到 SGLang 服务后中位延迟快了 1.7 到 2.0 倍。这条的意义在于:结构化判断这类高频、低价值的调用,正在被从通用大模型里剥离出来,单独定价。

正文(译文)

推出 Clef-omni:完整多模态,外加更快的 Clef 和更便宜的 Clef-flash

上周我们发布了 Clef 和 Clef-flash——Cloudflare 的开放权重决策模型。既然开了头,我们决定再多送几件礼物。今天发布的 Clef-omni,在文本和图像之外,还能接收音频和视频输入。我们还把 Clef-flash 的价格降到了比 Jev 更低,并让 Clef 变得更快。

对 Cloudflare 来说模型这场仗才刚开打,但创新和快速迭代写在我们的基因里,我们做每件事都按这个来。Clef 的故事其实只用了不到一周:某个周五傍晚我们决定要在决策模型这个方向做点什么,周末把模型训出来,周四就上线了。哪怕时间线这么短,我们仍然给社区交付了性能过关、质量在线的开放权重模型——往后能做的只会更多。

Clef-omni 能吃音频、视频、图像和文本

新的 Clef-omni 可以接收音频、视频、图像和文本输入。这改变了决策模型的范式——自 TypeSafe 的 Jev 出现以来,这类模型基本只能处理文本。Clef 支持图像和视频帧数组,而 Clef-omni 能在文本和图像之外,直接吃音频(wav 或 mp3)和视频(mp4 或 webm)。你不必再搭一串模型把语音转成文字、或者把视频的音轨和画面拆开,只要调一个模型,就能跨任意模态做判断。

我们在 Hugging Face 上同步放出了模型开放权重。快速上手的话,往 Clef-omni 传新模态是这样写的:

微信图片_20261010180827.png

Clef-omni 把我们这套开放权重决策架构扩展到了原生处理多模态工作流。它建立在 Qwen3-Omni-30B-A3B-Instruct 这个混合专家基础模型上——这个基础模型本身就能在同一条流水线里直接处理文本、图像、音频和视频,我们保留了它的主要理解骨干,去掉了文本转语音的输出组件。

在生产环境里,Clef-omni 会对完整载荷做一次快速的 prefill,同时给所有模态和所有合法参数选项打分。因为 Clef 系列不是大语言模型、不生成输出 token,我们省掉了转写或配字幕的开销。媒体元素直接映射进统一序列,视频和音频与视觉帧对齐后联合处理。随后 Clef-omni 用我们的两阶段注意力路由,直接从内部嵌入里抽取候选值:每个合法选项先从输入中收集关键证据(不管它埋在文本片段、视觉元素还是音频流里),再让字段向量跨完整上下文做交叉注意力,算出置信度分数。我们还内置了一套词法语法来保留选项语义,从而在每种输入类型上都做到快速、受 schema 约束的打分。

我们用和 Clef 相同的手法训练这个模型:冻结 Qwen 主干、训练低秩适配器(LoRA),并套用标准后训练流程——带标签平滑的交叉熵损失配合 Brier 分数校准。结果是这个模型足够稳健,不受 schema 变化、字段顺序和提示结构的影响。

基准测试

微信图片_20261010180915.png

价格:更便宜的 Clef-flash

定价随时可能调整,最及时的信息请看开发者文档,其中也详细说明了图像和音频模态如何折算成输入 token 计费。

  • Clef-flash:原本每百万输入 token 0.09 美元,现在 0.038 美元

  • Clef:维持每百万输入 token 0.24 美元

  • Clef-omni:今天上线,每百万输入 token 0.15 美元

不过,为了拿到这个更低的 price,有一个取舍:我们砍掉了 Clef-flash 的上下文窗口。托管版 Clef-flash 的上下文窗口现在是 24k,而不是此前宣传的 64k。Hugging Face 上的模型权重没有动,训练时就支持 256k 上下文,你想自己部署的话仍然可以用满。从我们的用量数据看,只有 0.24% 的请求输入 token 超过 24k。基于这个数据,我们决定把 Clef-flash 的窗口降到 24k,换一个更好入手的价格档。Clef 仍是 64k 上下文,需要更长上下文的同学请改用它。

Clef 现在更快了

微信图片_20261010180854.png

其中一项优化是把模型服务换到了 SGLang。我们和 SGLang 团队合作提了合并请求,把 Clef 接了进去(PR #42721),会随 SGLang 0.5.22 发布。因为权重是公开的,你也可以自己部署 Clef,新的 SGLang 启动命令在我们更新过的 Hugging Face 仓库和 SGLang cookbook 里都有。

大家在怎么用 Clef

在 Cloudflare 内部,已经有团队在拿 Clef 做实验……这是我们的第一批模型,我们还会继续带来更多。欢迎试用 Clef 系列,把想法告诉我们。

(文章为作者独立观点,不代表艾瑞网立场)
  • 合作伙伴

  • 官方微信
    官方微信

    新浪微博
    邮件订阅
    第一时间获取最新行业数据、研究成果、产业报告、活动峰会等信息。
     关于艾瑞| 业务体系| 加入艾瑞| 服务声明| 信息反馈| 联系我们| 合作伙伴| 友情链接

Copyright© 沪公网安备 31010402000581号沪ICP备15021772号-10

扫一扫,或长按识别二维码

关注艾瑞网官方微信公众号