摘要:Cloudflare发布开源决策模型Clef-omni,原生支持文本、图像、音频与视频输入,纯文本响应中位约130毫秒,权重已上架Hugging Face,为开发者搭建自动化决策工作流降本增效。

Cloudflare 近日正式放出全新开放权重决策模型 Clef-omni。作为 Clef 系列的迭代版本,它不仅延续了文本与图像的原生支持,还首次打通了音频和完整视频的直接输入通道,模型权重现已在 Hugging Face 上全面开放下载。

与上一代相比,最大的变化在于处理链路的简化。旧版 Clef 处理视频时,需要先把视频沿时间轴切成一帧帧静态图片再逐段分析;而 Clef-omni 直接"吃"下 wav、mp3、mp4、webm 等主流格式,开发者不必再单独搭建语音转写或视频拆帧管线,一次 API 调用就能完成四种模态的统一处理。

底座方面,Clef-omni 基于 Qwen3-Omni-30B-A3B-Instruct 架构构建,完整继承了其理解能力。作为一款专注结构化决策的专用模型,它不产出冗长文本,响应速度相当亮眼:官方实测数据显示,纯文本请求中位响应约 130 毫秒,图像请求约 150 毫秒,就连一段 21 秒、带声音的视频,也能在约 1.5 秒内完成评分。

伴随新模型发布,Cloudflare 同步调整了产品线价格:Clef-flash 输入价格下调约 58%,从每百万输入 Token 0.09 美元降到 0.038 美元,托管版上下文窗口由 64k 调整为 24k。

多模态能力的补齐加上开源策略,意味着开发者在构建智能工作流和自动化决策系统时,又多了一个高性价比的底层选项。