AI 前沿 2026 年 10 月 11 日

2026-10-11 — Cloudflare Clef-omni 支援音訊與影片,Clef-flash 降價

primary=https://blog.cloudflare.com/clef-faster-cheaper-multimodal/ primary=https://developers.cloudflare.com/workers-ai/models/clef-omni primary=https://github.com/sgl-project/sglang/pull/42721

Cloudflare Clef-omni 支援音訊與影片,Clef-flash 降價

Cloudflare Blog · 2026-10-09

Cloudflare 的 Clef 決策模型原本只吃文字、圖片與影片影格陣列,現在新增的 clef-omni 讓一次 API 呼叫就能同時處理音訊、帶同步影格的影片、圖片與文字。同一天,既有的 Clef 換了推論後端而變快,Clef-flash 則大幅降價。

Clef-omni 建立在 Qwen3-Omni-30B-A3B-Instruct(MoE 架構,移除了語音輸出元件)之上,文件列出輸入價 $0.15 / 百萬 token,輸出 token 不收費。

原本的問題

要判斷「這段安裝錄影裡風扇有沒有在轉」這類問題,過去得先用語音轉文字或影片轉描述的前處理,再把文字丟給分類模型。每多一段管線就多一份延遲與誤差,原始的聲音與畫面資訊也在轉換中遺失。

Clef 系列本身不產生文字,而是對整個 payload 做一次 prefill,直接替每個選項評分。Clef-omni 沿用這個設計,所以它不轉錄、不寫說明,只回答你定義的問題。

核心改動

請求以 questions 這個 map 傳入多個具名問題,媒體以 base64 data URI 放進 images、audio、videos。官方範例用同一支影片問了標籤是否可見、有無異常聲音、風扇是否運轉三題。

POST /client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/cloudflare/clef-omni
{ "model": "clef-omni",
  "state": "...",
  "videos": ["data:video/mp4;base64,..."],
  "questions": { "fan_running": { "type": "noul", "instructions": "..." } } }

文件列出的限制要先看:最多 4 張圖(各 4 MiB)、4 段音訊(各 300 秒)、2 支影片(各 60 秒,每秒取樣 2 影格),不接受遠端 URL,只能內嵌 base64。context 為 64,000 token,媒體與問題都算進去,超過就整個請求失敗,只有 state 文字會被截斷。

  • 音訊約 780 token / 分鐘
  • 圖片每 32x32 區塊 1 token,另加 3 個標記 token,單張上限 1,024
  • 480p 影片約 8,600 影格 token / 分鐘,有聲音再加約 780 / 分鐘

延遲方面,官方給的中位數是純文字約 130 ms、圖片約 150 ms、21 秒含聲音的影片約 1.5 秒。

Clef 與 Clef-flash 的變動

Clef 沒有釋出新權重,提速來自改用 SGLang 服務;Clef 支援的 PR 是 #42721,隨 SGLang 0.5.22 發布。

輸入大小之前 中位 / p95 (ms)現在 中位 / p95 (ms)中位加速
約 800 token262 / 438152 / 3511.7×
約 3,400 token616 / 777305 / 5312.0×
約 16,000 token2,721 / 3,2501,635 / 1,8051.7×

Clef-flash 的價格從 $0.09 降到 $0.038 / 百萬 token,但託管版 context 從 64k 縮到 24k。官方說只有 0.24% 的請求超過 24k;Hugging Face 上的權重仍是 256k 訓練。

Clef-flash  價格  $0.09 -> $0.038 / M input tokens
Clef-flash  context(託管)  64k -> 24k

影響範圍

已經在 Workers AI 用 Clef-flash 的人,成本會自動下降,但輸入超過 24k token 的請求會開始出問題。長文件分類、長對話摘要的流程要檢查輸入長度,需要的話改指向 Clef(64k,$0.24 / 百萬 token)。

用 Clef 的人不用改程式就能拿到延遲改善。官方也說 Clef 與 Jev API 相容,並可透過 AI Gateway 呼叫,換模型 ID 即可。

要不要換成 Clef-omni 要看任務類型。以官方表格為例,BANKING77 的 macro-F1,Clef-omni 為 94.8、Clef-flash 為 90.93;CLINC150+OOS 則是 97.7 對 66.77。但 When2Call 準確率 Clef-omni 只有 63.3,低於 Clef 的 72.37 與 Jev 的 80.97。純文字任務未必值得換,需要音訊或影片判讀的流程才是主要對象,例如客服錄音或設備安裝影片的檢核。

這些分數都是 Cloudflare 自家公布,release notes 未說明第三方重現;TypeSafe 的 Jev 是對照基準,文章未給其價格。

原始來源:Cloudflare Blog、Workers AI 文件、SGLang PR #42721


End of article
0
Would love your thoughts, please comment.x
()
x