AI 前沿 2026 年 9 月 24 日

2026-09-24 — Qwen3.8-Omni原生多模態架構砍音訊代理成本98%

primary=https://arxiv.org/abs/2609.25611

Qwen3.8-Omni原生多模態架構砍音訊代理成本98%

arXiv cs.CL · 2026-09-23

背景:外掛式編碼器撐不起即時多模態代理

多模態代理過去多半靠「文字模型+事後外掛的語音與影像編碼器」拼接而成。Qwen 團隊在論文中指出,這種做法讓串流音訊與影片難以進入主模型的上下文窗口,多數代理框架(harness)也不支援即時串流輸入。長影片的儲存與傳輸成本偏高,加上代理執行長任務時需要龐大的 token 預算,讓長時間多模態工作在代理流程中變得昂貴。Qwen3.8-Omni 把重點放在「原生」而非「外掛」,同時處理模態間延遲與工具排程效率兩個問題。

論文也提到,過去把語音、影像、文字能力硬塞進同一顆模型,容易出現跨模態干擾,不同模態與任務的訓練訊號會互相打架,導致單一模態表現被拖累。這次改用多教師蒸餾的訓練方式,目的就是把各模態的專才能力整合進同一顆模型,同時降低干擾。

核心改動:MoE 骨幹、雙音訊編碼器與百萬 token 上下文

Qwen3.8-Omni-Flash 沿用 Qwen3.8-Next 的稀疏混合專家(MoE)骨幹,把 Gated DeltaNet(GDN)與採用 Qwen Sparse Attention(QSA)的交錯注意力層結合在一起。模型原生支援 1M token 上下文,預訓練階段的原生窗口為 256K,後訓練再擴展到 1M。音訊端拆成兩顆編碼器:General AuT 以 6.25 Hz 產生音訊 token,Spatial AuT 則處理一階環境立體聲格式的多聲道音訊,藉此保留聲音的方向資訊。

預訓練資料量約 2.5 兆 token,其中文字 1.1T、音訊 0.7T、影像 0.35T、影片 0.15T、影音混合 0.3T。相較於前代 Qwen3.5-Omni-Plus,新模型在多項基準上都有大幅度提升:

  • OmniVideoBench(音視覺推理):53.8 → 63.4
  • Video-MME-v2:47.9 → 65.0
  • AgenticVBench(代理任務):14.5 → 36.8
  • OmniGAIA:57.2 → 74.0
  • 多語者 ASR(AliMeeting Test):DER 從 88.1 降到 3.4,cpWER 從 89.6 降到 17.2

即時互動效能方面,論文列出文字輸出速度為每秒 81 至 85 個 token,語音首字延遲(TTFC)約 1.0 秒(純音訊)或 1.3 秒(音視訊),語音生成即時率約 0.153,等於約 6.5 倍實時速度。音訊與音視訊代理的 API 輸入成本分別下降超過 98% 與 93%。

論文列出的產品化能力都圍繞「長影片+即時互動」這個主軸,不是單純的問答式多模態,而是能接手實際剪輯與整理工作:

  • 影片剪輯(video editing)
  • 長篇音訊/影片翻譯
  • 音樂條件式媒體生成(music-conditioned media generation)
  • 從影片自動產生筆記(Omni-Video2Note)
項目Qwen3.5-Omni-Plus(舊)Qwen3.8-Omni-Flash(新)
整體架構外掛式多模態編碼器原生多模態 MoE(Qwen3.8-Next + GDN + QSA)
上下文長度論文未公布1M token(預訓練 256K)
音訊處理路徑單一編碼器雙編碼器(General AuT + Spatial AuT,含方向資訊)
OmniVideoBench53.863.4
AgenticVBench14.536.8
音訊 API 成本基準降低超過 98%

影響範圍:誰該接 Qwen-MM-Plugins 與 Qwen-Live-Harness

對正在用 Qwen 系列打造代理系統的開發者來說,這次一併釋出了兩個開源框架。Qwen-MM-Plugins 是輕量插件框架,內建 Omni-Caption、Omni-Video2Note、Omni-Memory、Omni-Skill-Creator、Omni-Chatcut 等生產力應用,補上既有代理系統對音訊與影片支援不足的缺口。Qwen-Live-Harness 則專門用來搭建即時回應的多模態代理,兩者原始碼都在 GitHub 的 QwenLM 帳號下。

如果團隊的代理系統需要處理長影片摘要、即時語音互動或多聲道音訊定位,換上原生多模態骨幹可以直接省下串接多個外部編碼器的維護成本。若只做純文字或簡單影像問答,論文附的文字基準(如 SWE-bench Pro 63.3 對 62.5、LiveCodeBench v6 92.6 對 91.9)顯示提升幅度不大,可以先觀察社群對兩個框架的實際回饋再決定是否遷移。

原始來源:arXiv:2609.25611 — Qwen3.8-Omni: Towards Native Omni-Modal Agents


End of article
0
Would love your thoughts, please comment.x
()
x