AI 前沿 2026 年 10 月 9 日

2026-10-09 — Google 開源 ML Drift,取代 TFLite GPU delegate

primary=https://developers.googleblog.com/en/ml-drift-next-gen-gpu-aiml-inference-at-the-edge/ primary=https://github.com/google-ai-edge/ml-drift primary=https://developers.google.com/edge/litert/next/gpu

Google 開源 ML Drift,取代 TFLite GPU delegate

Google Developers Blog · 2026-10-08

Google 把端側 GPU 推論的核心換成新的開源引擎 ML Drift(Apache 2.0),原本的 TensorFlow Lite GPU delegate「將不再接收新功能更新」。ML Drift 同時是 LiteRT 的 GPU 加速器,也能單獨當成函式庫使用,後端涵蓋 OpenGL ES、OpenCL、Metal 與 WebGPU。

原本的問題

舊的 TFLite GPU delegate 把張量固定在 4D,5D 模型(3D 卷積、時空模型)得靠 layout 變通才能跑。它還要為 OpenGL、OpenCL、Metal 各自維護邏輯張量到實體張量的對應,每多一個後端,shader 就要多寫一份。

LLM 與擴散模型的出現又讓這個設計吃緊:prefill 與 decode 的瓶頸不同,舊 delegate 沒有針對兩階段切換 kernel 的空間。

核心改動

張量虛擬化:把張量的邏輯表示與 GPU 上的實體配置拆開。動態 shader 樣板在編譯器初始化時解析座標,形成統一的 shader 模型,官方稱執行期額外負擔「極小」。因此同一套 shader 邏輯不必為每個後端重寫。

LLM 分階段最佳化:compute-bound 的 prefill 與 memory-bandwidth-bound 的 decode,會切換不同的 kernel 與 layout。decode 階段使用與卷積對齊的 KV cache layout,並在 kernel 內做 activation 量化。

另外有兩項:開箱即用的 5D 張量支援,以及可擴充的 custom op 框架,能直接註冊並存取底層著色語言。官方還附了一份給 coding agent 用的 SKILL.md,教它撰寫、註冊與驗證自訂 shader。

啟用方式與平台

在 LiteRT 的 GPU 文件頁中,Android 加上 litert-gpu 套件,建立 CompiledModel 時指定 GPU 即可:

implementation 'com.google.ai.edge.litert:litert:2.3.0'
implementation 'com.google.ai.edge.litert:litert-gpu:2.3.0'

val model = CompiledModel.create(
  context.assets, "mymodel.tflite",
  CompiledModel.Options(Accelerator.GPU), env)
平台GPU 後端(LiteRT 文件)
AndroidOpenCL + OpenGL
LinuxWebGPU(Vulkan)
macOSMetal
WindowsWebGPU(Direct3D)

Windows 需另外安裝 DirectXShaderCompiler,並把 dxil.dll 與 dxcompiler.dll 放到執行檔旁。文件也提到部分模型只會被部分委派給 GPU,效能會受影響。

官方公布的數字

  • YouTube Shorts:分割類特效的平均每幀延遲最多降低 40%。
  • Google Photos:相對舊 GPU delegate 最多快 2 秒(Unblur 等流程)。
  • Adobe Lightroom 與 Photoshop:最多快 30%。
  • Snap:臉部與風格生成 lens 的模型延遲改善 30%。
  • Gemma:記憶體開銷比其他框架最多低 12%。

LLM 吞吐量只以圖表呈現,部落格文字沒有給數值,測試裝置也未在內文列名。這批數字全是 Google 與合作夥伴自報,尚無第三方重現。

影響範圍

還在用 TFLite GPU delegate 的 Android 與 iOS 應用要規劃遷移:舊 delegate 不再有新功能,官方說 LiteRT ML Drift GPU accelerator 與既有模型完全向後相容,所以多半是改初始化程式碼,而非重新轉換模型。Android 的獨立(unbundled)執行階段目前可透過獨立 LiteRT 套件取得,Google Play Services 版「即將推出」。

有 5D 模型或自訂運算元的團隊可以拿掉原本的 layout 變通,並改用 custom op 框架。想在瀏覽器或桌面跑端側模型的人可走 WebGPU,原生環境透過 Dawn 支援 Windows 與 Linux;Chrome 的 Gemini Nano 內建 AI API 已在使用。

硬體面,Arm 針對 Mali 與 Immortalis、Qualcomm 針對 Adreno、Intel 針對 Xe3 顯示卡的 Core Ultra 做了協同最佳化。程式庫以 Bazel 建置,README 稱其為 TFLite GPU delegate 的繼任者,並宣稱相對既有開源 GPU 推論引擎有「數量級」的效能提升;這項主張同樣缺少公開基準細節。

原始來源:Google Developers Blog、ml-drift 儲存庫、LiteRT GPU 文件


End of article
0
Would love your thoughts, please comment.x
()
x