Google 開源 ML Drift,取代 TFLite GPU delegate
Google Developers Blog · 2026-10-08
Google 把端側 GPU 推論的核心換成新的開源引擎 ML Drift(Apache 2.0),原本的 TensorFlow Lite GPU delegate「將不再接收新功能更新」。ML Drift 同時是 LiteRT 的 GPU 加速器,也能單獨當成函式庫使用,後端涵蓋 OpenGL ES、OpenCL、Metal 與 WebGPU。
原本的問題
舊的 TFLite GPU delegate 把張量固定在 4D,5D 模型(3D 卷積、時空模型)得靠 layout 變通才能跑。它還要為 OpenGL、OpenCL、Metal 各自維護邏輯張量到實體張量的對應,每多一個後端,shader 就要多寫一份。
LLM 與擴散模型的出現又讓這個設計吃緊:prefill 與 decode 的瓶頸不同,舊 delegate 沒有針對兩階段切換 kernel 的空間。
核心改動
張量虛擬化:把張量的邏輯表示與 GPU 上的實體配置拆開。動態 shader 樣板在編譯器初始化時解析座標,形成統一的 shader 模型,官方稱執行期額外負擔「極小」。因此同一套 shader 邏輯不必為每個後端重寫。
LLM 分階段最佳化:compute-bound 的 prefill 與 memory-bandwidth-bound 的 decode,會切換不同的 kernel 與 layout。decode 階段使用與卷積對齊的 KV cache layout,並在 kernel 內做 activation 量化。
另外有兩項:開箱即用的 5D 張量支援,以及可擴充的 custom op 框架,能直接註冊並存取底層著色語言。官方還附了一份給 coding agent 用的 SKILL.md,教它撰寫、註冊與驗證自訂 shader。
啟用方式與平台
在 LiteRT 的 GPU 文件頁中,Android 加上 litert-gpu 套件,建立 CompiledModel 時指定 GPU 即可:
implementation 'com.google.ai.edge.litert:litert:2.3.0'
implementation 'com.google.ai.edge.litert:litert-gpu:2.3.0'
val model = CompiledModel.create(
context.assets, "mymodel.tflite",
CompiledModel.Options(Accelerator.GPU), env)| 平台 | GPU 後端(LiteRT 文件) |
|---|---|
| Android | OpenCL + OpenGL |
| Linux | WebGPU(Vulkan) |
| macOS | Metal |
| Windows | WebGPU(Direct3D) |
Windows 需另外安裝 DirectXShaderCompiler,並把 dxil.dll 與 dxcompiler.dll 放到執行檔旁。文件也提到部分模型只會被部分委派給 GPU,效能會受影響。
官方公布的數字
- YouTube Shorts:分割類特效的平均每幀延遲最多降低 40%。
- Google Photos:相對舊 GPU delegate 最多快 2 秒(Unblur 等流程)。
- Adobe Lightroom 與 Photoshop:最多快 30%。
- Snap:臉部與風格生成 lens 的模型延遲改善 30%。
- Gemma:記憶體開銷比其他框架最多低 12%。
LLM 吞吐量只以圖表呈現,部落格文字沒有給數值,測試裝置也未在內文列名。這批數字全是 Google 與合作夥伴自報,尚無第三方重現。
影響範圍
還在用 TFLite GPU delegate 的 Android 與 iOS 應用要規劃遷移:舊 delegate 不再有新功能,官方說 LiteRT ML Drift GPU accelerator 與既有模型完全向後相容,所以多半是改初始化程式碼,而非重新轉換模型。Android 的獨立(unbundled)執行階段目前可透過獨立 LiteRT 套件取得,Google Play Services 版「即將推出」。
有 5D 模型或自訂運算元的團隊可以拿掉原本的 layout 變通,並改用 custom op 框架。想在瀏覽器或桌面跑端側模型的人可走 WebGPU,原生環境透過 Dawn 支援 Windows 與 Linux;Chrome 的 Gemini Nano 內建 AI API 已在使用。
硬體面,Arm 針對 Mali 與 Immortalis、Qualcomm 針對 Adreno、Intel 針對 Xe3 顯示卡的 Core Ultra 做了協同最佳化。程式庫以 Bazel 建置,README 稱其為 TFLite GPU delegate 的繼任者,並宣稱相對既有開源 GPU 推論引擎有「數量級」的效能提升;這項主張同樣缺少公開基準細節。