AI 前沿 2026 年 8 月 29 日

2026-08-29 — DeepMind 雙盲評測、Gemini 3.5 Transcribe 與 GLM-5.3 開源權重動態

primary=https://deepmind.google/blog/piloting-the-worlds-first-double-blind-ai-evaluations/ primary=https://mlcommons.org/2026/08/double-blind-reliability-evaluation/ primary=https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/ primary=https://huggingface.co/zai-org/GLM-5.3 primary=https://arxiv.org/abs/2602.15763 primary=https://github.com/zai-org/GLM-5

Google DeepMind 攜手外部機構 試辦全球首例雙盲 AI 評測

Google DeepMind Blog · 2026-08-27

Google DeepMind 於 2026 年 8 月 27 日在官方部落格宣布,已與新加坡 AI 安全機構、OpenMined、AVERI 及 MLCommons 合作,完成全球首次針對前沿專有模型的「雙盲」外部評測,受測模型為 Gemini Flash Lite。這次試辦的核心是讓評測方與模型方彼此都看不到對方的機密資料,藉此解決長期存在的評測公信力難題。

背景

外部單位評測商用 AI 模型時,向來面臨兩難:評測方若要驗證模型真實能力,就得看到模型輸出甚至內部行為,可能因此洩漏受測考題,汙染日後的訓練資料;模型供應商若拒絕開放測試環境,又難以讓外界信任分數的真實性。評測公信力與智慧財產保護長期互斥,使得多數第三方評測只能依賴供應商自報成績,或退而求其次採用抽樣、延遲公布等妥協做法。

核心作法

DeepMind 這次採用 Google Cloud 的 Confidential Space(機密運算/可信任執行環境)建立加密沙盒:模型在沙盒內執行評測方送入的題目,只有經過驗證的輸出結果才能離開沙盒。評測方看不到模型權重,DeepMind 也看不到評測題目本身,等於把互不信任的雙方放進同一個彼此都無法窺探的房間裡運算。合作夥伴 MLCommons 同步發布了對應的雙盲可靠性評測方案,技術細節收錄在技術報告中。

影響範圍

部落格文章並未揭露 Gemini Flash Lite 此次受測的具體分數或通過與否,重點放在方法論本身而非單一模型的成績單。這套機制為往後的第三方安全評測提供了範本,讓監管機構、學術單位在不取得模型權重的前提下,也能對前沿模型做出可驗證的獨立評估,同時保住供應商不願外流的模型與訓練資產。

原始來源:Google DeepMind BlogMLCommons


Google 發布 Gemini 3.5 Transcribe,主打串流低延遲語音轉文字

Google Blog · 2026-08-26

Google 於 2026 年 8 月 26 日在官方部落格發布新一代語音轉文字模型 Gemini 3.5 Transcribe,作為既有 Chirp 3 的後繼者,鎖定串流場景的低延遲辨識與多語言支援。此次發布同步開放開發者與企業預覽管道,並將陸續整合進多款消費端產品。

規格細節

Gemini 3.5 Transcribe 在串流模式下的字錯誤率(WER)為 4.0%,非串流模式降到 2.6%;在 Google 自家的跨語言語音基準 FLEURS 上,串流與非串流分別為 5.50% 與 5.04%。官方數據顯示辨識延遲較前代 Chirp 3 快 70%,並可自動偵測、辨識超過 85 種語言。模型另支援最多三位講者的區分與時間戳記標註,能自動去除贅字、修正說話者的自我更正,也能透過 function calling 把複雜任務轉交給其他 Gemini 模型處理。

指標串流非串流
整體 WER4.0%2.6%
FLEURS WER5.50%5.04%

影響範圍

開發者可透過 Live APIInteractions API 在 Google AI Studio、Google Antigravity 中公開預覽;企業端已在 Gemini Enterprise Agent Platform 開放,稍後也會進駐 Gemini Enterprise for Customer Experience。消費產品的整合已經展開,Android 版 Rambler(部分地區與語言)、macOS 版 Gemini App 已可使用,Chrome 版本則預告即將推出。

原始來源:Google Blog


Z.ai 旗艦模型 GLM-5.3 開源權重上線 Hugging Face

Hugging Face (zai-org) · 2026-08-28

中國 AI 公司 Z.ai(智譜)近日將旗艦模型 GLM-5.3 的開源權重釋出至 Hugging Face 的 zai-org/GLM-5.3 倉庫。此模型已於 8 月 14 日透過 API 上線,官方原先預告權重會在兩週後、約 8 月 28 日釋出,這次公開的時間點大致符合原訂排程。相關論文已發表於 arXiv:2602.15763

核心改動

GLM-5.3 沿用與 GLM-5.2 相同的 MoE 基座模型,這一版所有進步都只來自後訓練(post-training),而非架構本身的更動。官方表示在 Z.ai Code Bench 上的程式碼能力較 GLM-5.2 提升約 50%,同時意外展現出資安相關的能力,包括漏洞分析與利用鏈構建。模型支援 reasoning_effort 參數,可選擇 lowhighmax 三種推理強度,預設為 max,且此版本不再支援關閉推理。

規格細節

基準測試GLM-5.2GLM-5.3
Terminal-Bench 3.04.628.3
DeepSWE v1.146.266.9
CyberGym77.284.5
ExploitBench24.454.4

Hugging Face 上的模型卡標示總參數量為 753B,上下文長度最長可達 1M tokens,單次輸出上限為 128K tokens。官方在資安測試中對 269 個真實專案進行掃描,共找出 2,436 個漏洞,其中 1,097 個屬中高嚴重度,這也是「湧現資安能力」說法的依據。

影響範圍

GLM-5.3 完整版權重公開前,體型較小的 GLM-5.3-Flash 已先一步於 8 月 26 日以 MIT 授權開源,總參數約 320B、每次僅啟用 18B,是 GLM-5 系列中第一款原生多模態模型。兩款模型合力補齊了 Z.ai 開源陣營在推理成本與旗艦效能上的選項,開發者可透過 SGLang、vLLM、Transformers 等框架自行部署,程式碼與更多細節收錄在官方 GitHub 倉庫

原始來源:Hugging FacearXiv:2602.15763GitHub


End of article
0
Would love your thoughts, please comment.x
()
x