DeepMind 發布 WeatherNext 2 與颶風模型 WeatherNext Cyclones,論文登上 Nature
DeepMind Blog · 2026-08-06
Google DeepMind 於 2026 年 8 月 6 日在 Nature(論文編號 s41586-026-10953-2)發表 WeatherNext Cyclones 與新一代全球天氣模型 WeatherNext 2,同時釋出輕量版 WeatherNext 2-mini。團隊宣稱此次是熱帶氣旋(颶風/颱風)路徑與強度預報準確度的重大突破,並已用於美國國家颶風中心(NHC)的實際作業。
核心改動
WeatherNext Cyclones 採用 Functional Generative Networks(FGN)產生機率式集合預報,把全球天氣建模與局部颶風強度預測整合在同一個模型裡,而非像傳統流程那樣分成獨立的全球模式加區域巢狀模式。模型的空間解析度僅 28×28 公里,DeepMind 形容這比傳統作業預報模式粗了約 100 倍,但準確度反而更高,團隊表示這個現象本身仍待進一步研究解釋。
訓練資料包含約 20 TB 的全球大氣觀測資料,以及 NOAA 維護的 IBTrACS(International Best Track Archive for Climate Stewardship)資料庫中近 5000 筆歷史風暴觀測記錄。WeatherNext 2 的底層技術延續 DeepMind 先前的 GraphCast/GenCast 系列,結合圖神經網路做確定性預報與擴散模型做集合預報,技術細節記錄於另一篇技術報告 arXiv:2506.10772(Skillful joint probabilistic weather forecasting from marginals)。
規格細節
DeepMind 公布的比較基準是目前作業預報常用的 ENS(歐洲中期天氣預報中心集合系統)與 HWRF(美國颶風天氣研究與預報模式)。官方引用的具體數字包括:三日預報路徑誤差約 100 公里(對比 ENS)、三日強度誤差約 11 節(對比 HWRF),且在路徑、強度與風場結構預報上取得超過 24 小時的領先優勢——即三日預報的準確度已能匹敵過去的兩日預報。
- 路徑誤差基準:
ENS,三日誤差約 100 公里 - 強度誤差基準:
HWRF,三日誤差約 11 節 - 訓練歷史觀測基準:
IBTrACS,近 5000 筆風暴記錄
影響範圍
DeepMind 表示該模型系列曾協助 NHC 於 2025 年預測颶風 Melissa 的快速增強與登陸牙買加路徑,讓當地提前準備。模型權重與程式碼已在 GitHub 開源,並提供互動視覺化平台 Weather Lab 與 WeatherNext 2-mini 的免費 Colab 示範,方便研究社群或第三方氣象單位直接調用。
NVIDIA 同步推出 Nemotron 3.5 Lightning 模型與代理路由庫 NeMo Switchyard
NVIDIA Blog · 2026-08-11
NVIDIA 於 2026 年 8 月 11 日在官方部落格發布 Nemotron 3.5 Lightning 與開源路由庫 NeMo Switchyard,兩者共同針對多代理(multi-agent)系統中「哪個步驟該用哪個模型」的效率與成本問題。前者是一個專為代理系統中特定子任務設計的中量級模型,後者則是自動選模型的路由層。
規格細節
根據 NVIDIA 在 Hugging Face 模型卡上的說明,Nemotron 3.5 Lightning 採用混合式 Mixture-of-Experts 架構,交錯排列 Mamba-2 層、MoE 層與部分 Attention 層,總參數 30B,實際啟用參數僅 3B(即 30B-A3B),以超過 20T tokens 預訓練,並支援最長 1M context。NVIDIA 部落格引用的效能數字是相較同量級開源模型「輸出速度最高快 4 倍、代理任務完成時間快 30%」,並在其內部 PinchBench 基準上達到「frontier-level」準確度。
NeMo Switchyard 是一套開源路由庫,依「準確度、速度、成本」三個訊號將代理工作流程中每一步請求導向最合適的模型,並可依企業需求調整或替換路由演算法。NVIDIA 表示在其內部評測中,Switchyard 搭配多模型組合可以把任務完成成本壓低到「單獨使用 Opus 4.8 的近三分之一」,同時維持 frontier-level 準確度。
- Boomi:領域路由準確率 100%
- LangChain:成本降低 74%
- Ramp:成本降低 58%
影響範圍
Nemotron 3.5 Lightning 已被 CrowdStrike(資安)、Harvey(法律)、CodeRabbit(程式碼審查)、Lila Sciences(物理/生命科學)與 Fastino Labs(金融、醫療)用於客製化領域代理工作流程,並可部署在 RTX PC、DGX、Jetson 到雲端等不同環境。模型與路由庫皆為開放發布,Nemotron 3.5 Lightning 已上架 Hugging Face、ModelScope、OpenRouter 與 build.nvidia.com,NeMo Switchyard 則透過 GitHub 開源,部分合作平台的整合仍在推出中。
Mendel Gödel Machine:用「孟德爾式」比較演化取代單軌跡自我修改,程式代理刷新 Polyglot 分數
arXiv · 2026-08-07
來自 KAUST 與 LMU Munich 研究者於 2026 年 8 月 7 日在 arXiv 發布 arXiv:2608.07645,提出 Mendel Gödel Machine(MGM),一個讓程式碼代理能遞迴自我改寫(recursive self-improvement)的框架。核心主張是:過去這類系統只依單一失敗軌跡來修改自己,忽略了大量嘗試之間可比較的訊號。
背景
Gödel machine 概念最早由 Jürgen Schmidhuber 於 2003 年提出,指一個會不斷搜尋自身程式碼修改、並只在能證明新版本更優時才自我改寫的理論系統。近年 Sakana AI 的 Darwin Gödel Machine(DGM,arXiv:2505.22954)把這個構想落地成用單一失敗軌跡驅動的自我改寫程式代理,但放棄了嚴格的數學證明、改用實測效果篩選。MGM 這篇論文正是接續 DGM 的「達爾文式」單軌跡演化,加入更多比較訊號。
核心改動
MGM 定義三種自我修改運算子:clonal mutation(沿用單一軌跡改寫,對應 DGM 原有做法)、reaction-norm mutation(同一代理在多個任務上的軌跡一起參考再改寫)、以及 cross-lineage hybridization(跨代理、共享任務的比較與雜交)。作者在論文中建立一個「加成適應度模型」(additive fitness model),理論證明並用模擬驗證這三種比較式策略比單軌跡方法收斂更快。
規格細節
實證部分在 SWE-bench 與 Polyglot 兩個程式代理基準上進行。論文摘要指出,經過 MGM 演化後的 Qwen3.6-35B-A3B scaffold 在 Polyglot 上達到 93.3% 的分數,作者稱其「以約 117 倍更少的參數超越閉源 GPT-5」,並在不同基準與不同底層模型之間展現一致的泛化能力。
影響範圍
作者已將程式碼與專案頁面公開於 GitHub 與 reallcz.github.io/MGM,供其他研究者重現比較式自我修改流程。這代表自我改進代理研究正從 DGM 式的單軌跡試錯,轉向利用同一族群內多次嘗試之間的相對優劣訊號來加速演化。