Meta 發布 Muse Glimmer:可在本機端運行的 300 億參數多模態代理模型
research.meta.ai · 2026-08-10
Meta 於 2026 年 8 月 10 日在其研究部落格發布 Muse Glimmer,一款 30B 參數的開放權重多模態代理模型,設計目標是在消費級硬體上本機執行完整的代理任務。模型以 Apache 2.0 授權釋出,同步上架 Hugging Face 與開發者文件站。
背景
過去一年,重量級的代理式(agentic)模型多半仰賴雲端算力,推論延遲與資料傳輸都綁在伺服器端。Muse Glimmer 的設計方向鎖定筆電與工作站等本機裝置,把長時間執行的工具呼叫、瀏覽器操作與程式修改都放到裝置端完成。Meta 將其定位為具備「長時程執行、精確工具呼叫、多模態理解、長上下文記憶與指令遵循」能力的代理模型。
核心改動/架構細節
模型內建專屬的感知編碼器(perception encoder)以支援多模態輸入,能夠交錯處理文字與圖像,解讀截圖、圖表與文件內容。推論加速是這次發布的重點:Muse Glimmer 搭配一個以 DFlash 為基礎的輕量「草稿模型」(drafter)進行推測解碼(speculative decoding)。
DFlash(arXiv:2602.06036,ICML 2026)原論文提出以區塊擴散模型(block diffusion model)取代傳統自回歸草稿模型:傳統推測解碼的草稿模型仍須逐字生成候選 token,存在序列化瓶頸;DFlash 則利用擴散模型在單次前向傳播中平行產生多個草稿 token,再交由目標模型驗證,原論文報告可達 6 倍以上的無損加速,較 EAGLE-3 最高快 2.5 倍。權重量化至約 4-bit 精度後,Muse Glimmer 可在 20GB 記憶體以內運作,實測解碼加速倍率如下:
| 硬體 | 解碼加速倍率 |
|---|---|
| RTX 5090 | 3.1× |
| M5 Max | 1.8× |
| M4 Max | 1.5× |
Meta 表示在 DeepSearch QA、MCP-Atlas、τ-Bench 與 SWE-Bench 等完整任務型基準上,Muse Glimmer 的成功率優於 Gemma4-31B 與 Qwen3.6-27B。
影響範圍
Muse Glimmer 以 Apache 2.0 授權開放權重,並同步釋出開發文件與 Hugging Face 模型頁。本機執行能力讓需要長時間工具呼叫、狀態記憶與長上下文追蹤的代理任務,不必依賴雲端 API 即可在單台工作站或高階筆電上完成推論。搭配 DFlash 式推測解碼的作法,也可能被其他開放模型專案借鏡,用於降低本機部署的延遲與記憶體需求。
Multiverse Computing 提出快取式知識蒸餾法,大幅壓低訓練記憶體與算力成本
huggingface.co · 2026-08-10
新創公司 Multiverse Computing 於 2026 年 8 月 10 日在 Hugging Face 部落格發布一套知識蒸餾(knowledge distillation)系統優化方法,針對教師—學生蒸餾訓練中的記憶體瓶頸提出兩項技術:離線 Top-K logits 快取與 Fused Chunked KL Loss。團隊在對應論文(arXiv:2608.03796,2026 年 8 月 4 日提交)中以 Llama 3.1 8B Instruct 為教師模型、3.2B 規模的 Llama 變體為學生模型驗證方法,並額外在 GPT-OSS 20B 上做了測試。
背景
標準的線上知識蒸餾需要教師模型與學生模型同時常駐於 GPU 記憶體,且每個訓練步驟都要重新計算教師的完整輸出分布,對詞彙表龐大的語言模型而言記憶體與運算開銷會隨批次大小與序列長度快速增加。大規模消融實驗與模型健康度修復(healing)因此往往需要多節點叢集才能負擔。Multiverse Computing 的方法試圖把這類訓練壓回單一 GPU 完成。
方法
離線 Top-K logits 快取是第一項技術:團隊不在每個訓練步驟即時運算教師模型,而是預先算好一次教師輸出,只保留每個位置機率最高的前 100 個 token(top-100)存成快取,學生模型之後直接對快取資料做蒸餾訓練。教師模型因此不必在訓練期間常駐記憶體,推論與訓練工作被解耦。
第二項技術是 Fused Chunked KL Loss,用於解決 KL 散度損失計算時需要具現化完整「詞彙表大小 × 序列長度」logits 矩陣的問題。做法是把序列切成多個區塊(chunk),逐區塊算完 KL 散度後即釋放記憶體,不在任何時刻產生完整的 logits 矩陣,使峰值記憶體與序列長度呈線性關係而非平方關係。
結果
| 指標 | 線上蒸餾 | 本方法 |
|---|---|---|
| 峰值記憶體(8K 上下文,H200) | 102.8 GB | 58.3 GB |
| 峰值記憶體(32K token) | 85.2 GB | 5.45 GB |
| 單步耗時 | 57.0 秒 | 12.23 秒 |
在 32K token 長度下,峰值記憶體降幅達 15.6 倍;單步耗時從 57.0 秒降到 12.23 秒,相當於 5 倍加速,原本需要 4 節點的訓練規模可壓縮至單一節點完成。相較單純提升硬體規格,離線快取搭配 chunked loss 的組合讓相同精度的蒸餾訓練能在成本更低的單卡環境完成。
團隊另外用獨立 benchmark 測試該 loss kernel 在 4,096 至 256,000 token 序列長度區間的記憶體與迭代速率變化,結果符合線性擴展的預期。論文提及對應的專利申請案(EP26382987.1)已在受理中,實作程式碼已公開釋出。
MatrAIx:用 83 億筆合成人格資料模擬使用者行為的評測基礎設施
huggingface.co · 2026-08-06
由哈佛大學 Xiaomin Li、麻省理工學院 Yuexing Hao 等 70 餘位跨機構研究者共同發表的論文《MatrAIx: Simulating the World with 8.3 Billion Persona Agents》(arXiv:2608.04205,2026 年 8 月 4 日提交),收錄於 Hugging Face Papers。論文提出一套以 83 億筆合成人格(persona)紀錄為核心的 AI 系統評測基礎設施 MatrAIx。
背景
評測 AI 系統與真實使用者互動的行為長期受限於「測試使用者」多樣性不足,多數評測仍仰賴少量人工撰寫的角色腳本或問卷樣本,難以涵蓋不同人口統計、行為傾向與情境組合。這篇論文採用的解法是 persona-agent simulation(人格代理模擬):讓 LLM 驅動的代理人扮演具備詳細人格設定的虛擬使用者,在互動環境中重現接近真實分布的行為模式,以便在正式評測前大規模模擬使用者反應。
方法
MatrAIx 的人格資料建立在 1,290 維的結構化屬性 schema 上,每一筆人格紀錄都映射到同一組維度空間。資料來源有兩類:一是「人類基礎」紀錄,取材自 Wikipedia、Amazon Reviews、Stack Overflow 開發者調查等公開資料並映射為 schema 格式;二是「合成」紀錄,透過一個結合來源分佈、跨屬性相關性與相容性規則的有向無環圖(DAG)採樣產生,確保人口統計與行為變數之間的相依關係符合現實分布而非隨機組合。
系統從全部 83 億筆人格記錄中再篩選出一個 100 萬筆的公開核心資料集(599,847 筆人類基礎紀錄 + 400,000 筆合成紀錄)供下游任務直接使用。人格代理可在四種互動環境中運作:
- Survey(問卷填答)
- AI Chatbot(對話互動)
- Web(網頁瀏覽與產品測試)
- App(行動應用操作)
研究團隊設計了涵蓋 Commerce、Software、Finance、Healthcare 等 25 個以上領域、共 1,010 項可重複使用的應用任務,用於衡量使用者猶豫程度、失敗後的堅持行為與延遲容忍度等行為指標。人格代理分別以 Claude Opus 4.8、GPT 5.5 與 Claude Haiku 4.5 三種語言模型作為後端驅動。
結果
團隊在 18,189 次評測試驗中檢驗人格代理是否能正確表現或抑制被指派的行為特徵,抽樣的 400 次試驗中有 366 次(91.5%)符合預期,顯示分配給代理的人格特徵能被穩定「表現」或「正確抑制」。人類評分者對系統萃取出的人格描述給出平均 4.135 分(滿分 5 分)的品質評分,且三種不同 LLM 後端之間的人格效應具有一致性,顯示行為模式並非特定模型的偶然結果,而是可跨模型重現的效果。