AI 前沿 2026 年 8 月 1 日

2026-08-01 — 實機 GUI 代理、多語言檢索模型與自動化 ML 工程三則前沿解讀

primary=https://huggingface.co/papers/2607.28227 primary=https://huggingface.co/blog/lightonai/mdenseon-mlateon primary=https://arxiv.org/abs/2607.27178 primary=https://huggingface.co/papers/2607.28568

阿里 Qwen-UI-Agent 技術報告:從百萬模擬環境走向百台實機的 GUI 代理

Hugging Face Papers · 2026-07-31

阿里巴巴 MAI-UI 團隊於 2026 年 7 月 31 日在 arXiv 2607.28227 發布 Qwen-UI-Agent 技術報告,公開一系列鎖定手機、桌面、瀏覽器與搜尋場景的基礎 GUI 代理模型,涵蓋 27B35B-A3B(3B 啟用參數的 MoE)與 4B 三種規格。報告的核心訴求是縮小「跑分好看」與「真實裝置上能用」之間的落差。

背景

過去 GUI agent 多半在模擬器或錄影回放環境中訓練評測,一旦換到真實手機、真實 App 版本便容易失準。模擬到現實的落差(sim-to-real gap)長期是這類代理難以落地的主因,App 更新、彈窗、網路延遲都會讓模型在模擬環境學到的策略失效。Qwen-UI-Agent 因此把「真實裝置」本身當成訓練與評測基礎設施的一部分。

核心改動

模型採用統一動作空間,把 GUI 操作(點擊、輸入、拖曳)、CLI 指令與 API 呼叫放進同一套輸出格式,並支援單一輪次內生成批次動作,報告指出約 40% 的電腦操作動作以批次形式執行,藉此減少不必要的單步互動。訓練流程分為多階段:先做「領域條件化專家訓練+模型融合」,再以滑動視窗技巧做監督微調,最後針對六類重複出現的錯誤模式做動作級強化學習,並將線上 RL 擴展到超過 100 步的長軌跡任務。

支撐這套訓練的是逾百台真實手機組成的裝置池,涵蓋 150 多款 App,搭配健康感知排程器管理裝置分配,並用虛擬顯示技術讓單一裝置同時跑多個 App 會話,用以逼近約一萬個並行模擬環境的 rollout 加速效果。報告另外提出「自動化數據飛輪」,由代理自行合成任務、建構環境狀態、生成驗證器、分析失敗原因並規劃下一輪改進,減少人工介入。

規格細節

評測集成績對照
MobileWorld-Real92.2%領先 Seed 2.1 Pro 3.5 分
MobileWorld82.1%領先 GPT-5.6 Sol 12.0 分
AndroidDaily97.5%
OSWorld-Verified79.5%
WebArena73.6%
BrowseComp64.1%
ScreenSpot-Pro81.5%GUI grounding

報告同時提出名為 MobileWorld-Real 的實機基準,收錄中國行動生態 104 款 App 的人工撰寫任務,並搭配軌跡級評判器 AutoJudge,用來區分「模型失敗」與「環境本身出錯」,區分準確率達 92.8%。

影響範圍

技術報告額外描述一層「harness 層」,可依手機通知主動啟動服務,並支援任務狀態在裝置間無縫接續的跨平台工作流程。文件中未附上 GitHub 或獨立專案頁面連結,目前對外可見的技術細節僅限於這份 arXiv 報告本身。

原始來源:Qwen-UI-Agent Technical Report(arXiv 2607.28227)


LightOn 開源 mDenseOn/mLateOn:3 億參數九語言檢索模型,靠 late interaction 補跨語言短板

LightOn(Hugging Face Blog) · 2026-07-31

法國 AI 公司 LightOn 於 官方部落格發布兩款 307M 參數的多語言檢索模型:mLateOn(late-interaction 架構)與 mDenseOn(dense 架構),兩者共用 mmBERT-base 骨幹,支援英文加八種翻譯訓練目標語言,並隨附對應論文(arXiv 2607.27178)。

背景:dense 與 late-interaction 檢索的差異

Dense retrieval 把整段文字壓縮成單一向量,查詢與文件各算一個向量後做內積比對,速度快但會丟失 token 級細節。Late-interaction retrieval(如 ColBERT 系列)則保留每個 token 的向量,查詢與文件之間逐 token 做 MaxSim/MeanMaxSim 匹配後加總,能保留更細粒度的語意訊號,代價是儲存與計算量較高。這篇工作的重點發現是:在跨語言遷移場景下,late-interaction 對「翻譯訓練」(translate-train)語言之外的語種泛化明顯更好

規格細節

兩個模型都用 28 億句對的多語言語料,透過翻譯訓練法從精選英文資料生成,是目前公開的大型多語言檢索資料集之一;微調階段再加入 1630 萬筆涵蓋九種語言與程式碼的樣本。序列長度在微調與評測階段可達 8192 token,預訓練階段則對 late-interaction 模型採較激進的 300 token 截斷。

BenchmarkmLateOnmDenseOn
BEIR57.5656.70
MIRACL(目標語言)65.6159.61
MLDR(full)77.9251.59
MTEB Code73.4871.53
MIRACL(未見語言,18+)67.5957.42

值得注意的是兩個模型的程式碼檢索能力:微調階段僅加入少量程式碼資料,MTEB Code 分數就達到 70 分以上,顯示這類多語言檢索骨幹本身具備一定的程式碼語意遷移能力。

影響範圍

模型權重已上架 Hugging Face(mLateOnmDenseOn),推論端可搭配 LightOn 自家的 PyLateFastPLAID 執行 late-interaction 檢索,訓練腳本也一併開源。對於需要處理阿拉伯文、北歐語系等資源較少語言的檢索系統,late-interaction 版本在未見語言上的優勢是本次發布最直接可用的結論。

原始來源:mDenseOn/mLateOn 官方部落格arXiv 2607.27178


Frontis-MA1:35B 模型用 Draft-Improve-Debug-Crossover 迴圈自動做機器學習工程

Hugging Face Papers · 2026-07-31

研究團隊 Frontis AI 於 arXiv 2607.28568 公開 Frontis-MA1,一個 35B 參數的「元演化」(meta-evolution)代理,鎖定機器學習工程(MLE)任務本身作為訓練與評測場域,並隨附完整開源的訓練/評測堆疊 OpenMLE。

背景:什麼是遞迴自我改進

遞迴自我改進(recursive self-improvement,RSI)指系統利用自身能力去強化同一種能力,每一輪改進都讓下一輪改進更容易,形成正回饋迴圈。業界常把它與行之有年的 AutoML(自動搜尋架構、超參數)混為一談,但論文所稱的 RSI 更接近「AI 系統自己跑實驗、自己評估結果、自己迭代模型設計」的全流程自動化 R&D。這篇論文把研究範圍收斂在 MLE 這個可驗證的具體子任務上,稱之為 AI4AI:用 AI 改進打造 AI 的工程流程。

核心改動

Frontis-MA1 的核心是四個原子級「程式演化」算子:Draft(起草)、Improve(改進)、Debug(除錯)、Crossover(交叉),代理透過反覆呼叫這四種操作,對一份 ML 解法程式碼做長時間演化搜尋。支撐訓練的是團隊自建的 OpenMLE 全端系統,分為三部分:OpenMLE-Gym 提供可驗證的任務環境、OpenMLE-RL 負責訓練上述四個算子、OpenMLE-Evo 執行長視野的演化搜尋。訓練資料採用「execution-grounded」的監督微調加強化學習,並對所有評測基準做過去重,避免評測污染。

規格細節

MLE-Bench Lite(單張 RTX 4090、每任務 12 小時預算)上,論文給出三組數字:

設定成功率
Frontis-MA1 基礎模型39.39%
+ OpenMLE-Evo60.61%
+ OpenMLE-Evo-Max71.21%

最高設定的表現超過 GPT-5.5 搭配 Codex 的組合,並逼近 GPT-5.6 Sol 與 2.8T 參數的 Kimi K3。團隊也在held-out 的 NatureBench Lite 上驗證了遷移效果,顯示演化搜尋學到的策略並非只針對單一 benchmark 過擬合。

影響範圍

模型權重與完整 OpenMLE 堆疊已開源於 GitHub,並提供專案頁面。由於訓練與評測資源都公開釋出,這是目前少數把「AI 自動化 ML 工程」拆解成可重現算子與可驗證環境的公開研究,而非僅停留在論文層級的概念展示。

原始來源:Frontis-MA1(arXiv 2607.28568)OpenRSI GitHub


End of article
0
Would love your thoughts, please comment.x
()
x