阿里 Qwen-UI-Agent 技術報告:從百萬模擬環境走向百台實機的 GUI 代理
Hugging Face Papers · 2026-07-31
阿里巴巴 MAI-UI 團隊於 2026 年 7 月 31 日在 arXiv 2607.28227 發布 Qwen-UI-Agent 技術報告,公開一系列鎖定手機、桌面、瀏覽器與搜尋場景的基礎 GUI 代理模型,涵蓋 27B、35B-A3B(3B 啟用參數的 MoE)與 4B 三種規格。報告的核心訴求是縮小「跑分好看」與「真實裝置上能用」之間的落差。
背景
過去 GUI agent 多半在模擬器或錄影回放環境中訓練評測,一旦換到真實手機、真實 App 版本便容易失準。模擬到現實的落差(sim-to-real gap)長期是這類代理難以落地的主因,App 更新、彈窗、網路延遲都會讓模型在模擬環境學到的策略失效。Qwen-UI-Agent 因此把「真實裝置」本身當成訓練與評測基礎設施的一部分。
核心改動
模型採用統一動作空間,把 GUI 操作(點擊、輸入、拖曳)、CLI 指令與 API 呼叫放進同一套輸出格式,並支援單一輪次內生成批次動作,報告指出約 40% 的電腦操作動作以批次形式執行,藉此減少不必要的單步互動。訓練流程分為多階段:先做「領域條件化專家訓練+模型融合」,再以滑動視窗技巧做監督微調,最後針對六類重複出現的錯誤模式做動作級強化學習,並將線上 RL 擴展到超過 100 步的長軌跡任務。
支撐這套訓練的是逾百台真實手機組成的裝置池,涵蓋 150 多款 App,搭配健康感知排程器管理裝置分配,並用虛擬顯示技術讓單一裝置同時跑多個 App 會話,用以逼近約一萬個並行模擬環境的 rollout 加速效果。報告另外提出「自動化數據飛輪」,由代理自行合成任務、建構環境狀態、生成驗證器、分析失敗原因並規劃下一輪改進,減少人工介入。
規格細節
| 評測集 | 成績 | 對照 |
|---|---|---|
| MobileWorld-Real | 92.2% | 領先 Seed 2.1 Pro 3.5 分 |
| MobileWorld | 82.1% | 領先 GPT-5.6 Sol 12.0 分 |
| AndroidDaily | 97.5% | — |
| OSWorld-Verified | 79.5% | — |
| WebArena | 73.6% | — |
| BrowseComp | 64.1% | — |
| ScreenSpot-Pro | 81.5% | GUI grounding |
報告同時提出名為 MobileWorld-Real 的實機基準,收錄中國行動生態 104 款 App 的人工撰寫任務,並搭配軌跡級評判器 AutoJudge,用來區分「模型失敗」與「環境本身出錯」,區分準確率達 92.8%。
影響範圍
技術報告額外描述一層「harness 層」,可依手機通知主動啟動服務,並支援任務狀態在裝置間無縫接續的跨平台工作流程。文件中未附上 GitHub 或獨立專案頁面連結,目前對外可見的技術細節僅限於這份 arXiv 報告本身。
LightOn 開源 mDenseOn/mLateOn:3 億參數九語言檢索模型,靠 late interaction 補跨語言短板
LightOn(Hugging Face Blog) · 2026-07-31
法國 AI 公司 LightOn 於 官方部落格發布兩款 307M 參數的多語言檢索模型:mLateOn(late-interaction 架構)與 mDenseOn(dense 架構),兩者共用 mmBERT-base 骨幹,支援英文加八種翻譯訓練目標語言,並隨附對應論文(arXiv 2607.27178)。
背景:dense 與 late-interaction 檢索的差異
Dense retrieval 把整段文字壓縮成單一向量,查詢與文件各算一個向量後做內積比對,速度快但會丟失 token 級細節。Late-interaction retrieval(如 ColBERT 系列)則保留每個 token 的向量,查詢與文件之間逐 token 做 MaxSim/MeanMaxSim 匹配後加總,能保留更細粒度的語意訊號,代價是儲存與計算量較高。這篇工作的重點發現是:在跨語言遷移場景下,late-interaction 對「翻譯訓練」(translate-train)語言之外的語種泛化明顯更好。
規格細節
兩個模型都用 28 億句對的多語言語料,透過翻譯訓練法從精選英文資料生成,是目前公開的大型多語言檢索資料集之一;微調階段再加入 1630 萬筆涵蓋九種語言與程式碼的樣本。序列長度在微調與評測階段可達 8192 token,預訓練階段則對 late-interaction 模型採較激進的 300 token 截斷。
| Benchmark | mLateOn | mDenseOn |
|---|---|---|
| BEIR | 57.56 | 56.70 |
| MIRACL(目標語言) | 65.61 | 59.61 |
| MLDR(full) | 77.92 | 51.59 |
| MTEB Code | 73.48 | 71.53 |
| MIRACL(未見語言,18+) | 67.59 | 57.42 |
值得注意的是兩個模型的程式碼檢索能力:微調階段僅加入少量程式碼資料,MTEB Code 分數就達到 70 分以上,顯示這類多語言檢索骨幹本身具備一定的程式碼語意遷移能力。
影響範圍
模型權重已上架 Hugging Face(mLateOn、mDenseOn),推論端可搭配 LightOn 自家的 PyLate 與 FastPLAID 執行 late-interaction 檢索,訓練腳本也一併開源。對於需要處理阿拉伯文、北歐語系等資源較少語言的檢索系統,late-interaction 版本在未見語言上的優勢是本次發布最直接可用的結論。
Frontis-MA1:35B 模型用 Draft-Improve-Debug-Crossover 迴圈自動做機器學習工程
Hugging Face Papers · 2026-07-31
研究團隊 Frontis AI 於 arXiv 2607.28568 公開 Frontis-MA1,一個 35B 參數的「元演化」(meta-evolution)代理,鎖定機器學習工程(MLE)任務本身作為訓練與評測場域,並隨附完整開源的訓練/評測堆疊 OpenMLE。
背景:什麼是遞迴自我改進
遞迴自我改進(recursive self-improvement,RSI)指系統利用自身能力去強化同一種能力,每一輪改進都讓下一輪改進更容易,形成正回饋迴圈。業界常把它與行之有年的 AutoML(自動搜尋架構、超參數)混為一談,但論文所稱的 RSI 更接近「AI 系統自己跑實驗、自己評估結果、自己迭代模型設計」的全流程自動化 R&D。這篇論文把研究範圍收斂在 MLE 這個可驗證的具體子任務上,稱之為 AI4AI:用 AI 改進打造 AI 的工程流程。
核心改動
Frontis-MA1 的核心是四個原子級「程式演化」算子:Draft(起草)、Improve(改進)、Debug(除錯)、Crossover(交叉),代理透過反覆呼叫這四種操作,對一份 ML 解法程式碼做長時間演化搜尋。支撐訓練的是團隊自建的 OpenMLE 全端系統,分為三部分:OpenMLE-Gym 提供可驗證的任務環境、OpenMLE-RL 負責訓練上述四個算子、OpenMLE-Evo 執行長視野的演化搜尋。訓練資料採用「execution-grounded」的監督微調加強化學習,並對所有評測基準做過去重,避免評測污染。
規格細節
在 MLE-Bench Lite(單張 RTX 4090、每任務 12 小時預算)上,論文給出三組數字:
| 設定 | 成功率 |
|---|---|
| Frontis-MA1 基礎模型 | 39.39% |
| + OpenMLE-Evo | 60.61% |
| + OpenMLE-Evo-Max | 71.21% |
最高設定的表現超過 GPT-5.5 搭配 Codex 的組合,並逼近 GPT-5.6 Sol 與 2.8T 參數的 Kimi K3。團隊也在held-out 的 NatureBench Lite 上驗證了遷移效果,顯示演化搜尋學到的策略並非只針對單一 benchmark 過擬合。
影響範圍
模型權重與完整 OpenMLE 堆疊已開源於 GitHub,並提供專案頁面。由於訓練與評測資源都公開釋出,這是目前少數把「AI 自動化 ML 工程」拆解成可重現算子與可驗證環境的公開研究,而非僅停留在論文層級的概念展示。