微軟公開 AX Playbook:用評測取代猜測,檢驗 coding agent 懂不懂你的產品
Microsoft Developer Blog(Waldek Mastykarz)· 2026-10-09
判斷 AI coding agent 懂不懂你的技術,微軟給出的方法不再是看模型的 knowledge cutoff,而是自己設計任務、跑評測、再依結果修補文件與工具。這套方法整理成 Agent Experience(AX)Practitioner Playbook,可從 aka.ms/ax-playbook 下載。
作者是 Microsoft 的 Principal Developer Advocate Waldek Mastykarz,文章發表於 2026-10-09,工作自 2025 年秋季開始。
原本的問題
多數團隊挑選或設定 agent 時,會看模型的 knowledge cutoff,再替 cutoff 之後的版本補文件。同一位作者在先前的實驗中指出,cutoff 是很差的代理指標。
實驗拿 GPT-5.6 Luna(OpenAI 標示 cutoff 為 2026-02-16)測 Dev Proxy 與 SharePoint Framework(SPFx),移除文件與網路搜尋,由 changelog 產生任務。Dev Proxy 的 336 題只通過 61 題(18%),SPFx 的 413 題通過 61 題(15%)。
| 項目 | 結果 |
|---|---|
| Dev Proxy | 53 個版本,61/336 通過;模型的知識邊界約在 0.29.0,比 cutoff 早約八個月 |
| SPFx | 40 個版本,61/413 通過;沒有乾淨的分界版本 |
| cutoff 之後 | Dev Proxy 2.3.4、3.0.0、3.1.0 各通過 2 題中的 1 題 |
錯誤也不一定是「不知道」:Dev Proxy 0.5.0 的可執行檔,模型答 devproxy,實際是 mgdp。看似合理的錯答比空白更難被發現。
Playbook 的做法
Playbook 描述一次評測「從設定到修復上線」的流程,頁面並未列出編號步驟,只列出涵蓋範圍:
- 可辯護的結果:結果要先具備什麼條件才能採信,從判斷語意的準則到證明程式能跑的關卡。
- 準則設計:撰寫讓 judge 判定一致的準則、校準、版本化,並避免讓模型替你寫準則。
- 由症狀推原因:區分三種情況,擴充從未載入、已載入但從未被呼叫、已呼叫但用錯。
- 能上線的修復:把每個修改當成假設來測,再拿證據找擁有該技術的團隊。
範例涵蓋 Azure Cosmos DB、SPFx 等技術,另附自我檢查用的品質清單。文章稱在評測過的技術中,反覆出現 九種失敗模式,但摘要頁面未逐一列出內容。
影響範圍
最直接的是維護 SDK、CLI、框架或 agent 擴充(skills、MCP 等)的團隊:你的文件與擴充是否真的被 agent 載入並正確套用,可以用這套流程量測。文章以 Azure Cosmos DB Agent Kit 的 46 項改進作為成果。
其次是導入 coding agent 的內部平台團隊:不必先找出模型的 cutoff 版本再替之後的一切補文件,而是用自己工作負載的代表性任務,在不提供額外產品知識的情況下測模型,只在出現缺口時補文件。這是前述實驗的建議,Playbook 是它的完整版本。
微軟另提供 AX Practitioner skill,文章稱它回答了 330 題,平均與 Playbook 的一致度為 95%;評測方式與題目來源,文章摘要頁未說明。
Playbook 是微軟內部方法的公開版本,是否適用於你的技術,仍需自行評測;文中數字多來自微軟自家產品。