Qwen3.8-27B 發布:混合 DeltaNet 注意力架構搭配原生 FP8 量化,單一模型撐起百萬 token 上下文
huggingface.co · 8 小時前
阿里巴巴 Qwen 團隊在 Hugging Face 上架了 Qwen3.8-27B-FP8,這是建構在 Qwen3.5 架構之上的新一代開源模型,原生以區塊大小 128 的細粒度 FP8 量化釋出,號稱效能幾乎與未量化版本持平。這不是單純的模型升級,而是把注意力機制本身換掉一部分,改用線性複雜度的 Gated DeltaNet 與傳統 Gated Attention 交錯堆疊。官方模型卡也一併公布了架構細節與多項 agentic benchmark 成績。
背景:為什麼要混合兩種注意力
純 Transformer 的自注意力機制在超長上下文下,運算量會隨序列長度平方成長,這也是多數模型難以把上下文推到百萬 token 等級的主因。Gated DeltaNet 是一種線性注意力變體,用固定大小的狀態矩陣取代逐 token 的 KV cache 累積,換取近似線性的推論成本。Qwen3.8 並沒有整個模型都換成 DeltaNet,而是每 16 層裡安排 3 層 DeltaNet 接一次標準 Gated Attention,形成 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)) 的重複區塊。
這種安排讓模型大部分時間用便宜的線性層處理局部與中距離依賴,再用少量全域注意力層補回長距依賴的精確度。官方將原生上下文長度定在 262,144 token,並宣稱可外推到 1,000,000 token,這在 27B 這個參數量級並不常見。
核心改動:架構與量化細節
模型本體為 27B 參數、64 層、隱藏維度 5,120。Gated Attention 層使用 24 個 query head 搭配 4 個 KV head,head 維度 256;Gated DeltaNet 層則是 48 個 value head、16 個 QK head,head 維度 128。FFN 中間維度為 17,408。訓練時採用 Multi-Token Prediction(MTP),一次預測多個未來 token 以加速訓練收斂並提升推論時的投機解碼效率。
- 參數量:27B,64 層,隱藏維度 5,120
- 量化:細粒度 FP8,區塊大小 128
- 原生上下文:262,144 token,可外推至 1,000,000 token
- 推理模式:預設開啟思考模式,可透過
reasoning_effort參數調整思考深度 - 授權:Apache 2.0
模型延續多輪對話間保留思考鏈的設計,讓 agent 類任務在多步驟互動中不必每次重新推理上下文。視覺語言理解同時支援圖片與影片輸入,對照前代 Qwen3.6 擴大了多模態涵蓋範圍。
影響範圍:效能數字與部署方式
模型卡列出的幾項 benchmark 顯示其在 agentic coding 與電腦操作類任務上的表現:
| 測試項目 | 成績 |
|---|---|
| SWE-bench Pro(agentic coding) | 61.7% |
| OSWorld-Verified(電腦操作) | 84.3% |
| MathVision(視覺數學) | 94.6% |
| LiveCodeBench v6 | 90.3% |
部署方面官方建議透過 SGLang、vLLM 或 TokenSpeed 這幾個推論框架載入,並提供與 OpenAI Chat Completions 相容的 API 介面,也可經由 Qwen Cloud 直接呼叫。HN 討論串中有使用者實測指出,27B 稠密模型在 27B 這個量級下,速度明顯慢於同期的 MoE 版本 Qwen3.6-35B-A3B(4–5 tokens/s 對比 20+ tokens/s),但推論品質與長上下文穩定性換取了這個代價。
密碼學家警告:AI 把好抓的漏洞抓光後,執法機關反而會回頭要求後門
blog.cryptographyengineering.com · 2026-08-14
密碼學家 Matthew Green 在部落格發表〈Everything is about to "go dark"〉一文,指出 AI 驅動的漏洞挖掘工具正快速清空軟體中「容易被利用」的臭蟲存量,而這件事的後果和大家直覺想的相反:它不會讓執法機關安心,反而會重新點燃要求加密後門的壓力。這篇文章把「Going Dark」這個沿用超過十年的爭論,放進 2026 年 AI 找漏洞的新現實裡重新檢視。
背景:Going Dark 爭論的十年脈絡
「Going Dark」一詞可追溯到 2014 年,時任 FBI 局長 Comey 發起倡議,要求就服務商配合執法調查的義務展開全國性對話。真正的轉捩點在 2016 年 Apple 與 FBI 的 iPhone 解鎖爭議:一家外部公司證明無需 Apple 配合也能破解該款 iPhone,執法機關因此發現不必靠立法逼供應商裝後門。
此後執法單位改走市場路線,直接向商業廠商採購攻擊工具,例如 GrayKey 和 NSO Group 的 Pegasus。Green 指出,這套「用錢買漏洞利用能力」的模式運作了將近十年,前提是軟體世界裡永遠有足夠多可被利用的漏洞可以買。
核心論點:AI 正在抽乾漏洞庫存
文章點名 Anthropic 在 2026 年 4 月發布的漏洞挖掘模型 Mythos 是這波轉變的關鍵。美國政府一度限制該模型出口到國內機關使用,但 Green 認為這類管制形同虛設,因為 OpenAI、Z.ai、Moonshot 等競爭者已經展示出相近的漏洞挖掘能力,代表這項能力不會被單一機構壟斷。
Green 描述的現象是防守方正在「補上數十年份的舊漏洞」,開發流程也開始內建 AI 漏洞掃描作為標準環節。他預測兩年內,主流軟體很可能會用光容易被遠端利用的漏洞,這正是「go dark」一詞在這篇文章裡的真正意涵——不是加密讓執法看不到,而是攻擊面本身消失了。
影響範圍:後門壓力與地緣風險
Green 認為,一旦商業駭客工具失效,執法與情報機關「更迫切需要」替代方案的壓力會急遽升高,而最直接的替代方案就是要求廠商在系統裡刻意設計後門。他警告這類後門通常只會出現在美製系統裡,結果是外國對手得到新的攻擊入口,而美國自身的基礎設施安全在關鍵的現代化階段反而被削弱。
文章沒有提出解方,Green 坦承自己也不確定該如何在「軟體變得更安全」與「政府因此更想要例外存取權」這組矛盾之間找到出路。HN 討論串裡也有人質疑前提本身,認為 AI 一邊修漏洞、一邊也在擴大攻擊面(例如 AI 生成程式碼帶來的新漏洞類型),兩股力量互相抵銷的速度未必如文章樂觀。
原始來源:Everything is about to "go dark"(Matthew Green)、Hacker News 討論串
逐條拆解 RISC-V:硬體工程師 Dmitry.GR 認為這個指令集「早該做得更好」
dmitry.gr · 29 分鐘前
長期撰寫底層硬體與韌體文章的 Dmitry.GR,發表長文〈RISC-V: They should have known better〉,逐項檢視 RISC-V 指令集的設計決策。他的核心立場是 RISC-V 會拿下便宜微控制器市場,不是因為指令集設計得好,而是儘管設計有問題,靠核心授權免費這件事贏下市場。文章列出多項具體技術缺陷,並與 x86、ARM、MIPS 做逐一對照。
指令編碼:立即值位置散亂
作者指出 MIPS 的立即值固定放在第 0–15 位元,查表即可解碼;RISC-V 卻把立即值的位元拆得七零八落,例如 J-type 立即值的位元順序是 20 10 9 8 7 6 5 4 3 2 1 11 19 18 17 16 15 14 13 12,I/S/B/U 幾種指令格式又各自把同樣的位元擺在不同位置。RISC-V 官方文件解釋這是為了讓「立即值的相同位元來自指令的相同位元」,作者認為這個理由站不住腳,因為硬體多工器本來就不在乎訊號實際走線位置。
16 位元壓縮指令(C 擴充)問題更嚴重:九種不同編碼格式,每種指令的立即值都各自打散,例如 C.J 的立即值順序是 11 4 9 8 10 6 7 3 2 1 5。作者的評語是「幾乎一種指令一種編碼格式」。
缺少的常用指令與中斷開銷
文章分析一份 ARM64 核心映像(vmlinuz-6.1.0-49)發現 bit-test-and-branch(TBZ/TBNZ)出現 35,393 次,平均每個函式兩次;RISC-V 沒有對應指令,得靠 SLLI 加 BGEZ/BLTZ 湊出來,還得多佔一個暫存器。同一份映像裡 BFI/BFE(bitfield 插入/擷取)合計出現超過 1.5 萬次,RISC-V 需要 3–6 條指令模擬,作者認為這種操作用硬體實作「不過是幾條線」。陣列存取常用的 [reg + reg×scale] 定址模式(ARM 的 LSL #2、x86 的 ebx + esi×4)RISC-V 同樣沒有,得拆成位移、加法、載入三條指令。負責補這個洞的 Zba 擴充,在基礎規格發布兩年多後才推出,而且組出來的指令仍比 ARM 多花一倍位元組。
中斷處理的開銷也被拿來跟 ARM Cortex-M0 對比:
| 項目 | RV32I + Zicsr | Cortex-M0 |
|---|---|---|
| 進入中斷(儲存暫存器) | 21 週期 | 15 週期(硬體自動堆疊) |
| 離開中斷(還原暫存器) | 20 週期 | 12 週期 |
| 總開銷(含呼叫/返回) | 44+ 週期 | 27 週期 |
作者解釋根本原因是 RISC-V 沒有預留給中斷處理的暫存器(MIPS 有 $k0/$k1),得靠 CSR 暫存中間值,但 CSR 支援本身還是選配的。
選配過度導致的相容性災難
文章批評最重的一點是 RISC-V 把幾乎所有東西都設計成可選:乘除法、使用者/監督模式、CSR 全部選配,連唯一標準化的中斷處理機制(透過 Zicsr 擴充的 CSR)本身也是選配的。功能偵測用的 misa 暫存器同樣選配,而且回傳全零也算合規實作;更麻煩的是 misa 只能在 machine mode 讀取,監督模式或使用者模式的程式碼完全無法查詢自己執行在什麼樣的核心上。
實際後果是:想寫一個能在「所有」RISC-V 核心上跑的作業系統幾乎不可能——測試監督模式是否存在會在監督模式不存在時直接失敗,讀 misa 又只能在監督模式不存在時才有意義,靠捕捉例外來試探支援了哪些 CSR,又得先知道有哪些 CSR 可能存在。作者也舉出 0xA002 這串位元組為例:視核心是否支援 D 與 Zcmp 擴充,它可能被解讀成浮點數存指令,也可能是無條件跳躍指令,兩種擴充彼此不相容卻同時被宣傳為「可選功能」,一旦搭配錯誤,暫存器會被靜靜地覆寫且不會觸發任何例外。
結語:市場勝利不等於設計勝利
作者總結,RISC-V 會在低價微控制器領域打敗 8051 這類老架構,但原因是核心授權免費、生態系願意投入,而非指令集本身設計優良。文章也提到蘋果內部針對 AArch64 的建模顯示,類似 RISC-V 壓縮指令的 Thumb 編碼,在指令每瓦效能上其實是淨損失,對高效能亂序執行核心而言,固定長度的 4 位元組指令(如 AArch64、MIPS)更利於平行解碼多條指令。HN 討論串上有人建議乾脆用 RISC-V 當「反面教材」,另起爐灶做一個修正過這些缺陷的社群版本;也有人以 MIPS 為例反駁,認為任何指令集在成熟之前都容易被嫌棄。
原始來源:RISC-V: They should have known better(Dmitry.GR)、Hacker News 討論串