平行迭代記憶:把長文本推理一口氣推向 360 萬 token
arxiv.org (cs.CL) · 2026-08-05
逐塊循序處理長文件時,模型容易在後段遺漏前段證據,而且逐塊之間的序列依賴讓平行化無從談起。PI-Mem(Parallel-Iterative Memory)反其道而行:讓所有文本段在同一輪同時被讀取,再把各段抽取出的證據匯總進一份共享記憶,供下一輪使用。這套架構讓上下文長度一路擴展到360 萬 token,同時準確率不降反升。
核心方法
每一輪迭代中,PI-Mem 讓模型以目前的記憶狀態同時讀取全部文本片段,從每一段抽取與問題相關的證據,再把這些發現壓縮進一份精簡記憶,作為下一輪的輸入。這種平行讀取、迭代精煉的設計取代了傳統的逐塊序列掃描,讓多個片段的證據抽取可以同時進行而不必互相等待。
為了避免模型做多餘的迭代輪次,作者引入了帶有輪次效率獎勵(turn-efficiency reward)的強化學習,讓模型自行判斷何時已蒐集到足夠資訊、可以提前停止,而不必跑滿固定輪數。這個機制同時控制了推理成本與答案品質。
實驗結果
在 HotpotQA 上,Qwen3.5-35B 搭配 PI-Mem 準確率提升 6.25 個百分點,Qwen2.5-7B 提升 7.81 個百分點。推理速度方面,35B 模型加速 6.1 倍,7B 模型加速 2.1 倍。作者指出,這打破了長文本推理中常見的「準度換速度」取捨——PI-Mem 在把上下文推向 360 萬 token 規模的同時,準確率與效率同步提升。
原始來源:arXiv:2608.03048
KV Cache 壓到 2-bit:先找對該優化的誤差,旋轉矩陣才有意義
arxiv.org (cs.LG) · 2026-08-05
長上下文 LLM 推理時,KV cache 已成為記憶體與頻寬的主要瓶頸,把它壓到 INT2 這種極低位元格式因此愈發重要。既有的 rotation-based INT2 量化方法(如 QuaRot)在完整的 attention 讀出結果出現之前,就先針對 cache 本身的統計量做優化,但模型的實際輸出品質其實取決於誤差經過 attention 與輸出投影層傳遞之後的樣子。OptR(Output-Aware Rotation)正是針對這個被忽略的環節重新設計旋轉矩陣。
背景:優化目標選錯了位置
作者指出,現有 rotation-based INT2 方法的問題不在旋轉本身,而在優化目標的位置:它們把旋轉矩陣調整到讓量化前後的 cache 數值差異最小,卻沒有考慮這些誤差進入 attention softmax 與輸出投影後會如何被放大或抵銷。這種「前置」優化與模型真正在意的「輸出端」誤差之間存在落差。
核心方法
OptR 改為直接最小化輸出投影之後的 attention 誤差,並將這個誤差拆解為 key 與 value 兩個分量分別處理。針對每個注意力頭,模型學習一組正交(orthogonal)修正矩陣,這組矩陣是貫穿完整的 INT2 量化與 attention 計算流程訓練出來的,而非事後校正。
- 拆解 attention-output 誤差為 key 分量與 value 分量分別優化
- 逐頭(per-head)學習正交旋轉修正,納入下游誤差傳遞的考量
- 套用「attention 等效的 key 重參數化」,縮小 channel-wise 的數值偏移,且不改變 softmax 的分布
實驗結果
作者在 Llama-2-7B、Llama-2-13B 與 Qwen-7B 上進行 INT2 KV cache 量化實驗,並以 LongBench 與 RULER 兩個長上下文基準測試長程檢索能力。結果顯示 OptR 相較 QuaRot 與 OSCAR 兩個既有方法均有提升,且能強化長上下文檢索表現,同時額外推理開銷極小,並維持與現有 paged KV-cache 格式相容。
原始來源:arXiv:2608.02691
讓 LLM 讀懂行為序列:SeqLLM 如何在微信支付揪出高風險商戶
arxiv.org (cs.CL) · 2026-08-05
大型支付平台每天要篩查數千萬商戶,誤判會傷害合法商戶,漏判則放行詐騙行為,最難處理的案例往往需要同時理解商戶的文字檔案與長期行為序列。LLM 擅長文字理解,卻無法原生建模這類序列資料,強行微調又容易導致災難性遺忘(catastrophic forgetting)。SeqLLM 用三個組件把行為序列建模能力接上既有 LLM,並在微信支付的生產環境中把篩查 precision 從 92.0% 推升到 97.5%。
核心方法
SeqLLM 由三部分組成。首先是一套精簡的離散詞彙表,把商戶的行為事件(如交易、操作紀錄)編碼成 LLM 可以原生處理的 token,而不是額外接一個獨立的序列編碼器。其次是一個輕量的投影器(projector),透過兩階段對齊課程(two-stage alignment curriculum)訓練,把這些行為 token 對齊進 LLM 原本的語意空間。
第三個組件是前綴引導的能力注入(prefix-guided capability injection):模型不靠持續預訓練(continual pre-training)來學會處理序列,而是透過帶任務前綴的監督微調(task-prefixed supervised fine-tuning)取得序列建模能力。這個設計是 SeqLLM 用來避免遺忘既有語言能力的關鍵。
實驗結果
在微信支付的生產系統中,SeqLLM 相較原本以 DeepSeek 為基礎的線上模型,把篩查 precision 從 92.0% 提升到 97.5%;在十億規模的交易流量中,行為 token 嵌入讓 Precision@Top-0.01% 提升了 26.8 個百分點。
- 公開推薦資料集 MovieLens / Amazon:相對 Recall@5 較 User-LLM 基準最多高出 32%,同時保留更強的語言能力
- RecIF 基準:Pass@32 較完整版 OneRec-8B pipeline 提升 14.2%,且只用五分之一的運算資源
原始來源:arXiv:2608.03063