Ai2 開源 8B 模型 AstaBrief,一次生成帶引用的研究報告
Ai2 blog · 2026-10-02
Ai2 把 Asta 研究助理裡「逐段推理、逐段生成」的報告流程,壓成一個 8B 開源模型 AstaBrief-8B,改成單次輸出整份帶引用的報告。權重以 apache-2.0 釋出,可下載在本機執行。
模型由 Qwen3-8B 微調而來,輸入是研究問題加上已檢索到的文獻片段,輸出是附引用的報告。
原本的問題
Asta 原有的 Thinking 模式比較慢,部落格也拿 Claude 驅動的流程當對照組。AstaBrief 的訓練資料就是用 Claude 3.5 Sonnet、Claude 3.7 Sonnet、o3、o4-mini、GPT-4.1 等生成,換句話說,好的結果過去綁在閉源 API 上。
對研究者來說有兩個痛點:等待時間長,而且資料與問題必須送出去。部落格的數字顯示,Fast 模式平均 51.1 秒出一份報告,Thinking 模式為 178.5 秒,約快 3.5 倍。
核心改動
訓練分兩階段:先用 47,000 筆 SFT 範例做監督微調,再用約 6,000 組 DPO 偏好對做偏好最佳化。兩者都來自 90,000 筆過濾後的研究查詢。
資料品質靠過濾控制。引用部分套用四項統計過濾:
- 輸出與輸入的 token 比例
- 引用相關度
- 引用密度
- 引用多樣性
DPO 偏好對由 GPT-4.1 與 DeepSeek-R1 兩位評審都同意才採用,部落格稱這組評審與人類偏好有 95% 的一致性。生成端除了上述模型,還加入 DeepSeek-V3、DeepSeek-R1。
| 項目 | 舊流程(Thinking) | AstaBrief(Fast) |
|---|---|---|
| 生成方式 | Thinking 模式 | 單次輸出整份報告 |
| 平均耗時 | 178.5 秒 | 51.1 秒 |
| 模型取得 | 經由 Asta 服務 | 可下載權重本機執行 |
評估結果
評估指標有四項:rubric 分數(內容涵蓋)、答案精確度、引用精確度、引用召回率。模型卡在 ScholarQA-CS2 測試集上列出引用精確度 90.5%、引用召回率 78.2%,整體平均 87。
部落格表示,LLM 評審下的表現與 Claude 驅動的流程及 DR Tulu 相當。人工評估只有 14 題、3 位研究者,其中兩位在引用準確度上偏好 AstaBrief,樣本很小,只能當參考。
使用數據方面:374 位 Asta 使用者中,29.1% 使用超過兩天;試過 Fast 模式的人裡,23% 之後沒再切回去。
影響範圍
自架 RAG 的團隊可以把它放在檢索之後,取代呼叫閉源 API 的「整理成報告」那一步。前提是你的檢索端要能提供文獻片段與章節參照,因為模型卡明說要用同一份提示格式,換格式「可能導致行為退化或不一致」。
非資訊科學領域的使用者要小心:模型卡指出評估只針對電腦科學研究問題,跨領域表現未公布。訓練時最大序列長度為 16000,檢索片段過多的長輸入需要自行截斷或分批。
資料也一併釋出,放在 Hugging Face collection,工作流程範例在 ai2-scholarqa-lib。想復現或換底模做蒸餾的人可以直接從這裡開始。