AI 前沿 2026 年 10 月 5 日

2026-10-05 — Kolibri-1 開放權重,78B MoE 只啟用 3.46B

primary=https://aleph-alpha.com/en/blog/kolibri-has-landed-a-sovereign-open-weight-model/ primary=https://huggingface.co/Aleph-Alpha/Kolibri-1 primary=https://github.com/Aleph-Alpha/aleph-alpha-inference

Kolibri-1 開放權重,78B MoE 只啟用 3.46B

Aleph Alpha · 2026-10-03(依 Hugging Face 模型卡 Release Date)

想在自家機房跑一個高階推理模型,過去多半得租海外 API,或扛起上百 B 參數稠密模型的 GPU 帳單;Kolibri-1 把這個選項換成「總參數 78B、每個 token 只啟用 3.46B」的 MoE 模型,權重以 Apache 2.0 釋出。發布者是德國的 Aleph Alpha,支援德文與英文,模型卡列出的發布日為 2026-10-03。

原本的問題

企業若有資料不能出境的限制,選項很窄:自架大型稠密模型,顯存與解碼成本都高;改用小模型,推理與 agent 能力又掉一截。長上下文更麻煩,KV cache 隨長度線性長大,併發請求一多就先爆顯存。

Aleph Alpha 的賣點是「主權」:官方文章把它定義為開發端全程可控(資料到評測都在歐洲與德國法律下進行,基礎設施位於德國與芬蘭),以及客戶端可在地部署、資料不必送給第三方服務。

這代表它不是單純把模型縮小,而是把「雙語」與「在地部署」當成設計條件:官方文章說預訓練語料中德文占 21.3%(4.3T tokens),其餘以英文與程式碼為主,目的是讓德文能力不是翻譯出來的附屬品。

核心改動

架構上有兩個決定影響部署成本。第一,50 層全是 MoE,每層 384 個 routed expert、每個 token 選 6 個,另有 1 個 shared expert,所以 78B 權重裡只有 3.46B 參與單 token 計算。第二,注意力混合:官方文章說 10 層用完整注意力,40 層用 512 token 的滑動視窗;模型卡寫法是 4:1 的 sliding-window GQA 對 full GQA。滑動視窗層的快取不隨長度增長,這是長上下文能壓住成本的來源。

  • 上下文:模型卡標示 1,048,576 tokens,原生為 262,144;訓練序列長度依序為 16k、64k、256k。
  • 預訓練:768 張 B200、21 天,模型卡記為 392k GPU 小時;詞表 128,000。
  • 後訓練:SFT 資料 268B tokens,之後在 120 萬以上的任務上做強化學習,涵蓋程式、數學、agent、工具呼叫。
  • 推理模式:可透過 chat template 設為 none、low、medium、high 四檔,用算力換品質。

跑起來需要什麼

權重是 FP8(128×128 區塊量化),模型卡列出約 78 GB 的記憶體佔用,建議配置為 2 張 H100 SXM5、2 張 H200、1 張 B200 或 1 張 B300,最低為 2 張 A100 80GB。官方文章稱兩張 H100 可同時處理 18 個 256k token 的請求,解碼比 123B 的對照模型快 28%。部署指令如下:

vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
  --reasoning-parser kolibri1 --tool-call-parser kolibri1
# 建議取樣:temperature=1.0, top_p=0.97, top_k=128

官方另提供 aleph-alpha-inference 套件與容器映像,vLLM 的 parser 需要靠它註冊。

基準表現

下表節錄官方與 Qwen3.6-35B 的對照,數字皆為廠商自家評測,非第三方複現:

項目KolibriQwen3.6-35B
GPQA Diamond (EN)84.383.4
AIME 2025 (EN)96.984.6
LiveCodeBench v685.982.5
Tau2-Bench (Telecom)94.799.1
BFCL v4 (overall)61.467.2
LongBench Pro64.570.8

另一個值得看的是事實依據(grounding):官方文章以 Merlin-Arthur 協定量測,Kolibri 的 M/A Grounding Score 為 0.23,Qwen3.6-35B 為 0.12,Nemotron 3 Super 為 0.00。AA-Omniscience Non-Hallucination 則是 Kolibri 44.0、Qwen3.6-35B 56.7,兩項指標方向不一致,所以不能直接說它比較不會幻覺。

數學與知識題領先,agent 工具呼叫與長文本題則落後 Qwen3.6-35B,對照可看出它的強項不是全面勝出。

影響範圍

有資料落地要求的團隊,例如德語區的金融、公部門或內部知識庫,可以直接評估這顆模型,因為德文基準(GPQA 81.3、AIME 2025 87.5)與英文差距不大。評估前先確認三件事:自家 GPU 是否達到 2 張 80GB 等級;若要用工具呼叫,得安裝 aleph-alpha-inference 才有 kolibri1 parser;以及模型卡註明 Apache 2.0 只涵蓋權重與設定檔,不含底層程式碼與架構,法務要看清楚這一條。

另外,模型卡記載的知識截止日為 2026-06-18(德英皆同),訓練總運算量為 6.4×1023 FLOPs、耗電約 950 MWh,這些數字可作為內部評估自行訓練或微調成本時的參照。

至於中文或其他語言的表現,官方文章與模型卡都只談德英兩種語言,未公布其他語言結果。

原始來源:Aleph Alpha 官方文章、Hugging Face 模型卡、aleph-alpha-inference


End of article
0
Would love your thoughts, please comment.x
()
x