2026年10月11日 · 星期日 免費實用生活資訊 · 每日更新
DB3 DB3HK 免費精選實用資訊

每日精選內容,看完就明白、知道下一步

科技數碼

Aleph Alpha 的 Kolibri 是什麼?為什麼權重可以自己帶走?

德國實驗室 Aleph Alpha 在 10 月 3 日公開 Kolibri。它是英德雙語的混合專家模型,總參數 781 億,每個 token 只啟用約 34.6 億。完整權重以 Apache 2.0 放在 Hugging Face,機構可以下載到自己的機器上跑,內部文件不必送到別人的推論服務。

Kolibri 實際交出了什麼

官方網誌的日期是 10 月 3 日,當天是德國統一日。實驗室把這次發布寫成「Kolibri 落地」:一個為公共行政、工業和航天這類受監管工作而做的模型,重點是可以在客戶自己的機房裡跑。

網誌開頭把規模寫成約 780 億參數、約 30 億啟用。同一頁的對照表更細:總參數 781 億,每個 token 啟用 34.6 億。知識截止日,英德都是 2026 年 6 月 18 日。推理力度分四檔:不推理、低、中、高,用來在費用、速度和答案質量之間取捨。

預訓練在 9 月 11 日完成,用了約 20 萬億 token。德文佔預訓練的 21.3%;翻譯文本只佔整體約 6%,其餘德文來自網頁、改寫和公開文獻。前一個內部模型 Kolibri Origin(總參數 306 億、啟用 32.7 億)在 6 月 11 日完成預訓練,沒有公開發布。Kolibri 才是這次放到 Hugging Face 的版本,倉庫名是 Aleph-Alpha/Kolibri-1。

項目 實驗室自己的數字
總參數/每個 token 啟用 781 億/34.6 億
預訓練 token 約 20 萬億
預訓練序列長度 16,384
訓練到的最長上下文 262,144(約 26 萬)
網誌寫的可用上限 最多 100 萬 token
知識截止 2026 年 6 月 18 日
授權與發布日 Apache 2.0;2026 年 10 月 3 日

一百萬 token 和訓練長度要分開看

網誌第一段寫,Kolibri 支援最長 100 萬 token 的上下文。對照表裡,訓練到的最長長度是 262,144,也就是約 26 萬;預訓練階段的序列長度只有 16,384。後文把訓練拆成三段:16k 長度的預訓練、64k 的中段,以及 256k 的長上下文適配。三段加起來接近 24 萬億 token。

所以「支援 100 萬」和「訓練到 26 萬」是兩句不同的話。拿它來塞很長的卷宗之前,要先看技術報告裡這段長度是怎樣接上的,不能把兩個數字收成同一個。

實驗室還寫,預訓練用了 768 張 B200,21 天裡有 38 次計劃外中斷,由流程自動從檢查點續跑。這是他們自己的工程紀錄。

主權指的是哪兩件事

網誌把主權寫成兩件一起成立的事。第一件是模型怎樣建成:在德國設計,在德國和芬蘭的基礎設施上訓練,適用歐洲和德國法律,資料篩選、預訓練、後訓練到評估都在自己的流程裡。第二件是怎樣交到客戶手上:完整權重可以帶走,在自己的機器上部署,內部文件不用送到第三方推論服務。模型體積小,是為了讓這件事在機房裡負擔得起。

他們同時寫,訓練時考慮了歐盟人工智能法案、通用人工智能行為守則和 GDPR,並用一套叫 Merlin-Arthur 的方法,讓模型在上下文裡找不到根據時改口說不知道。這是實驗室的設計說明。權重開放,不代表每一間機構下載之後就自動符合自己行業的法規。

分數是實驗室自己的表

公開基準也是 Aleph Alpha 貼出來的。同一張表上,AIME 2025 是 96.9、AIME 2026 是 96.0、GPQA Diamond 是 84.3、LiveCodeBench v6 是 85.9、BFCL v4 是 61.4。對照欄包括 Qwen3.6-35B-A3B、Nemotron 3 Super 和 Mistral Small 4。網誌說,在數學、程式、依據原文作答和長上下文上,它對得上啟用參數多達四倍的模型。這些比較的跑分設定,以技術報告為準。

另外還有一組內部的行業代理測試,涵蓋德國公共部門、航空、製造和汽車供應鏈。那些升降是實驗室的客戶代理分數。南德意志報同日引德新社報道,Kolibri 面向公共行政和工業,客戶自己掌握基礎設施。這句和網誌的部署方式一致,沒有另外公布新的參數。

Ai2 的 AstaBrief 是另一種開放

Allen Institute for AI 在 10 月 2 日公開 AstaBrief。這是一個 80 億參數的模型,起點是 Qwen3-8B,做的事很窄:拿到一個研究問題和已經檢索到的文獻摘錄,一次過寫成一篇帶引用的報告。權重在 Hugging Face 的 allenai/AstaBrief_8B,訓練資料一併放出。Asta 產品裡,Fast 模式用這個模型,Thinking 模式仍用 Claude。

他們給出的速度是整條 Asta 流程的平均:Fast 51.1 秒,Thinking 178.5 秒,大約快 3.5 倍。同一段還有「相對所追蹤的專有模型接近一個數量級」的說法,那個倍數和 3.5 倍是兩句不同的比較,要分開看。機構也寫明,大部分訓練和評估在 2025 年完成,還沒有拿今天的前沿模型重跑全套測試。

Praxis-1 的權重還沒有放出來

Runway 的研究頁在 9 月介紹 Praxis-1,稱為開放權重的世界動作模型,把影片預訓練轉成機械人控制,並與 Noble Machines、Standard Bots、Ultra 等早期夥伴在不同機體上測試。頁面寫公開發布在「未來數月」。權重現在下載不到,不能寫成已經發布。

公司稱,在自己的世界模型裡模擬策略,和真實世界結果的相關性是 0.95。這是 Runway 的數字。機器人媒體 The Robot Report 在 10 月 2 日轉述了同一項發布,沒有改寫「權重尚未公開」這一句。

相關討論

總結

這輪最值得先讀的仍是 Kolibri:權重已經可以下載,參數、訓練長度和授權都寫在實驗室自己的網誌和表上。AstaBrief 是 10 月 2 日的另一個開放模型,Praxis-1 的權重則還沒有放出來。三則的日期和「能不能下載」都不一樣。

Newsletter · 免費通訊

最新資訊寄到你郵箱。

最新資訊,完全免費,一鍵退訂。

FREE FOREVER · NO SPAM · UNSUBSCRIBE ANYTIME