瑞士100% 開源Apertus,叫板全球大模型
瑞士100% 開源Apertus,叫板全球大模型
- 背景與核心理念
歐洲AI主權倡議:瑞士聯邦理工學院洛桑分校(EPFL)、蘇黎世聯邦理工學院(ETH Zurich)與瑞士國家超級計算中心(CSCS)聯合發布Apertus(拉丁語意為「開放」),旨在為歐洲提供「可信賴、主權、包容」的AI基礎,挑戰美國主導的AI格局(如GPT、Llama)。
全端開源:從模型權重、架構、訓練程式碼到資料配方和完整文件全部公開,強調技術透明與倫理自主。 - 技術架構與效能
模型配置:
雙版本設計:80億參數(8B)輕量版與700億參數(70B)高效能版,後者針對科學研究與商業場景。
核心技術:採用純解碼器Transformer架構,搭配新型xIELU激活函數、AdEMAMix優化器,並透過監督微調(SFT)和QRPO對齊優化。
長上下文支援:65,536 tokens窗口,擅長處理複雜任務與工具呼叫。
訓練資料:
規模與合規性:15兆tokens,來自明確允許爬取的公開數據,嚴格過濾個人隱私與不當內容,支援資料刪除請求。
多語言涵蓋:支援1811種語言(40%非英語),顯著優於英語中心的美國模型。
算力支援:依托瑞士Alps超算中心,使用4096塊英偉達GH200 GPU訓練。 - 開源與合規優勢
徹底透明:在Hugging Face公開所有資源(包括檢查點、資料腳本、技術報告),並附上歐盟AI法案合規文件。
責任架構:商用需簽署協議以防止濫用,平衡開源自由與倫理約束。
法律風險規避:資料來源可追溯,避免美國模型因版權/隱私訴訟(如《紐約時報》訴OpenAI)的爭議。 - 性能表現
評測結果:
70B版本與Meta的Llama 3-70B持平,略遜於Qwen2.5-72B,但超越Mistral、OLMo2等開源模型。
多語言任務表現突出,獲Hugging Face研究主管認可為「開源新里程碑」。 - 產業反應與挑戰
支援方:
金融與製造業:瑞士銀行看好其資料主權潛力;Swissmem認為其更適合歐洲法規。
開發者社群:讚賞多語言支援與透明性,但70B版本硬體要求高,中小企業部署需依賴雲端服務。
質疑方:
商業落地:如瑞銀集團(UBS)仍傾向與OpenAI合作,反映成熟方案的優先選擇。 - 戰略意義
歐洲AI自主權:Apertus被視為對抗美國科技壟斷的標桿,符合歐盟《2024年AI法案》嚴苛要求。
長期承諾:團隊強調此為“開放AI生態的起點”,將持續推進可信賴技術基礎。
關鍵圖片與數據
模型比較圖(見上文)清楚展示Apertus在參數、多語言支援與開源程度上的差異化優勢。
參考資料:
ETH Zurich官方新聞| Hugging Face模型頁| 技術報告

