瑞士100% 開源Apertus,叫板全球大模型

瑞士100% 開源Apertus,叫板全球大模型

  1. 背景與核心理念
    歐洲AI主權倡議:瑞士聯邦理工學院洛桑分校(EPFL)、蘇黎世聯邦理工學院(ETH Zurich)與瑞士國家超級計算中心(CSCS)聯合發布Apertus(拉丁語意為「開放」),旨在為歐洲提供「可信賴、主權、包容」的AI基礎,挑戰美國主導的AI格局(如GPT、Llama)。
    全端開源:從模型權重、架構、訓練程式碼到資料配方和完整文件全部公開,強調技術透明與倫理自主。
  2. 技術架構與效能
    模型配置:
    雙版本設計:80億參數(8B)輕量版與700億參數(70B)高效能版,後者針對科學研究與商業場景。
    核心技術:採用純解碼器Transformer架構,搭配新型xIELU激活函數、AdEMAMix優化器,並透過監督微調(SFT)和QRPO對齊優化。
    長上下文支援:65,536 tokens窗口,擅長處理複雜任務與工具呼叫。
    訓練資料:
    規模與合規性:15兆tokens,來自明確允許爬取的公開數據,嚴格過濾個人隱私與不當內容,支援資料刪除請求。
    多語言涵蓋:支援1811種語言(40%非英語),顯著優於英語中心的美國模型。
    算力支援:依托瑞士Alps超算中心,使用4096塊英偉達GH200 GPU訓練。
  3. 開源與合規優勢
    徹底透明:在Hugging Face公開所有資源(包括檢查點、資料腳本、技術報告),並附上歐盟AI法案合規文件。
    責任架構:商用需簽署協議以防止濫用,平衡開源自由與倫理約束。
    法律風險規避:資料來源可追溯,避免美國模型因版權/隱私訴訟(如《紐約時報》訴OpenAI)的爭議。
  4. 性能表現
    評測結果:
    70B版本與Meta的Llama 3-70B持平,略遜於Qwen2.5-72B,但超越Mistral、OLMo2等開源模型。
    多語言任務表現突出,獲Hugging Face研究主管認可為「開源新里程碑」。
  5. 產業反應與挑戰
    支援方:
    金融與製造業:瑞士銀行看好其資料主權潛力;Swissmem認為其更適合歐洲法規。
    開發者社群:讚賞多語言支援與透明性,但70B版本硬體要求高,中小企業部署需依賴雲端服務。
    質疑方:
    商業落地:如瑞銀集團(UBS)仍傾向與OpenAI合作,反映成熟方案的優先選擇。
  6. 戰略意義
    歐洲AI自主權:Apertus被視為對抗美國科技壟斷的標桿,符合歐盟《2024年AI法案》嚴苛要求。
    長期承諾:團隊強調此為“開放AI生態的起點”,將持續推進可信賴技術基礎。
    關鍵圖片與數據
    模型比較圖(見上文)清楚展示Apertus在參數、多語言支援與開源程度上的差異化優勢。
    參考資料:
    ETH Zurich官方新聞| Hugging Face模型頁| 技術報告