AI 風向標|The Stack v3 發布:開放程式碼訓練資料進入多兆 token 規模
The Stack v3 發布:開放程式碼訓練資料進入多兆 token 規模
Hugging Face Code 發布 The Stack v3,將可用於程式碼模型預訓練的資料集擴展到約 15.9 TB、713 種程式與標記語言,約含 4.9 兆 token。資料集卡指出,它直接爬取 GitHub 儲存庫,並提供含完整儲存庫內容的訓練子集;完整語料則涵蓋約 224 百萬個儲存庫與 770 種語言。
與前一版本相比,v3 的實用改變在於內容可直接取得、以儲存庫為單位整理,並在訓練子集加入近似去重、品質篩選與個資刪除處理。獨立報導將其視為開放程式碼資料規模的重要升級,但資料集本身並不自動解決模型訓練中的授權、資料治理與評估問題。
對訓練開放程式碼模型的團隊而言,這提供了可重現性較高的大型資料基礎;然而不應直接下載整套資料就投入訓練。較務實的做法是先以特定語言分區或代表性樣本測試,檢查授權條件、敏感資料處理與下游基準表現。需要自訂去重或篩選策略時,應特別區分已處理的 train 集與未經相同處理的 full corpus。