AI 風向標|28.9M 參數模型跑上 ESP32-S3:邊緣推論的記憶體配置實驗

28.9M 參數模型跑上 ESP32-S3:邊緣推論的記憶體配置實驗

開源專案 esp32-ai 展示了一個 28.9M 參數的語言模型,能在 ESP32-S3 開發板本機生成短篇文字,不需要把內容送到雲端。專案文件指出,測試硬體為具 16MB Flash 與 8MB PSRAM 的 ESP32-S3,端到端速度約為每秒 9.5 個 token;這些數字是專案作者公布的實測結果,並非通用 ESP32 都能達到的規格。

關鍵不在於把完整 Transformer 權重塞入 SRAM,而是重新安排不同類型權重的位置。作者把約 2,500 萬個 Per-Layer Embeddings 放在記憶體映射 Flash,將每個 token 需要頻繁運算的緊湊核心留在較快的記憶體,並以 4-bit 量化降低模型檔案大小。XDA 的獨立報導也確認,該設計以 Flash 中的大型查表結構換取有限的工作記憶體需求。

這項成果較適合視為記憶體階層與離線推論的工程示範,而不是可取代雲端助理的通用模型。它以 TinyStories 資料訓練,能產生簡短故事,但不具備問答、程式設計或可靠知識檢索能力。對物聯網、教育硬體與網路受限裝置而言,價值在於證明:若任務可以接受窄領域能力,模型的部分容量可放到較慢的儲存層,讓低成本硬體保留本機處理與資料不離開裝置的優點。

來源