陽明交大突破大型語言模型推論瓶頸
端對端 LLM 邊緣 AI 晶片讓生成式 AI 走出雲端、走向終端裝置

圖說: 研究團隊提出專為大型語言模型設計的 MMA 邊緣 AI 加速器架構,整合多通道記憶體存取、MX 運算、動態量化及向量運算引擎,大幅提升 LLM 推論效率與能源效率,實現大型語言模型於邊緣裝置的端對端運算。
技術名稱
針對邊緣運算最佳化的高效能端對端大型語言模型加速器晶片
計畫單位
國立陽明交通大學
計畫主持人
黃俊達 教授
技術簡介
隨著生成式 AI 快速普及,大型語言模型(Large Language Model, LLM)對運算能力、記憶體頻寬與能源效率的需求日益提高,使多數模型仍須仰賴雲端伺服器執行。本研究團隊成功研發全球首款可於邊緣裝置完整執行大型語言模型端對端推論的專用加速器晶片 MMA,突破傳統邊緣 AI 晶片僅能加速部分運算流程的限制。
晶片整合 MX 運算架構與動態量化(Dynamic Quantization)技術,支援多種運算精度及非線性函數,有效提升運算效率、降低資料傳輸量與推論延遲,同時兼顧模型精度與能源效率。執行 Llama 2-7B 模型時,運算資源使用率高達 95%,模型困惑度(Perplexity, PPL)僅較原始模型增加 0.3,展現優異的推論效能。相較於美國喬治亞理工學院的 MicroScopiQ、韓國首爾大學的 Tender 與高麗大學的 OPAL 等架構,本技術率先實現大型語言模型於邊緣裝置的完整端對端運算,為邊緣生成式 AI 晶片的重要突破。
技術亮點
- 全球首款支援大型語言模型(LLM)端對端推論的邊緣 AI 加速器晶片。
- 專為 Transformer 架構最佳化,大幅提升 LLM 推論效率。
- 整合 MX 運算架構與動態量化技術,兼顧高效能與低功耗。
- 支援多種運算精度與非線性函數,加速 AI 模型部署。
- 執行 Llama 2-7B 時運算資源使用率達 95%,PPL 僅增加 0.3。
- 可望推動生成式 AI 在手機、智慧終端與邊緣設備的普及應用。
產業應用性
本技術可廣泛應用於生成式 AI 終端裝置、智慧手機、穿戴式裝置、機器人、智慧製造、智慧醫療、智慧車載系統及企業邊緣伺服器等場域,提供即時且低延遲的大型語言模型推論服務。由於模型可直接於本地端運作,不僅可降低雲端運算成本與網路傳輸負擔,更能提升個人資料安全與隱私保護。
研究團隊期望與IC 設計公司、半導體業者、AI 晶片開發商、系統整合商及終端產品製造商合作,共同推動邊緣 AI 晶片技術商品化,加速生成式 AI 在各類智慧裝置的實際應用。
資料來源: 針對邊緣運算優化之高效能端對端大型語言模型加速器晶片 - Future Tech Pavilion, FUTEX未來科技館