
重點整理
- Hugging Face 發布 207 個 WebGPU Kernels,優化瀏覽器 AI 運算。
- 實測顯示,新技術比現有方案平均快 2.57 倍,特定運算甚至快上萬倍。
- 推出 Fleet 眾測工具,透過社群數據確保 AI 在各裝置上都能順暢運行。
- 瀏覽器端 AI 運算可減少雲端成本,並提升使用者資料隱私。
你曾經在網頁上使用 AI 功能時,覺得載入很慢或畫面卡頓嗎?隨著 AI 技術普及,越來越多企業希望在網站上提供即時的 AI 互動體驗。過去,網頁要跑 AI 模型通常需要依賴雲端伺服器,不僅速度慢,還得擔心資料隱私與昂貴的伺服器成本。現在,知名 AI 社群 Hugging Face 推出了全新的底層技術,讓使用者的瀏覽器就能快速執行 AI 運算。這項突破不僅能大幅提升網頁流暢度,更為企業節省可觀的雲端資源。
什麼是 WebGPU Kernels?為什麼它很重要?
要理解這項技術,我們先認識兩個名詞。首先是 WebGPU,這是一種讓瀏覽器能直接呼叫顯示卡(GPU)來加速運算的技術。其次是 Kernels(核心運算),也就是 AI 模型在底層執行時,需要用到的一組組 GPU 運算指令。
過去瀏覽器跑 AI 之所以慢,是因為底層的運算指令沒有被最佳化。為此,Hugging Face 推出了 @huggingface/kernels 函式庫,一口氣發布了 207 個針對 WebGPU 優化過的 Kernels。這些指令涵蓋了各種 AI 模型需要的基礎運算,讓瀏覽器在處理 AI 任務時,能更有效地利用硬體效能。
瀏覽器跑 AI 變多快?實測數據大公開
這些優化過的指令到底能提升多少速度?Hugging Face 團隊在 Apple M4 GPU 上進行了實測,將新技術與現有的 ORT WebGPU 方案進行比較。結果顯示,在 809 個測試案例中,新的 Kernels 平均速度提升了 2.57 倍,中位數速度也提升了 1.90 倍。
更令人驚豔的是,在某些特定的複雜運算上,效能提升甚至達到了上萬倍。例如,在處理特定的雙線性運算時,新技術僅耗時 0.136 毫秒,而舊方案則需要 1,396 毫秒。這意味著,未來我們在網頁上進行 AI 影像處理、即時語音辨識或複雜數據分析時,將能獲得幾乎無延遲的順暢體驗。
Fleet 眾測工具:確保各種裝置都能順暢運行
不過,每個人的電腦、手機所使用的顯示卡與瀏覽器都不盡相同,單一裝置的測試結果無法代表全貌。為了解決這個問題,Hugging Face 同時推出了 Fleet,這是一個在瀏覽器內執行的 GPU 效能測試工具。
Fleet 的運作概念很簡單:它讓一般使用者也能在自己的裝置上跑測試,並將效能與正確性的數據回饋給官方。透過這種眾包的方式,Hugging Face 能收集到來自全球各種硬體的真實數據,進而找出特定裝置上的效能瓶頸,持續優化這些 Kernels,確保 AI 應用在任何裝置上都能穩定運行。
崴米的建議
這項技術的發展,代表了網頁 AI 本地化的趨勢正在加速。作為您的數位顧問,我們提供以下三點建議:
- 評估網頁 AI 本地運算的可行性:若您的網站有輕量級的 AI 功能,可考慮利用 WebGPU 讓使用者在瀏覽器端直接運算,這不僅能大幅降低雲端伺服器成本,還能確保客戶資料不離開裝置,提升隱私安全。
- 規劃高互動的下一代網頁應用:WebGPU 的成熟讓網頁能處理更複雜的運算。您可以開始發想需要即時互動的 AI 功能,例如網頁端的即時 3D 模型生成或互動式數據視覺化,為顧客創造更驚豔的使用體驗。
- 盤點並升級現有網站架構:要支援 WebGPU 等新技術,網站的前後端架構需要具備良好的擴展性。建議定期檢視現有網站的技術棧,確保未來導入新 AI 工具時,不會被舊有架構卡住。
參考來源:Introducing @huggingface/kernels: 200+ WebGPU Kernels for Local AI



