CPU 可以處理各種工作,GPU 擅長大量平行運算,NPU 則是替 AI 推論設計的專用處理器。Techno Tim 沒有只跑一套合成測試,而是找了一個真的可能全天候運作的工作:讓開源監視系統 Frigate 持續分析攝影機畫面,辨識人與車輛。
測試機器是搭載 Intel Core Ultra 9 386H 的 MINISFORUM MS-03,裡面同時有 CPU、整合式 GPU,以及標示為 50 TOPS 的 NPU。因為 Panther Lake 平台太新,Frigate 容器內的 Intel 軟體還跟不上,他先重建容器,接著把在 Minneapolis 拍攝的四段街景循環播放成四路攝影機串流。每一輪都使用相同的 YOLOv9 Tiny 模型與影片設定,只更換負責物件偵測的處理器,並各自執行五次、每次五分鐘。
來源:影片畫面擷取自 YouTube/Techno Tim(約 06:44)
實際跑 Frigate 時,CPU 的平均推論延遲是 30.4 毫秒,每秒約處理 32.9 個偵測畫面,整台機器耗電約 51.4 W。GPU 將延遲降至 9.7 毫秒、提升到 53.5 fps,耗電也降到 24.8 W;NPU 同樣是 9.7 毫秒與 53.3 fps,速度幾乎和 GPU 相同,但整機耗電只有 18.3 W。
來源:影片畫面擷取自 YouTube/Techno Tim(約 09:12)
差別不只在省下幾瓦電。由 NPU 接手偵測後,GPU 不必同時處理影片解碼與 AI 推論,可以保留大部分資源做其他工作。獨立的 OpenVINO 跑分雖然顯示 NPU 比 GPU 更快,放進完整的 Frigate 流程後兩者卻幾乎打平,也說明單一跑分不一定能反映實際應用裡的資料搬移與其他處理成本。
NPU 因此比較不像一張縮小版 GPU,而是另一個可以安置長時間背景 AI 工作的位置。即時物件偵測是一個例子,視訊會議的背景模糊、自動取景與持續語音轉錄也是同類用途。影片剛發表不久,目前只有少量早期留言;除了肯定這種真實使用情境的測法,也有人提到效能較低的 Google Coral EdgeTPU,仍足以支撐自己的 Frigate 監視系統。
What Is an NPU Actually Good For? / Techno Tim/YouTube · 在 YouTube 觀看 ↗