機器人能夠辨識物件、理解指令,甚至完成抓取與搬運,並不代表就能直接投入工廠或門市運作。從模型展示走向實際部署,還必須處理運動控制、硬體成本、功耗,以及與人和環境互動時的安全驗證。英特爾提出的 Physical AI 落地路徑,是在既有邊緣運算與控制技術上加入 AI 能力,並透過 Physical AI Studio 與 OpenVINO Physical AI,串接資料蒐集、模型微調與部署流程。
這套思路並非將機器人的所有功能都交給 AI,而是讓成熟的控制技術與 AI 各自處理適合的工作。對需要長時間運作、受到電池與空間限制的機器人而言,如何用合理的成本完成任務,與模型本身的能力同樣重要。
Physical AI 落地,先解決控制、成本與功耗
英特爾邊緣運算事業群平台研發協理王宗業表示,機器人的運動控制與 AI 運算可以分工。 CPU 處理運動軌跡規劃原本就很擅長,AI 則可用於任務拆解與規劃;除非使用雲端 GPU,否則要將所有功能都交給 AI,機器人端很難提供所需的大量算力。「想要用全 AI 的人,現在沒辦法出貨量產,因為他發現功耗、成本是不符需求的。」
他以摺毛巾為例,說明固定動作與環境判斷的差別。機器手臂摺毛巾的動作,可以由 CPU 執行的傳統運動控制完成;但不同分店可能要求毛巾按固定數量堆疊,或摺好後放入箱子,此時 AI 可協助判斷放置位置與方式,避免撞倒旁邊的物品,而不是重新以 AI 取代所有既有動作。王宗業指出,從 2018 年至今的經驗來看,純 AI 與傳統電腦視覺等計算方式結合後,才會走到出貨階段,「純 AI 不會做到 100 分,兩個合在一起的時候才會做到 100 分。」
王宗業以「大腦」與「小腦」比喻機器人的運算分工:小腦負責運動控制,大腦負責 AI,目前已有部分機種的運動控制採用英特爾平台。在此基礎上加入 AI,成本是客戶的重要考量,「有時候客戶會跟我們開玩笑說,我今天加了 AI 功能,他的客戶也不希望加價去買。」
功耗同樣是實際限制。王宗業舉例,部分在賣場運作的清潔機器人,一天至少需要工作 4 到 8 小時,不能工作兩小時就回去充電;若再外加獨立 GPU 卡,不僅耗電,系統尺寸也會變大。英特爾因此強調整合式運算平台,讓控制與 AI 工作負載能在同一平台上執行,降低外加元件的需求。
從 Edge AI 延伸至感知、推理與行動
英特爾邊緣運算事業群生態系發展部門總經理杜唯揚表示,邊緣 AI 的應用正從電腦視覺,逐步延伸至生成式 AI 、 Agentic AI 與 Physical AI 。攝影機、感測器及遙測資料提供感知輸入,系統再進行推理與判斷,最後由機器人、工業系統或無人機等設備執行動作,形成 Sense 、 Reason 、 Act 的循環機制。

杜唯揚觀察,尖端模型的市場競爭已經白熱化,「很多時候跟客人聊的時候,會覺得是模型選擇困難症,模型太多了。」他認為,現在不缺模型,模型如何落地使用,才是重要的環節。
不同環節需要的運算資源並不相同。影像偵測、分割與物件追蹤,可以分配給 CPU 、內建 GPU 或 NPU 處理;進入 Agentic AI 階段後,大部分運算則落在 CPU 。英特爾主張以異質運算處理整段工作流程,而非只從大型模型訓練所需的 GPU 算力出發。
在軟體與生態系方面,Open Edge Platform 採用模組化的開原架構,整合平台軟體、工具與函式庫,以及產業參考應用。 Intel AI Edge Systems 則為 OEM 與 ODM 提供標準化藍圖、基準測試與驗證工具,客戶及解決方案供應商可依效能需求配置系統,並有不同能耗等級、尺寸與效能選項。 Edge AI Suites 進一步提供特定產業的參考應用、範例程式碼及基準測試,供開發者客製化。
兩項工具串接資料蒐集、微調與部署
Physical AI Studio 與 OpenVINO Physical AI 是 Intel Robotics AI Suite 的一部分,分別處理模型開發與實際部署的需求。
王宗業說明,機器人應用開發通常不是從零開始訓練整個基礎模型,而是選擇既有模型,再針對特定任務蒐集資料、進行微調。例如同一台機器人從摺毛巾改為煮蛋或洗碗,就需要重新訓練;開發者必須示範對應動作,可能要重複 50 到 100 次蒐集資料,讓模型學習新的任務。他也指出,機器人資料不像大型語言模型可從網路大量取得,各家業者都必須自行蒐集。
Physical AI Studio 提供圖形介面,協助開發者設定攝影機、手臂與感測器,進行資料蒐集、模型微調、最佳化與量化,並匯出經預先驗證、可供部署的視覺語言動作模型 (Vision-Language-Action Model, VLA) 。王宗業表示,自行開發時需要安裝多項軟體、調整許多參數,這項工具將常用的開原模型與重要參數整理在同一介面,微調則交由英特爾 GPU 執行。
OpenVINO Physical AI 則是針對英特爾平台最佳化的開原框架,著重將機器人策略與多模態模型導入實際運作的系統,並最佳化推論效能,也整合 Physical AI Studio 與 LeRobot 等開原模型開發環境,協助模型匯出與部署。王宗業指出,以開原工具建置的軟體環境約需十幾 GB 到二十幾 GB,OpenVINO Physical AI 可將部署環境精簡至約數百 MB 、 1GB 以下。在記憶體與快閃記憶體價格偏高的情況下,儲存容量直接影響系統成本,「大家都很在意,這個系統只要 64GB 的 Flash 就可以裝,那我當然用 64GB,我不要 128GB,整個成本都上去了。」

這些工具並非取代所有既有開發框架。英特爾同時整合並最佳化 ROS 2 與 PyTorch,讓開發者可採用既有工具,或加入自有模組。以 PCB 檢測為例,機器人拿起物件只是其中一個步驟,還需要透過 OpenVINO 與 ROS 2 協調瑕疵檢測模型、判斷 PCB 良窳,再由 CPU 將檢測結果傳送至製造系統;運動、視覺推論與資料交換必須一起運作。

Ella 案例呈現 AI 代理與即時控制的整合
英特爾與 Sensory AI 合作的 Ella 系統,提供了控制與 AI 整合的具體案例。英特爾稱 Ella 是第一個在公開商業場域營運的多代理 Physical AI 商店。該系統於今年 COMPUTEX 期間展示,民眾可現場向機器人點購咖啡;系統採用 Intel Core Ultra 系列 3 處理器與 Robotics AI Suite,將原先由 CPU 搭配獨立加速器的分散式架構,整合為單一平台,同時處理即時控制與 AI 運算。王宗業表示,Sensory AI 一開始採用另一張獨立 GPU 卡,後來發現「這個 GPU 卡竟然比他整個系統還要貴」,最後改用英特爾平台完成整合。
Ella 可在單一系統單晶片 (System on Chip, SoC) 平台上同步運行 Avatar 、 Guardian 與 Ella Agent 三個專用 AI 代理,分別負責顧客互動、系統營運,以及門市層級的商業智慧分析。機器人的實際運作,則由具備確定性控制能力的協調器統一調度。
這個案例呈現的不是以 AI 取代控制系統,而是將 AI 代理與既有控制機制整合。英特爾表示,這種架構可減少硬體元件與軟體複雜度,並簡化後續在同一平台上擴展機器人設計的開發路徑。
從實驗到現場,安全驗證仍需時間
工具整合可以簡化開發,但機器人走入真實環境後,仍需要時間驗證。王宗業表示,一般專案開發約需 3 至 9 個月,視複雜度而定;由於 Physical AI 應用會與人和環境接觸,開發完成後通常還需要半年至一年以上進行現場測試。以工具機業者等客戶為例,一旦發生碰撞就可能造成工安意外,因此會花較長時間測試。
模擬也是部署前的重要環節。王宗業以訓練機器人依影片學跳舞為例,「我們怕說放進去他就暴衝,沒有人攔得住。」因此會先在模擬環境中測試。他指出,除了 NVIDIA 的 Isaac Sim,MuJoCo 等開原模擬工具及 ROS 相關工具都能在 CPU 上執行;英特爾也支援 PyTorch,並透過內建 GPU 與獨立 GPU,加速這些工具中需要 GPU 運算的部分。
資安同樣需要多方參與。杜唯揚表示,相關工作包括遵循全球與各國層級的安全指引、產品本身的安全能力,以及生態系夥伴在軟體與部署上的實作。王宗業則指出,英特爾內部開發流程從設計階段就納入資安,並確認提供的工具不會造成資安危害;但資安不只是程式開發者的責任,撰寫規格、測試的人員與使用者都需要具備相關概念。
從既有運動控制加入 AI 規劃,到模型微調、部署與現場驗證,Physical AI 的落地是一段完整的系統整合流程。英特爾所提出的方案,重點在於讓開發者沿用成熟技術,再以 AI 補強特定任務;最終能否投入實際運作,仍取決於效率、成本、功耗與安全需求是否同時獲得滿足。

