Physical AI 是什麼?為什麼下一波 AI 不只存在螢幕裡
當 AI 從文字、影像與軟體走進機器人、自駕車、無人機與智慧設備,錯誤開始需要由真實世界承擔。從感知、推理、行動、模擬到 Edge AI,理解 Physical AI 為什麼是值得長期追蹤的下一條技術主線。

過去幾年,我們談 AI,多半是在談一個發生在螢幕裡的世界。
文字生成、圖片生成、搜尋、程式撰寫、客服、分析與 Agent,真正改變的是資訊如何被理解、重組與執行。即使模型答錯了,最常見的後果仍然是一段錯誤文字、一張不正確的圖片,或一個需要人工修正的流程。
但 AI 正在跨過另一條更重要的界線。
當相同的感知、推理與決策能力被放進機器人、自駕車、無人機、智慧攝影機、工業設備與其他實體系統裡,錯誤就不再只停留在資訊世界。
它可能是一個轉錯方向的方向盤、一隻抓錯位置的機械手臂、一架判斷錯誤的無人機,或一套在錯誤時間啟動的自動設備。
這正是我長久以來特別關注 Physical AI 的原因,甚至為此而真正動筆寫了部小說《新巴比倫》,來描述這個即將到來的未來世界。
真正的轉折,不是機器突然「更像人」,而是 AI 開始從理解世界,走向對世界產生後果。
先界定問題:Physical AI 到底是什麼?
Physical AI 並不是一個完全統一、只有單一定義的學術名詞。
產業界近年大量使用這個詞。NVIDIA 將 Physical AI 描述為:讓攝影機、機器人、自駕車等自主系統能夠感知、理解、推理,並在真實世界執行或協調複雜行動的 AI 系統。
更廣泛的研究與產業語境裡,也常看到 embodied AI、robotics、autonomous systems、vision-language-action models、embodied reasoning 等不同名稱。這些詞並不完全等價,但共同指向同一個方向:AI 不再只處理文字、影像與資料,而是開始接收真實世界的感測訊號、建立對環境的理解、規劃下一步,最後透過機械或控制系統執行動作。
如果要用一個簡單流程理解,我會把 Physical AI 拆成四個步驟:
- Perception:看見、聽見、量測環境。
- Reasoning:理解目前正在發生什麼。
- Planning:決定接下來應該怎麼做。
- Action:真的對物理世界產生動作。
最後這一步,就是它和大多數生成式 AI 最明顯的分界。
從「回答問題」變成「做出動作」
Google DeepMind 的 Gemini Robotics 提供了一個很具體的例子。Gemini Robotics 1.5 是 vision-language-action 模型,可以把視覺資訊與指令轉成機器人的 motor commands;Gemini Robotics-ER 則更偏向理解環境、規劃與 embodied reasoning。
這是一個重要變化。
大型語言模型可以告訴你:「把紅色積木放到盒子裡。」
但 Physical AI 面對的是:哪一個是紅色積木?它距離手臂多遠?抓取角度是多少?桌面是否有障礙?抓起來後重心會不會偏?機械手應該施加多少力量?如果有人突然把手伸進來,是否要立刻停止?
也就是說,語言裡的一句話,在真實世界可能展開成大量連續而彼此相依的小決策。
真實世界也沒有乾淨的 API contract。
地板可能有水,光線會改變,物體位置不會永遠一致,鏡頭可能被遮住,輪胎會打滑,零件會磨耗,人更不會按照模型預期的方式移動。
數位世界裡,我們常能先把輸入整理好再送進模型;實體世界裡,輸入本身就是不完整、連續變動而且帶有雜訊的。
為什麼機器人、自駕車、無人機與智慧攝影機正在匯流
表面上看,一台 humanoid robot、一輛 robotaxi、一架巡檢無人機與一支智慧攝影機是完全不同的產品。
但從 AI 系統角度看,它們開始共享很多相同能力。
它們都需要感測環境,都需要即時推理,也都需要在有限算力、有限功耗與有限時間內做出可靠決策。差別主要在最後的 action layer。
智慧攝影機的 action 可能只是觸發警報或紀錄事件;無人機是改變飛行方向;自駕車是方向盤、煞車與加速;機器人則可能涉及手臂、手指、雙腳與整個身體。
這也是我認為 Physical AI 值得獨立看待的原因:不同產業的 AI stack,正在感知、世界模型、推理、模擬、edge inference 與安全控制等層面逐漸匯流。
Physical AI 為什麼比 Chatbot 難很多?
第一個差別是 latency。
聊天慢半秒,大部分人只會覺得系統反應比較慢;但高速移動的機器晚半秒判斷,可能已經沒有補救空間。
第二個差別是 power。
大型雲端模型可以使用大量 GPU 與能源,但一台移動中的機器人、無人機或智慧裝置,必須在有限電池、散熱與體積下完成推理。
第三個差別是 network reliability。
如果每一個關鍵動作都必須等待雲端回答,斷線本身就可能成為安全問題。Google DeepMind 推出的 Gemini Robotics On-Device,正是把 VLA 能力最佳化到機器人本地端執行的一個例子。
第四個差別是 failure cost。
生成式 AI 的錯誤當然也可能造成嚴重後果,但 Physical AI 把模型輸出直接連接到物理行動,風險結構因此不同。
所以 Physical AI 的工程核心不會只是「模型準不準」。它還包括容錯、即時性、控制、安全驗證、感測器品質、機械系統與完整的 system engineering。
為什麼 Simulation、Digital Twin 與 Synthetic Data 變得更重要
如果一個模型要學會寫文章,我們可以提供大量文字。
如果一個機器人要學會走路、抓取、避障或操作設備,直接在真實世界裡反覆試錯就昂貴得多,也可能具有安全風險。
因此,模擬環境的重要性快速提高。
NVIDIA 的 Physical AI 與 robotics 工具鏈強調 physics-based simulation、digital twins 與 synthetic data。概念很直觀:讓系統先在虛擬環境裡大量遇到不同物體、光線、碰撞、位置與異常情境,再把學到的能力帶到真實設備。
Synthetic data 也能補足一些現實世界資料很難大量取得的情況。例如罕見危險事件、特定光線、極端天候,或尚未真正建成的工廠環境,都可以先在模擬裡建立大量變化。
但這不代表 simulation 可以取代現場測試。
真正困難的問題仍然是 sim-to-real gap:虛擬世界再準確,也很難完整複製摩擦、材料差異、感測雜訊、人類行為與設備老化。
所以我更傾向把 Physical AI 的學習流程理解成循環:simulation、synthetic data、real-world data、field validation,再回到模型與模擬環境更新,而不是「在虛擬世界學完一次就畢業」。
AI 競爭會重新回到晶片、感測器與 Edge Computing
生成式 AI 讓很多人的注意力集中在 foundation models。
但當 AI 走進真實世界,我認為硬體的重要性會重新放大。
一個 Physical AI 系統需要的不只是模型。它還可能需要相機、LiDAR、雷達、IMU、麥克風、馬達、控制器、通訊模組、edge processor、記憶體、電源系統,以及完整的機構設計。
更重要的是,這些東西不能只是各自很好,它們必須在有限時間內協同工作。
NVIDIA 對自駕車的說明就把 onboard sensors、AI software 與 high-performance compute 放在同一個即時決策系統裡;Google DeepMind 也持續推進 on-device robotics。這些方向都提醒我們,Physical AI 不只是「把更大的模型裝進機器人」。
它更像是 AI 軟體能力與半導體、感測器、機械、控制工程重新匯流的一個階段。
這也是我特別感興趣的一點。AI 過去幾年的討論很容易讓人覺得一切最後都會收斂到雲端裡最大的模型;Physical AI 卻可能把競爭重新拉回大量分散、即時、低功耗而且必須高度可靠的運算節點。
我接下來真正想追的,不是哪一台機器人最炫
目前 Physical AI 最容易吸引注意力的是 humanoid robots。
但我不認為 humanoid 本身就代表整個 Physical AI。
真正值得長期觀察的,是幾個更底層的問題:
第一,AI 是否能從受控環境走進高度不確定的現實世界?
第二,simulation 與 synthetic data 能否真的大幅降低機器學習與驗證成本?
第三,edge computing 能否讓更複雜模型在低功耗設備上即時執行?
第四,不同 robot morphology 是否能逐漸共享 foundation model、world model 或 embodied reasoning 能力?
第五,Physical AI 的安全驗證與責任制度能不能跟上技術進展?
第六,真正產生規模效益的會先是 humanoid、robotaxi、工業機器人、無人機,還是大量看起來並不酷的智慧設備?
這些問題,比單純猜哪家公司最後會贏更值得追。
因為當 AI 開始真正進入物理世界,我們面對的已經不只是「更聰明的軟體」,而是一群可以感知環境、做出決定,而且真的會採取行動的系統。
AI 接下來的競爭因此會越來越不像純粹的軟體競賽。它會重新牽動晶片、能源、感測器、機械、城市、交通、工業與治理。
這會是我接下來想沿著 Physical AI 持續追蹤的一條線。
常見問題
Physical AI 和 Embodied AI 是同一件事嗎?
不完全相同。兩者高度重疊,但 Physical AI 目前更多出現在產業與平台語境,強調 AI 對真實物理環境的感知、推理與行動;Embodied AI 在研究語境裡則有更長的發展歷史。實際閱讀資料時,最好不要把兩個詞視為完全可互換的標籤。
Physical AI 就是機器人嗎?
不是。機器人是最直觀的 embodiment 之一,但自駕車、無人機、智慧空間與具備即時感知和控制能力的設備,也可能屬於 Physical AI 的範圍。NVIDIA 的定義甚至把 cameras、robots、self-driving cars 一起列為自主系統例子。
Physical AI 一定需要連上雲端嗎?
不一定。訓練大型模型可能高度依賴資料中心,但部署後的關鍵動作往往需要 local 或 edge inference。實際系統可能採用雲端與裝置端混合架構,取決於延遲、功耗、網路、安全與模型大小。
為什麼 Physical AI 需要 simulation?
因為真實世界試錯昂貴、緩慢,有時甚至危險。模擬可以大量產生訓練情境、罕見事件與 synthetic data,也能在部署前反覆測試。不過 sim-to-real gap 仍然存在,因此 simulation 不能取代真實世界驗證。
Physical AI 接下來最值得關注什麼?
我會優先看 embodied models 的泛化能力、on-device inference、simulation 與 synthetic data、robotics foundation models、安全驗證,以及真正能產生規模化商業價值的應用場景,而不只看 humanoid robot 的展示效果。