Lecture 1|Physical AI 導論與課程地圖
本講核心:Physical AI 是讓 AI 系統在物理世界中「感知、推理、行動」。但真正難的不是做出一段漂亮 demo,而是知道它在什麼條件下能成功、什麼時候會失敗,以及失敗後如何評估與改進。
- Physical AI 延續機器人學的 sense–plan–act,但受 foundation model 與大量資料訓練推動。
- 看 Physical AI demo 時,要問成功條件、失敗條件、部署證據,而不是只看結果。
- 真實世界會帶來硬體磨損、環境變化、安全限制與動態互動,這些不一定是模型本身能解決的。
- 本課程用評估來引導設計:sense、plan、act,再到 imitation learning pipeline。
課程從哪裡來:從影像、電腦視覺到機器人

這門課不是只介紹最新機器人新聞,而是從講者多年研究脈絡出發:先用影像理解世界,再到自動駕駛與機器人,最後回到「AI 如何在真實物理環境中可靠行動」這個問題。
AI 從數位工具走向物理世界

Project Astra 之類的 agentic AI 已能使用搜尋、網站、PDF 等工具協助人類。但 Physical AI 進一步要求系統用感測器理解真實世界,並透過馬達、輪子、機械臂等致動器行動。這讓問題從「回答得好不好」變成「行動是否安全、穩定、可部署」。
Physical AI 的工作定義

本課採用的定義是:運用 AI 技術,讓系統能在物理世界中感知、推理,並透過感測器觀察、透過致動器互動。這個定義故意不把 Physical AI 限定為人形機器人,因為真正關鍵是「感知—推理—行動」的閉環。
sense–plan–act:老問題的新版本

Physical AI 不是憑空出現的新名詞。早在 Shakey 機器人時代,研究者就已經在做「感知環境、規劃路徑、控制機器人」的閉環。新的地方在於:今天的 AI 技術、資料規模與模型能力讓人重新想像這個閉環能做到多通用。
foundation model 路線:從生成式 AI 借來的想像

生成式 AI 的成功讓機器人研究者開始問:能不能也收集大量機器人資料、訓練一個 foundation model,再微調到不同任務?但機器人不像網路文字有天然海量資料,真實世界資料昂貴、慢、危險,而且受到硬體限制。
看 demo 時要問的不是「酷不酷」

講者反覆提醒:demo 影片很容易讓人高估系統能力。真正應該問的是:它能做什麼?在什麼條件下成功?條件改變時會怎樣?如果要部署到真實場域,需要哪些證據?這些問題比單次成功更重要。
真實部署:模型之外還有硬體、場域與維護

Dyna 2 每小時摺毛巾的數量與品質都比 Dyna 1 大幅提升,但部署後仍遇到處理量下降。最後發現不是模型退化,而是夾具磨損。這件事說明 Physical AI 的失敗可能來自硬體、流程、場域條件,而不只是演算法。

課程地圖:用評估貫穿 sense、plan、act

作業一對應 sense:影像與 3D 重建。作業二對應 plan:語意地圖與路徑規劃。作業三對應 act:控制機械手臂拿取與放置物件。期末專題則會實作 imitation learning pipeline,包含資料收集、資料驗證、policy 訓練與評估。

這一講留下的三個問題
- 看到一個機器人 demo 時,你能列出它成功所需的隱含條件嗎?
- 如果部署後效能下降,你會先懷疑模型、資料、硬體,還是場域流程?為什麼?
- 你要如何定義一個 Physical AI 系統「準備好部署」所需的證據?