Lecture 1

Physical AI 導論與課程地圖

這一講的任務不是背名詞,而是建立看 Physical AI 的框架:它是什麼、和過去機器人學有何關係、近期 demo 為何重要,以及為何真實世界部署不能只看模型能力。

約 110 分鐘正式內容約 17:37 開始

Lecture 1|Physical AI 導論與課程地圖

本講核心:Physical AI 是讓 AI 系統在物理世界中「感知、推理、行動」。但真正難的不是做出一段漂亮 demo,而是知道它在什麼條件下能成功、什麼時候會失敗,以及失敗後如何評估與改進。

快速掌握:
  1. Physical AI 延續機器人學的 sense–plan–act,但受 foundation model 與大量資料訓練推動。
  2. 看 Physical AI demo 時,要問成功條件、失敗條件、部署證據,而不是只看結果。
  3. 真實世界會帶來硬體磨損、環境變化、安全限制與動態互動,這些不一定是模型本身能解決的。
  4. 本課程用評估來引導設計:sense、plan、act,再到 imitation learning pipeline。

課程從哪裡來:從影像、電腦視覺到機器人

Physical AI Lecture 1 開場投影片
開場投影片。講者把自己從影像處理、電腦視覺、自動駕駛到機器人的路徑,串成這門 Physical AI 課的背景。17:42

這門課不是只介紹最新機器人新聞,而是從講者多年研究脈絡出發:先用影像理解世界,再到自動駕駛與機器人,最後回到「AI 如何在真實物理環境中可靠行動」這個問題。

AI 從數位工具走向物理世界

AI 離開數位世界進入物理世界的問題
關鍵轉折:如果 AI 不只在螢幕與雲端裡回答問題,而是進入物理世界,會發生什麼事?35:00

Project Astra 之類的 agentic AI 已能使用搜尋、網站、PDF 等工具協助人類。但 Physical AI 進一步要求系統用感測器理解真實世界,並透過馬達、輪子、機械臂等致動器行動。這讓問題從「回答得好不好」變成「行動是否安全、穩定、可部署」。

Physical AI 的工作定義

從 perception AI 到 physical AI 的發展圖
Physical AI 位於 AI 發展圖的右上角:系統不只生成內容,也能在物理世界採取行動。26:30

本課採用的定義是:運用 AI 技術,讓系統能在物理世界中感知、推理,並透過感測器觀察、透過致動器互動。這個定義故意不把 Physical AI 限定為人形機器人,因為真正關鍵是「感知—推理—行動」的閉環。

學習重點:之後遇到任何案例,先判斷它是否有觀察、推理、行動,以及是否真的和物理世界互動。

sense–plan–act:老問題的新版本

Shakey 機器人相關投影片
Shakey 機器人代表早期機器人學的 sense–plan–act 範式:先感知、建模與規劃,再控制身體行動。40:00

Physical AI 不是憑空出現的新名詞。早在 Shakey 機器人時代,研究者就已經在做「感知環境、規劃路徑、控制機器人」的閉環。新的地方在於:今天的 AI 技術、資料規模與模型能力讓人重新想像這個閉環能做到多通用。

foundation model 路線:從生成式 AI 借來的想像

Physical AI 近期進展問題
近期 Physical AI 進展背後的共同問題:大量資料與 foundation model 能否帶來更通用的機器人行為?48:30

生成式 AI 的成功讓機器人研究者開始問:能不能也收集大量機器人資料、訓練一個 foundation model,再微調到不同任務?但機器人不像網路文字有天然海量資料,真實世界資料昂貴、慢、危險,而且受到硬體限制。

看 demo 時要問的不是「酷不酷」

機器人操作任務示範截圖
機器人 demo 可能看起來很流暢,但學習重點是拆解任務條件、成功標準與失敗模式。55:30

講者反覆提醒:demo 影片很容易讓人高估系統能力。真正應該問的是:它能做什麼?在什麼條件下成功?條件改變時會怎樣?如果要部署到真實場域,需要哪些證據?這些問題比單次成功更重要。

真實部署:模型之外還有硬體、場域與維護

Dyna 產品化案例
Dyna 摺毛巾案例顯示:即使模型能做任務,產品化仍需要處理現場監控、硬體退化與維護。1:03:30

Dyna 2 每小時摺毛巾的數量與品質都比 Dyna 1 大幅提升,但部署後仍遇到處理量下降。最後發現不是模型退化,而是夾具磨損。這件事說明 Physical AI 的失敗可能來自硬體、流程、場域條件,而不只是演算法。

自駕車與真實世界挑戰
Physical AI 進入道路、人群與高風險場域後,會遇到遠比 benchmark 複雜的條件組合。1:11:30
重點:部署不是「模型準確率夠高」就結束,而是需要長期評估、資料標註、異常診斷、維護與安全復原。

課程地圖:用評估貫穿 sense、plan、act

HW2 語意地圖與路徑規劃投影片
作業會從感知、規劃到行動逐步建立 Physical AI pipeline。1:18:30

作業一對應 sense:影像與 3D 重建。作業二對應 plan:語意地圖與路徑規劃。作業三對應 act:控制機械手臂拿取與放置物件。期末專題則會實作 imitation learning pipeline,包含資料收集、資料驗證、policy 訓練與評估。

Course Project pipeline
期末專題重點不是只訓練 policy,而是把資料驗證與評估結果用來改善系統。1:22:30

這一講留下的三個問題

  1. 看到一個機器人 demo 時,你能列出它成功所需的隱含條件嗎?
  2. 如果部署後效能下降,你會先懷疑模型、資料、硬體,還是場域流程?為什麼?
  3. 你要如何定義一個 Physical AI 系統「準備好部署」所需的證據?