Lecture 3

Physical AI 的資料飛輪:資料涵蓋度、品質與持續改善

這一講把焦點從「模型能不能更大、更通用」轉到「資料從哪裡來、涵蓋什麼、品質如何,以及如何用部署後的失敗持續補資料」。

Lecture 3 Part 1 + Part 2 已整理繁中字幕已產出

Lecture 3|Physical AI 的資料飛輪

本講核心:Physical AI 的瓶頸不只是模型,而是資料。真正重要的不是「資料夠不夠多」,而是資料是否涵蓋目標任務需要的物件、任務、環境與實體形式;部署後是否能辨識能力缺口,再回頭收集最有價值的新經驗。

快速掌握:
  1. 資料量只是第一層問題;更重要的是資料涵蓋度與品質。
  2. 資料飛輪不是一直收集更多資料,而是從部署與評估找到能力缺口,再收集能補缺口的資料。
  3. coverage 會隨物件、任務、環境、實體形式組合爆炸,因此必須由評估目標引導。
  4. 資料取得策略要在擬真度、涵蓋度、規模與成本之間取捨。

三個研究問題:資料是通用 Physical AI 的核心瓶頸

Three Research Questions
本講延續前兩講的問題:如何收集多元高品質的物理互動資料,訓練能跨任務、環境與實體形式泛化的模型,並確認系統真的能在真實世界運作。19:10

如果想建立 general-purpose model,不能只問模型架構。必須先問:物理互動資料如何取得?資料是否足以涵蓋真實世界變化?訓練出的系統又如何透過部署與評估確認有效?這些問題導向本講主題:資料飛輪。

三層資料思維:從資料量走向資料價值

Three levels of thinking about data
第一層是資料量:我有多少資料?但這不是唯一、也不是最終問題。20:15

機器學習專案常被問「資料集夠大嗎?」但在 Physical AI 裡,單純追求資料量很容易失焦。資料量再大,如果只涵蓋單一任務、單一物件或單一環境,部署後仍可能失敗。講者因此引入第二層:資料涵蓋度;以及第三層:哪些資料最有價值。

重點:「更多資料」不是答案;「更對的資料」才是資料飛輪要解決的問題。

資料集思維 vs 資料飛輪

Data Flywheel basic pipeline
基本流程:Experience → Data → Learning → Deployment。若停在一次性資料集,就是收集、訓練、部署後結束。25:30

傳統資料集思維常是:收集資料、訓練模型、在 benchmark 上比前人好 5%,然後結束。但 Physical AI 面對真實世界時,需要持續回答:模型在哪些條件下失敗?失敗代表缺少哪種經驗?下一步應該收集什麼資料?

Data Flywheel capability gaps
資料飛輪加入 Evaluate 與 Identify Capability Gaps:透過評估找出能力缺口,再回頭取得新經驗。44:00

資料涵蓋度:物件 × 任務 × 環境 × 實體形式

Operating Conditions
Physical AI 的 operating conditions 包含環境條件、目標任務、物件屬性、動態物體與部署限制。31:30

涵蓋度不是抽象名詞,而是要具體問:資料涵蓋哪些物件?哪些任務?哪些環境?哪些機器人或實體形式?如果只收集很多房間 layout,可能只增加 layout 多樣性,卻沒有增加物件、任務或動態互動的涵蓋度。

What does Coverage mean
涵蓋度會組合爆炸:100 物件 × 20 任務 × 20 環境 × 5 實體形式,就已經是 200,000 種組合。36:30

這也是為什麼不能盲目收集全部資料。組合數成長太快,必須用評估目標決定哪些維度最重要:是物件變化?任務變化?環境變化?還是機器人 embodiment 變化?

能力缺口:下一筆資料應該收集什麼?

Data Flywheel collect simulate generate reconstruct imagine
資料飛輪的重點是根據能力缺口選擇下一種經驗來源,而不是無差別增加資料。50:30

部署與評估會回傳失敗訊號。這些失敗不是單純扣分,而是指向下一輪資料收集策略:要從真實世界收集?在模擬中產生?重建場景?生成變化?還是想像更多條件?資料飛輪的價值在於把失敗轉成下一步資料取得的決策。

資料取得策略:擬真度、涵蓋度、規模與成本

Fidelity coverage scale cost
不同資料來源要在擬真度、涵蓋度、規模與成本間取捨。沒有單一策略永遠最好。53:30

真實機器人資料擬真度高,但成本高、速度慢、風險大。模擬或生成資料規模較容易擴大,涵蓋度也能設計,但可能缺少真實物理互動訊號。選擇資料策略時,必須回到評估目標:目前能力缺口需要的是高擬真度、更多涵蓋度,還是更大規模?

學習重點:資料飛輪不是資料越多越好,而是讓「評估 → 能力缺口 → 新經驗 → 再訓練 → 再部署」形成可持續改善的閉環。

七種資料取得策略:不是只有真實機器人收資料

Kinesthetic Teaching
策略一:Kinesthetic Teaching。人直接牽引或示範機器人動作,取得高擬真度的互動資料。Part 2 5:00

第二段課程把資料飛輪落到實作層次:社群已經發展出多種取得或產生經驗資料的方法。第一類是 kinesthetic teaching,也就是人直接帶著機器人做任務。它的擬真度高,因為資料來自真實機器人與真實物理互動;但成本高、速度慢,也受限於操作人員與設備。

UC Berkeley Gello teleoperation
策略二:Teleoperation。以遙操作裝置控制機器人,例如 UC Berkeley GELLO。Part 2 12:00

遙操作看似比直接牽引更容易擴展,但也有代價:操作者缺少觸覺回饋,常從第三人稱視角控制機器手臂,不一定能感覺自己是機器人的一部分。因此資料品質和操作介面設計高度相關。

從影片學習:資料規模巨大,但後處理很難

Learning from Videos
策略三:Learning from Videos。網路影片規模巨大,但需要把人類動作轉成機器人可用的狀態與動作。Part 2 20:00

影片資料的吸引力在於規模:網路上有大量人類操作影片。但它不是免費午餐。人手和機器手的 embodiment 不同,人類動作更快、更靈活,影片也缺少力覺與接觸訊號。如何從影片中估計手部骨架、物體狀態,再映射到機器人,是一個困難的研究問題。

模擬、程序生成與 world model:用算力換涵蓋度

Simulation
策略四:Simulation。模擬能平行擴展大量環境與物件變化,但擬真度取決於物理引擎與建模品質。Part 2 30:00

模擬的優點是可控制、可平行化、可大量產生環境變化;缺點是 sim-to-real gap。若目標需要精細接觸、柔性物體、液體或摩擦細節,模擬不一定忠實捕捉真實互動訊號。

Procedural Data Generation via LLM
策略五:透過 LLM 做程序式資料生成,擴充物件、場景與任務組合。Part 2 40:00

程序式生成與 LLM 可以快速擴展任務描述、場景配置與物件組合,提升涵蓋度。但生成出來的資料仍要回到評估:它是否補到真正能力缺口?還是只增加表面多樣性?

Open X-Embodiment and RT-X
開放資料集與跨 embodiment 模型,例如 Open X-Embodiment 與 RT-X,代表社群試圖把不同機器人經驗匯集起來。Part 2 1:12:00

跨機器人資料集能提高 coverage,讓模型接觸更多 embodiment 與任務。但資料格式、動作空間、感測器、任務定義與品質不一致,仍需要標準化與評估來判斷真正價值。

總結:資料飛輪要回答「系統下一步該經歷什麼?」

Fidelity Coverage Scale Cost table
不同資料策略可用 Fidelity × Coverage × Scale,在成本限制下比較。Part 2 50:00

講者把所有策略放回同一個取捨框架:擬真度、涵蓋度、規模,並受成本限制。真實資料擬真度高但昂貴;模擬與生成可擴展但可能失真;影片規模大但後處理困難;world model 可想像未來狀態,但訓練成本與可靠性都是挑戰。

Takeaway
本講 takeaways:generalization 是 coverage problem;沒有單一資料來源最優;目標不是更大的資料集,而是資料飛輪。Part 2 1:36:00
最終問題:What should the system experience next? 一個好的 Physical AI 系統,不只要會從資料學習,也要能透過評估知道下一步應該經歷、收集或生成什麼資料。

這一講留下的三個問題

  1. 如果你的機器人模型失敗了,你能把失敗對應到物件、任務、環境或實體形式哪個涵蓋度缺口嗎?
  2. 下一筆資料要從真實世界、遙操作、影片、模擬、程序生成還是 world model 取得?你的選擇標準是什麼?
  3. 你設計的評估是否能告訴你「該收集什麼資料」,而不只是告訴你分數高低?