這是什麼
用
強化學習訓練 AI 玩 QWOP(史上最難跑步遊戲)。AI 沒有被寫任何「怎麼跑」的規則——它靠
試誤 + 獎勵(前進加分、跌倒扣分),自己在數百萬次模擬中學會平衡與步態。這裡的 AI 是真的訓練出來的策略網路(policy network),在你瀏覽器裡即時 inference。
Reinforcement LearningPPOpolicy network (MLP)reward shapingBox2D 物理train==deploy
技術拆解與名詞速查見另一份研究報告;訓練程式碼純 JS 從頭實作(planck.js 物理 + 手刻 PPO)。