🏃 QWOP AI 競技場

真人用 Q/W/O/P 控制大小腿跑步 · 綠色是自學會跑的 AI(強化學習 PPO 訓練,非寫死規則)· 同一套物理引擎 train==deploy
你:0.0 m
Q
左髖
W
右髖
O
左膝
P
右膝

這是什麼

強化學習訓練 AI 玩 QWOP(史上最難跑步遊戲)。AI 沒有被寫任何「怎麼跑」的規則——它靠試誤 + 獎勵(前進加分、跌倒扣分),自己在數百萬次模擬中學會平衡與步態。這裡的 AI 是真的訓練出來的策略網路(policy network),在你瀏覽器裡即時 inference。
Reinforcement LearningPPOpolicy network (MLP)reward shapingBox2D 物理train==deploy

技術拆解與名詞速查見另一份研究報告;訓練程式碼純 JS 從頭實作(planck.js 物理 + 手刻 PPO)。