物理智能的核心在于智能体通过观测与行动的闭环,实现对物理世界变化的预测与改造,而非单纯依赖语言模型的下一个词预测。大语言模型在物理交互中存在表征效率低下与缺乏因果常识的局限,构建基于视频与动作配对的世界模型成为实现通用物理智能的关键路径。池晓威指出,物理智能应通过大规模、高多样性的动作观测数据训练,使模型具备直觉性的未来预测能力。相比于追求单一的人形机器人形态,更应关注底层模型在不同本体间的泛化能力,通过工程化手段提升数据采集效率与模型压缩比,从而在有限算力下实现物理智能的跃迁,让各类设备具备自主交互与执行任务的能力。
Outlines
Sign in to continue reading, translating and more.
Open full episode in Podwise
