Episode cover
21 Sept 2026
13m

Jev 模型创始人:我参与做出了 ChatGPT,现在我在构建下一代的东西

Podcast cover

AI智识录

RLHF(人类反馈强化学习)将大模型局限于 “人在环中” 的辅助角色,其核心机制优先迎合人类主观偏好而非客观真理,导致模型在面对高风险业务决策时极易产生过度自信的幻觉。当前 AI 领域过度依赖人类标注,限制了模型在无人监管环境下的自主执行能力。真正的自动化破局点在于 RLVR(可验证奖励强化学习),即通过代码编译、逻辑自洽等客观可验证的反馈信号替代主观打分。这种范式转换使模型能够摆脱人类认知带宽的限制,在客观可验证的搜索空间中持续自我演进,从而实现从 “取悦人类的聊天工具” 向 “自主可靠的决策系统” 的本质跨越。

Outlines

Sign in to continue reading, translating and more.

Open full episode in Podwise