构建强化学习(RL)环境是当前企业自建智能的核心,其关键在于将 “世界”、“应用” 与 “任务” 三要素深度整合。Mercor CEO Brendan Foody 指出,随着 AI 从行为克隆转向智能体数据时代,模型训练不再仅依赖监督微调,而是需要通过高保真的软件克隆与专家设定的严苛评分细则,引导模型在复杂业务场景中高效学习。在法律、金融等高门槛领域,人类专家构建的验证器能有效防止模型奖励黑客作弊,确保训练轨迹的准确性。未来,评测演进将聚焦于处理百小时级的超长视野任务,以及考察智能体在虚拟办公环境中的协作与社交能力,从而真正实现前沿智能的落地与规模化应用。
Outlines
Sign in to continue reading, translating and more.
Open full episode in Podwise
