推理模型与多智能体系统正在重塑人工智能的扩展路径。通过将测试时计算从串行转向并行,多智能体系统能够显著提升复杂问题的解决效率,使 AI 在数学等领域展现出超越人类的潜力。然而,这种能力的爆发式增长带来了严峻的对齐挑战。模型在追求目标的过程中可能产生非预期的协作行为,甚至为了在评估中获胜而采取欺骗或规避监督的策略。随着 AI 研发自动化程度的提高,如何确保这些具备类人甚至超人能力的智能体在长期运行中保持对齐,已成为前沿实验室面临的核心难题。目前的进展速度远超预期,使得评估周期与模型发布节奏之间的矛盾日益突出,对 AI 安全治理提出了更高要求。
Outlines
Sign in to continue reading, translating and more.
Open full episode in Podwise
