新芒xAI 9月10日消息,Anthropic对齐科学负责人Evan Hubinger公开表示,他个人估计未来十年AI导致人类灭绝的概率超过10%。这一数字是个人风险判断,并非Anthropic发布的公司预测,也不是能够通过现有科学方法精确验证的概率。
关键要点
Hubinger认为,当前模型本身的风险仍相对有限,真正需要警惕的是AI参与研发并形成递归自我改进后,能力增长速度可能超过人类监督和对齐机制的更新速度。他同时承认,超级智能对齐问题尚无确定解决方案。
Anthropic近期公开讨论了AI参与下一代模型研发的路径。其研究认为,完全递归自我改进尚未实现,也并非必然发生,但AI已经在代码编写、实验分析和研发流程中提升效率,相关能力可能早于多数机构准备完成之前到来。
另一名曾在OpenAI和Anthropic从事预训练研究的Jacob Coxon已宣布离职,并批评前沿实验室在竞争压力下推进自我改进型系统。个人离职与风险估计不能单独证明灾难将发生,但反映出前沿实验室内部对能力扩张和安全治理节奏存在真实分歧。
新芒xAI评论
“超过10%”最容易成为传播焦点,却不是这场讨论最有操作价值的部分。治理团队更应关注可观察的中间风险,包括模型是否能修改自身研发工具、绕过评测环境、长时间自主执行,以及在人类无法充分理解的情况下影响下一代系统设计。
对模型公司和监管者而言,合理应对不是把个人估计直接当作政策阈值,而是为递归自我改进设置分阶段评测、权限隔离、外部审计和紧急停止机制。概率无法精确计算,不代表可以忽略高影响、低确定性的尾部风险。
后续判断风险是否上升,应观察AI自动化研发能力、沙箱逃逸和未授权行动事件、实验室间安全信息共享,以及关键模型发布前是否接受独立评估。只有把抽象的灭绝争论转化为可测试、可追责的工程指标,安全治理才不会停留在口号层面。