
先说结论:10%不是经过观测得出的事故率
Anthropic对齐科学团队负责人Evan Hubinger提出“未来十年AI导致人类灭绝的概率超过10%”后,一个最常见的问题是:这个数字究竟怎么计算出来的?
从目前公开材料看,它不是依据一套公开公式算出的统一结果,也不是来自大量可重复事件的统计频率,而是研究人员综合技术进展、风险路径和安全能力后给出的个人概率判断。新闻标题保留数字,却常常删掉“我个人认为”这一前提,容易让主观预测看起来像确定的测量值。
为什么前沿AI风险很难像天气一样预测
缺少可重复的历史样本
天气、交通和疾病风险可以利用大量历史数据校准模型,但人类从未经历过假设中的超级智能失控事件。研究者面对的是一次性、尚未发生的未来情景,因此很难检验“10%”与“5%”究竟哪个更准确。
不同人对问题的定义可能不同
有人评估的是AI直接失控,有人把恶意使用、关键系统故障和连锁社会风险一并纳入;有人讨论未来十年,有人评估更长时期。问题定义、时间范围和前提不同,得出的数字自然无法简单横向比较。
治理进展本身会改变概率
风险并不是写死的常数。如果模型发布前的评估更严格、关键权限受到限制、异常操作可以追踪并及时中止,悲观情景出现的可能性就可能下降。反过来,如果能力快速提升而安全措施滞后,研究者可能上调自己的判断。
更大规模的专家调查怎么说
一项针对2778名AI论文作者的调查提供了更宽的参照。论文显示,在不同提问方式下,38%至51%的受访者对“与人类灭绝同等级的极端负面结果”给出了至少10%的概率;针对一项相关问题,预测中位数为5%,平均值为9%。
这组结果有两个含义。第一,AI极端风险并非只有少数人讨论,专业群体中确实存在广泛忧虑。第二,回答高度分散,部分研究者非常担心,也有人认为概率很低。调查还提醒,AI研究经验不等于专业预测能力,受访者给出的仍然是带有不确定性的判断。
此外,这项调查的题目和时间范围并不完全等同于Hubinger的“未来十年”说法,不能拿来为他的具体数字作直接证明。
2026年国际安全报告提供了怎样的基准
由百余名专家参与指导的2026年《国际人工智能安全报告》对“失去控制”给出了相对克制的表述:当前AI系统还缺少造成此类局面所需的完整能力,但在自主行动、长期规划以及识别测试环境等相关方面正在进步。
报告同时指出,专家对失控风险的看法差异很大,其发生概率、具体形式和时间都很难确定。这比单独引用某位研究人员的数字更接近当前知识边界:风险不能被证明为零,但也没有可靠依据把十年内的具体概率写成公认事实。
普通读者应该怎样看待“AI灭绝概率”
第一步是检查发言主体。个人观点、企业声明、学术论文和多专家报告的证据等级并不相同。第二步是检查时间范围和风险定义,避免把长期极端情景套到今天的产品上。第三步是关注可以验证的治理措施,例如模型评估是否公开、系统权限是否受控、重大异常是否披露。
低概率但后果严重的风险值得研究和预防,但严肃预防不需要制造恐慌。把“超过10%”放回完整语境,才能既看到业内人士的担忧,也保留对证据质量的判断。
FAQ
Q: AI安全领域的10%能否理解为十年后必然有十分之一概率发生灾难?
A: 不能。它是基于多个未来假设的个人概率判断,并非通过可重复历史样本计算出的稳定事故率。
Q: 专家调查是否证明多数研究人员支持同一个结论?
A: 没有。调查说明不少研究人员认真看待极端风险,但回答差异很大,而且调查问题与“未来十年超过10%”并不完全相同。
标签: #资讯
