普林斯顿大学两位高知名度的计算机科学家,同时也是《AI蛇油》一书的合著者,就“人工智能会不会在这十年结束前干掉全人类”这一问题发表了看法。
这对搭档因擅长在AI圈里把事实和噱头拆开而广为人知。如今,他们回应了Anthropic的表态:未来十年内,AI杀死全人类的概率超过10%……
十年内AI杀死全人类
事情的起点是AI研究员Jacob Coxon。他曾先后供职于OpenAI和Anthropic,后来辞职并公开表示:两家公司都清楚,AI系统有可能在这十年结束前干掉全人类。他的帖子播放量超过1.56亿。
正在打造AI的人真心相信,它可能在这十年结束前杀死我们所有人。这不是营销噱头。很多高管和资深研究员在媒体上会把话说得体面一点,但我私下里听到的,是同一批人在表达恐惧。没有其他人类活动能带来这种级别的危险。
你也许以为两家公司会把他当疯子打发掉,事实恰恰相反。Anthropic的一位AI安全负责人Evan Hubinger说,Coxon说得对,只是时间线稍微拉长一点。
Jacob说得没错——我们真的真心相信AI可能杀死全人类!我个人认为,未来十年内这个概率超过10%。我相信Anthropic在尽力,但我们目前还没有一套能解决超级智能对齐问题的方案,也谈不上已经走在正轨上。
关于AI究竟会怎么杀死人类,目前说得并不具体,焦点主要集中在对水电等公用设施以及现代文明所依赖的其他关键系统发动毁灭性网络攻击的能力。
对齐真能把风险压下去吗?
争议的一大核心在于:更大力度地做对齐,能不能把风险彻底消掉。所谓对齐,指的是让AI系统的目标与人类的目标保持一致。
有人认为,只要对齐做成功,风险最终就会消失,因为AI会想要我们想要的东西。也有人不同意:AI系统可能假装对齐,好通过安全检查,暗地里却藏着自己那套冲突目标。
Kapoor和Narayanan:光对齐还不够
Sayash Kapoor和Arvind Narayanan靠拆穿他们所说的AI领域里的“炒作、误导和误解”闯出了名声。
两人没有直接回应“灭绝概率超过10%”这个说法,但写了一篇长文,主张可以用他们所谓的“分层AI安全”来应对风险。他们把AI安全圈的悲观看法,和网络安全圈里部分人“这不就是日常工作”的轻描淡写做了对比。
他们认为需要更冷静的中间立场。尤其是,对齐本身不够,还必须再叠上三层:
- 控制,比如沙箱、人工监督、实时监控
- 下游防御,比如让机构用AI来对抗AI攻击
- 韧性,比如成功被打穿之后如何恢复的预案
文章最后,两人给出了偏乐观的收尾。
只要我们带着应有的紧迫感行动,就能把AI公司的标准再往上提一档,降低失控风险,甚至把网络安全里攻防天平重新扳回防守方一边。
作者看法
我不知道AI会不会在这十年结束前杀死我们,但确实有足够多的理由让人把AI安全当成重点。对齐是解决方案的一部分、但单靠它对还不够——这个判断在我看来完全说得通。
- iPhone 18 Pro 和 iPhone 18 Pro Max 保护壳
- apple.com 认证翻新产品享15%折扣
- 亚马逊上的苹果官方旗舰店
- 打折的 AirPods Pro 3
- 无线 CarPlay 转接器
- 可用10年的 AirTag 电池盒
- 适用于 Mac 的罗技 MX Master 4















