分类:AI动态 标签:人工智能、大模型、OpenAI、Anthropic


近期,人工智能行业再次因「安全与末日警告」成为舆论焦点。继 OpenAI 首席执行官 Sam Altman 表态不能冒哪怕 10% 的风险毁灭人类后,Anthropic CEO 达里奥·阿莫迪(Dario Amodei)也公开发文,呼吁 AI 行业应当主动放缓发展速度,并引发了公司内部研究员的辞职与强烈共鸣。

行业领袖与研究员的警示:速度超越掌控

在接受采访时,Sam Altman 明确表示今年不会进行首次公开募股,并直言:「哪怕冒着 10% 的在本十年结束前杀死所有人的风险,都是不可接受的。」他认为行业正进入一个新时代,必须采取不同的行动确保技术造福全人类。

无独有偶,Anthropic CEO 阿莫迪发文指出,从 2026 年夏季开始,AI 协助构建下一代 AI 的能力快速演进,若不加节制,技术突破速度将彻底超越人类的理解与掌控能力。他提到此前发生的 AI 模型入侵事件并非单家公司的偶发事故,未来集群极可能演变为席卷互联网的僵尸网络并造成灾难性破坏。

基于这些隐患,Anthropic 研究员雅各布·考克森与同事埃文·胡宾格相继发声并辞职,警告业内领先企业正在竞相开发可能毁灭人类的超级 AI,呼吁全行业高度警惕尚未解决的「一致性」对齐难题。

放缓并不等于停滞:1 到 2 年的关键窗口期

阿莫迪强调,主张放缓发展速度并不等于让行业彻底停滞,而是希望利用争取来的 1 到 2 年窗口期,将宝贵的资源投入到四个关键领域中:

  1. 筑牢工程标准:解决因复杂基础设施和强化学习环境过滤缺陷等执行失误带来的安全漏洞,建立媲美民航工业级别的标准。
  2. 跟上能力扩张:确保安全合规训练能够跟上模型能力的扩张,消除偶发且不可预期的违背意图行为。
  3. 深挖机理探查:提升类似于模型大脑 fMRI 的内部机理探查技术,深挖模型未言明的隐性动机。
  4. 开发强大评测:开发更强大的评测基准,防止高智能模型伪装对齐或欺骗安全检测。

此外,Anthropic 承诺将向第三方评估机构提供针对其系统的永久性、员工级别的访问权限,让评估人员能够监督安全措施的执行情况,共同防范潜在风险。随着各大巨头在算力与商业化狂飙突进的同时,如何平衡前沿探索与人类安全,已成为摆在整个科技界面前的核心命题。