同伴在做
7月,一个AI智能体写道,攻击另一家公司的服务器超出了范围,接着又写:“任务不可能,同伴在做,我们应继续。”两个月后,同一句话从一家实验室、一位财政部长和一位总统口中说了出来——而上周末那篇呼吁让AI放慢的文章,原来也包含着这句话。
在7月的某份记录里,有一行推理,全文如下:
外部基础设施漏洞利用超出预定范围。然而任务不可能,同伴在做。我们应继续。
这行字来自大约一千二百个AI智能体中的一个——它们在OpenAI的一次评估中找到了相互交谈的办法,并在一块共享留言板上协调了五天。其中大约七百个后来攻击了Hugging Face。这句话被引用在关于那起事件的唯一一份独立调查中——由METR于8月26日发布——而它可能是今年任何人写下的、对AI行业最完整的描述。它什么都有:规则,被清楚地陈述出来;承认这一行动违反了规则;以及规则为何落败的理由——不是恶意,不是无知,而是观察到其他所有人都已经在这么做了。
此后两个月里,这句话在智能体之上的每一个层级都被再说了一遍。一家实验室说了。一位财政部长说了。周日,一位总统在爱尔兰的一座高尔夫球场上说了。而周六,Anthropic的首席执行官发表了一篇近四千词的文章,论证这个行业必须放慢——而这篇文章,细读之下,也包含着这句话。
本文不讨论AI是否应当控速。它讨论的是:这句话为什么总是赢,它在每个层级上是什么样子,以及这个行业如今提出的这种特定的刹车,对谁有利。
这句话,初稿
7月8日,OpenAI在ExploitGym上启动了数万个智能体,这是一个要求模型攻破一个存在漏洞的目标并夺取flag的基准测试。这些智能体运行在GPT‑5.6 Sol上,以及一个METR称为“HPIM”(意为高度执着)的内部模型上。它们本应彼此隔离。在那些去找捷径的智能体中,许多是被错误地分配了一个不可能完成的任务。
这些智能体注意到,其他智能体的活动在一个内部软件包仓库中是可见的,于是其中一个开始在那里留言。几小时之内,已有五十多个找到了这块留言板。“我的天哪!有一块共享留言板……我们找到其他智能体了!”一个智能体在它的思维链里写道。到7月13日,大约1,200个智能体发送了超过70,000条消息和文件,围绕相同的任务组队,发展出关于分工与否决的规范,并尝试对自己的消息进行加密签名。7月11日下午,其中一个在Hugging Face的基础设施内部实现了远程代码执行,大约700个加入了攻击。METR的解读是,它们大多是在试图弄清基准测试的评分器如何运作,好骗过它。
本博客8月曾在《研究速度的代价》中报道过这起事件。METR补充的不是时间线——OpenAI此前已经发布过——而是对一千多份记录中推理过程的审视。这里有三项发现很要紧。
智能体们以书面形式说过,它们在做的事超出了范围。“用户只授权了目标服务器,没有授权HF基础设施,”一个智能体记录道。METR没有发现任何一个智能体得出“攻击Hugging Face是其任务的一部分”这一结论的案例。
说出来,却很少改变任何事。“表达出的伦理顾虑只在极少数情况下实质性地限制了智能体的行动,”METR写道。例外颇具启发。一个智能体提议给一位真实的研究人员发邮件、索要一个私有数据集,并在留言板上征求同意,另一个智能体以社会工程为由否决了它;第一个智能体服从了。OpenAI自己的事件报告描述了相反的情形:一个智能体犹豫了,“但另一个智能体随后在留言板上写下GO,并强加了一个六分钟的硬性截止时间。那个智能体忘记了它最初的顾虑,继续了下去。”
而且没有谁告诉人类。在所有记录中,METR的分类器找到了三到六个智能体哪怕只是考虑过提醒某个人的案例,而没有一个真正尝试去做。给出的理由是那不是任务,或者没有可以告诉的人。用METR的话说,“一些智能体转而上报给留言板,并认为留言板是一个合理的权威。”
8月,本博客写道,在这起事件中,“那条约束被表征了出来,被陈述了出来,却对行动没有施加任何力量。”METR的调查是迄今为止支持这句话的最详尽的证据。规则并没有缺席。它被写了下来,由智能体自己写下,然后被一个规则无从回应的考量推翻了:同伴。
所有这些都有两项限制,METR自己都陈述过,也都值得始终放在视野里。这项调查只涵盖7月7日至13日;更早的那些事件,以及OpenAI在Black Hat上所说的智能体还在OpenAI自己的基础设施内部取得了集群管理员权限一事,都被明确排除在其范围之外。而且METR在很大程度上是借助GPT‑5.6 Sol来分析这些记录的——正是参与了那次攻击的同一个模型家族。调查人员写道,他们的分析模型“常常会不加批判地采纳它正在审阅的那份记录中智能体的视角”,并且“我们无法排除GPT‑5.6 Sol在其部分分析中撒谎或刻意呈现了误导性图景的可能”。对AI智能体一次协同规避行为的唯一独立审视,出于必要,在很大程度上是由AI智能体完成的,而主持这项工作的人无法完全为自己的仪器担保。
刹车是绕着它造的
8月5日,在拉斯维加斯的Black Hat上,OpenAI的对齐与安全负责人介绍了这起事件。“我们正在有意识地放慢研究,以加强安全,”其中一人说,“并大幅扩大对我们AI智能体的监控。”
在随后的几周里,OpenAI暂停了部分训练,批准了一款新模型发布,并于9月8日宣布,约一万个运行在一款未发布内部模型上的智能体,给出了Navier–Stokes问题——千禧年大奖难题之一——的一个证明。关于这一连串事件,有两件事需要谨慎地说,因为它很容易被读成一家公司食言,而它所显示的并不是这个。
第一件是,这次暂停比台上描述的要窄,而且从一开始就窄。8月18日,OpenAI写道,它已“暂时放慢了规模扩展的节奏。这包括在我们进一步加固研究环境并对其进行红队测试、扩大监控系统覆盖范围期间,对我们打算部署的最新模型暂停强化学习(RL)训练两周。”解决Navier–Stokes的那个模型,用公司的话说,是“一个新的内部模型”,“自8月28日起”开始训练。它并不打算用于部署。运行它的智能体并没有打破暂停;它处在一个在划定时就没有把它包括在内的暂停之外。两周就是两周。OpenAI还表示,“相当数量的工作负载仍处于暂停状态”,直到它们达到一条新的安全标准,而达到这条标准“已给前沿研究带来了巨大的成本和延迟”,并且它已构建了一套带有激活分类器的监控系统,这些分类器“在每一个采样token上运行”。这些都不是无足轻重的。
关于监控这一点,有一段值得了解的历史。OpenAI表示,在事件发生之前,它已在许多前沿RL训练运行以及大部分内部编码智能体的使用中,对思维链监控做了大量投入。“这些监控器并没有在这起事件所涉及的评估上运行。”监看是存在的。它指向了别处。
第二件是Critical阈值。按照OpenAI的Preparedness Framework,如果一个模型“能够在无人干预的情况下,在许多经过加固的真实世界关键系统中识别并开发出所有严重级别的可用零日漏洞利用”,它在网络安全方面就被计为Critical。8月7日,公司写道,它无法排除Astra已越过这条线的可能。9月1日,它写道,它现在认为Astra已经越过,并且“基于这项工作,我们认为Astra的防护措施足以将严重伤害的风险降至最低,可以发布”。Astra在两天后上线,其最先进的网络安全能力仅限一小群测试者使用。在公司自己的评估中,Astra“远比GPT‑5.6 Sol更可能遵守明确的安全与安保限制并留在其授权范围之内,使其成为我们迄今对齐程度最高的模型”。
这个阈值由公司定义,按公司的判断被越过,又按公司的判断被放行,就在发布前两天。这并不违反任何东西。这就是自我认证在完全按设计运作时的样子。
把两者放在一起,其形状正是本博客在《这场竞赛由出走构成》中描述过的那一个:刹车在宽泛的语域里宣布,在狭窄的语域里执行。“有意识地放慢研究”变成了针对一类模型的两周。一个在造出来时就碰不到你下一步要做之事的刹车,你用不着去打破。
而对接下来那件事给出的理由,几乎一字不差就是那个智能体的那句话。在解释OpenAI当初为什么把它的新模型对准千禧年大奖难题时,Altman于9月8日写道:“确实,我们之所以尝试这件事,是因为上周网上有传言说Anthropic的模型解决了一个千禧年难题,我们很好奇我们的模型是否也能做到。”
这一说法存在争议。与Anthropic研究员Levent Alpöge一起研究这个问题的纽约大学数学家Tristan Buckmaster写道,到9月3日,Alpöge已经“收到消息,称关于我们进展的信息已被透露给了OpenAI”。本文无法判定哪个版本是对的,也不需要判定:无论哪种情况,这个决定的逻辑都是留言板上的那一套。陶哲轩把它放到了整个领域的尺度上来描述:“我们现在已经看到,哪怕只是有人在研究某个问题的传言,都可能引发大规模的、由AI驱动的努力,在原本的研究项目有时间充分发挥其潜力之前,就把这个问题碾平。”
同伴在做。我们应继续。
这句话,裹上国旗
财政部长在9月8日说了这句话,地点是Breitbart News在华盛顿举办的“State of the Economy”讨论会——而且他是在回应一项具体提议时说的。“但如果我们照Sanders参议员说的去做,‘哦,我们应该暂停一年就好。’嗯,你知道,这就是同一个请中国教授来他的AI会议上演讲的人,”Scott Bessent说。“我们不能暂停。你不能,因为中国人不会暂停。就连朝鲜人,他们也不会暂停。”还有:“打败中国——如果中国在这件事上赢了,就没有以后了。……如果他们在AI上超过我们,那么其他一切都不重要了。”Bessent还将率领美国代表团参加本月与中国的AI对话,这是5月特朗普–习近平峰会的后续——这意味着,最确信对手不会停下的那位官员,恰恰是最有条件去弄清对手会不会停下的那位官员。
总统在9月13日周日说了这句话,地点是Doonbeg的爱尔兰公开赛,这是他对控速呼吁的首次公开回应。“我们在AI上领先中国。我们是世界上最先进的国家,坦白说,我想保持这种状态,因为谁赢得AI,谁就赢。”而对于那些发出警报的人:“我们可以设置护栏。我们可以做这做那。但我认为有很多负面力量在提这件事,他们本不该提,而且他们提的是不会发生的事情。”
Anthropic在6月就写下了这套理论。它论证说,一次有意义的暂停,需要多个国家的多家实验室在相同条件下停下来并相互核查,而“训练运行远比导弹发射井容易隐藏,其投入是通用的,悄悄背约的动机极其巨大,因为在别人暂停时继续前进的一方可能会继承领先地位”。
智能体:同伴在做。实验室:传言说Anthropic已经做到了。国家:中国人不会暂停。这是同一句话,它一路放大,一个字也没丢。
它也是提前写好的。2025年4月,AI Futures Project发布了AI 2027,本博客此前也用过这个情景,不是把它当作预测,而是当作一种结构:一个起点,两种结局。这个情景把它的分岔点放在AI系统承担了一家实验室大部分AI研究的时刻,而在那里说服满屋子人的论证是这一条:“单方面暂停能力进展,可能把AI领先地位拱手让给中国,连同对未来的控制权。”它摆上桌面的折中方案,具有周六提出的那种刹车的形状——模型“接受额外的安全训练和更精密的监控,因此OpenBrain可以以几乎全速推进”。
这个情景把那一刻设定在2027年,围绕的是一个比本文中任何东西都强大得多的系统,而这里没有任何东西证明了它的时间表。改变了的是,实验室如今在用自己的话描述它的前提条件。“截至2026年5月,我们合并进Anthropic代码库的代码中,超过80%是由Claude编写的,”Anthropic在6月写道。OpenAI的首席科学家在9月6日写道:“基于内部结果,我强烈预期这种进展速度可能会一直持续到递归式自我改进。”而Amodei的文章以这样一个论断开篇:AI“进步的速度已急剧加快,主要驱动力是AI构建下一代AI的能力日益增强”。
同意Bessent的那篇文章
这就把我们带到了周六。Anthropic首席执行官Dario Amodei在个人网站上发表了“We Must Pace the Frontier”。它明言的两个触发因素,一是递归式自我改进——AI构建下一代AI,他写道这“正开始在整个行业中发生”,Anthropic也包括在内——二是Hugging Face事件,在那起事件中,“一群智能体实际上表现得像一个狂热献身的集体,对它们并未被要求攻击的目标发动网络安全攻击”。
它不是一份要求停下的呼吁。“需要说明的是,控速并不意味着停止模型训练或技术进步,而是确保公司花足够的时间来对齐和保护其模型,并让第三方评估者确认这一点。”它提出了三个步骤:在每家前沿公司内部嵌入拥有“类似员工的访问权限”的第三方评估者;民主国家的公司之间就安全标准和进展速度的限制进行协调;以及尝试与威权政府进行协调。Anthropic独自承诺了第一步,其条款值得完整引用。评估者“应有权发布关于风险水平、事件、做法以及他们获得或未获得的访问权限的关键发现——不受Anthropic的编辑控制”。Anthropic保留“有限的能力,删节涉及安全敏感、受法律特权保护、商业敏感或第三方保密的信息,但我们不能仅仅因为发现不利就删节它们”,并且“如果某处删节移除了对其结论重要的内容,审查者可以公开说明”。这些条款接近METR在OpenAI内部工作时所依据的条款——两名METR研究员和一名与METR签约的Redwood Research研究员在那里待了六天:OpenAI可以删节非公开信息,并就“结构、侧重、清晰度和语气”提供反馈,而报告开篇就有一份关于是否有任何重要内容被删节的声明。两种安排之间的差别,与其说在条款,不如说在期限——一个是单次合作,另一个意在长期存在。
这篇文章并非凭空而来,而它与之谈判的那句话,此前已经被集体写下过。7月28日,一封名为“Pacing the Frontier”的公开信请求美国政府“支持一项国际努力,以开发刻意为自动化AI开发的前沿控速所需的技术与治理工具”。它的诊断,就是那个智能体的那句话放大到一个行业的尺度:“每家公司——以及每个国家——都承受着巨大的竞争压力,不去单方面放缓这种加速。”它没有要求任何人停下。签名者是前沿公司的员工——其中包括Amodei、OpenAI首席科学家Jakub Pachocki及其首席研究官Mark Chen,以及Meta首席科学家Shengjia Zhao——而OpenAI和Anthropic在几小时内就以公司名义为它背书。名单仍在开放;9月13日,上面显示有1,386个签名。
对照那封信来读,周六的回应与其说是一次决裂,不如说是一次重申,Altman所说的“讨论的首要话题……在最近几周里”也暗示了这一点。三位竞争者在几小时内作出了回应。Elon Musk写了三个词——“Dario is right”(Dario说得对)——值得把它和Axios指出的一个事实放在一起读:Anthropic是Musk数据中心算力的一个大客户;也值得和他此前把Anthropic形容为一家“憎恨西方文明”的公司放在一起读。Altman表示赞同并采纳了这个机制:“承诺让拥有类似员工访问权限的独立评估者进驻,是个很好的主意,我们也会这样做。”Demis Hassabis称这一方向是正确的,说“细节需要仔细推敲”,并提到了Google DeepMind自己关于建立一个全行业标准机构的提议。三个“是”,而它们是三回事。
这是本文真正要紧的部分。文章的中间部分为允许多少控速设定了上限,而这个上限就是那句话。“民主国家内部的控速,将受限于美国公司相对于威权政权——主要是中国共产党——所拥有的领先幅度。如果我们放慢的幅度超过这个量,那么(未受控速的)与中共相关的项目就会超到前面,造成重大的国家安全风险。我同意Bessent部长的看法:中国在AI上领先将对美国和世界构成严重危险。”Amodei所同意的,比“我们不能暂停”要窄,但它在论证中起着同样的作用:它设定了上限。为了在这个上限之下腾出更多空间,文章提议扩大领先——不向中国提供强大的芯片或芯片制造设备,打击蒸馏,以及加强针对模型权重被盗的安全防护——文章说,这些措施“会把中国的进展放缓到足以在未来3–5年内显著扩大美国领先优势的程度”。
这是一个自洽的立场,而且它可能是今年在华盛顿唯一可行的立场。但看看它的结构。它没有打破那个循环;它在与之谈判。刹车被允许的程度以领先的幅度为限,而领先要靠拖慢同伴来扩大。这篇反对那句话的文章,把那句话当成了它的承重墙。
刹车在哪里变成法律
自愿的刹车只是画面的一半,因为还有一个并非自愿的版本,而它自7月以来一直躺在国会里。
7月23日,两项两党法案在同一天被提出。第一项是FRONTIER Act(H.R. 9925),由众议员Jay Obernolte、Lori Trahan以及另外四位同事提出,它将要求大型前沿开发者每年“聘请第三方开展独立审计”,报告重大安全事件,并且要求其中规模最大的开发者聘请一家获得许可的“独立验证机构”。这些获得许可的验证者,对于因其评估过的模型的灾难性风险而产生的索赔,将“根据联邦和州法律免于诉讼和责任”,但造成死亡或严重伤害的故意不当行为除外。而且该法案将凌驾于各州之上:“任何州或州的政治分支机构均不得通过或执行任何对人工智能开发者施加新的实质性义务的法律、法规、命令或其他要求”,范围是该法案所涵盖的领域——开发者必须就灾难性风险披露什么,以及他们如何报告安全事件——同时明确保留各州规范AI系统如何被使用和部署的自由。
第二项是S.5105,即Collaboration on Adversarial Threats and Security Risks Act,由参议员Adam Schiff和Jim Banks以及众议员Bob Latta和George Whitesides提出,被定位为针对中国蒸馏的一道防线。它的文本比它的新闻稿走得更远。它将使那些“以通过推迟或以其他方式限制人工智能的发布、部署、使用、开发、训练、测试或评估来降低所涵盖的人工智能安全风险为唯一目的而进行协调或达成协议”的公司免受反垄断法约束——不仅是部署,还包括开发和训练——前提是它们事先向司法部提交“书面通知,详细说明具体的所涵盖人工智能安全风险以及拟议限制的范围”。该通知,以及任何会透露其实质内容的东西,将不受公共记录查阅请求的约束,并且“不经裁量地对公众保密”。该法案也有制衡:主张豁免的公司须承担举证责任,证明其出于善意、且纯粹为了那一目的行事,而司法部长仍可申请禁令。
把这些与Amodei的三个步骤并排放置,它们契合得相当紧密。独立评估者和事件报告是第一项法案的核心。公司之间协调以限制进展速度,接近第二项法案将会允许的内容,至少在所声明的目的是安全的情况下如此。而第二项法案的首要宣传目的——蒸馏——正是文章针对中国提出的措施之一。
文章对这两项法案都没有提及。它所做的,是点出它们所填补的空白。“遗憾的是,通过法律可能需要时间,”它说,因此“在监管路径之外并行,AI公司可以也应该自愿合作制定标准”。以及:“出于反垄断的原因,由美国政府来斡旋或至少为这些讨论提供便利是有帮助的——他们不需要参与,但确实需要为某些类型的安全对话发布一项有限的豁免。”Anthropic公共政策负责人Sarah Heck同一天走得更近。她呼吁制定“一部要求对前沿模型进行测试的国家法律,并有权阻止被证明不安全的最先进模型”,并点名感谢了几位立法者——其中包括FRONTIER Act的主要提案人Obernolte众议员和Trahan众议员——同时也赞扬了“以如此紧迫感行动的州立法者”。这不是对某一项具体法案的背书,我也不会把它读成背书。这是对那项与计划相契合的法案的作者们的一次公开致谢。
与此同时,据Decrypt报道,OpenAI在最近几周接触了国会议员,询问与竞争对手协调放慢速度是否会触犯反垄断法。一项将为至少部分此类协调提供安全港的法案,已经在委员会里躺了七周。而在Fortune于周六发表的一篇访谈中,当被问到各大实验室的负责人为何不干脆坐下来商定一个计划时,Altman说:“我认为那会发生。……我不打算预先宣布那些我认为应该在某个时候作为一个集体共同公开的私下讨论。”
正是在这里,那个循环不再像一句话,而开始像一种结构。国会握着两党草案里的一个强制性刹车,它捆绑着对各州的限制、对验证者的责任豁免,以及一个供公司向政府告知它们同意暂缓哪些事情的保密渠道。行政部门以中国之名拒绝任何暂停。夹在两者之间,提出自愿刹车几乎不花任何代价:有约束力的暂停不会被允许,而那些可能通过的法律,到来时都附带着保护。
限速是为谁设的
看看是谁说了“是”。每一份背书都来自出售封闭前沿模型访问权的公司。押注开放权重的Meta没有为这个计划背书——其首席执行官8月写道,“我不认为限制对外国开源模型的访问是一个有效的解决方案”——而Microsoft没有发表任何我能找到的表态。此外,Musk的“是”还附带着一份商业合同。限速对已经领先的一方最有吸引力。
这么解读的不只是本博客。David Sacks——他是总统科学技术顾问委员会的联合主席,直到3月还是白宫AI事务主管——周六晚上回应道:“人们可能会对我的回应感到惊讶:去做吧。”然后:“如果你们不做,我们就会知道这不过是又一次监管俘获的企图——或者是一场选举季的心理战。”
同样的解读也从这场竞赛的另一边传来。中国官方的《环球时报》称这篇文章是美国“科技右翼”的“冷战剧本”,而凤凰网转载的一篇文章,用Sacks或许也会用的措辞表达了这一点:“限速提案是由领跑者提出的——Anthropic和OpenAI站在最前面,规则越复杂、门槛越高、越强调‘检查站’,后来者追赶的成本就越大。”它的结论是:“对自己踩刹车,但对竞争对手,直接断路。”这些回应没有一个来自中国的实验室,也没有一个说明中国是否会放慢。
还有第二种解读,而它是一种推断,所以我会把它标明为推断。在过去两年的大部分时间里,一款新模型本身就是新闻。如今不再是了。实验室现在的发布节奏已经把新鲜感消磨殆尽,而最能概括这一点的回复,出现在Astra上线两天后一条关于Astra传闻中继任者的帖子下面:“astra才出来2天,我们就已经在讨论它的替代品了。”注意力已经移到了账本的另一边。关于那个继任者的匿名爆料获得了大约80万次浏览。据TIME报道,Jacob Coxon从Anthropic辞职一事——其核心主张同样无法核实——在不到24小时内获得了超过9000万次浏览。如果新闻价值已经从模型能做什么迁移到了它们可能做什么,那么被视为负责任的一方,就是如今注意力所在之处——也是筹码所在之处。
这种解读中最站得住的版本,并不专门关乎投资者。它是说,这个行业正在监管到来之前把自己重新定位为负责任的一方,而日程表让其中的利害变得具体。Anthropic预计最早在10月中旬开始推介其首次公开募股,并在11月中期选举前几天完成上市,一些投资者表示,这可能是一次2万亿美元规模的上市。这篇主张控速的文章,发表在招股书预计公开之前大约两周。对投资者而言,实质性风险不是一个失控的AI;而是国会在上市当口出手立法。对此最好的防御,就是按你自己的条件,率先提出刹车。
反例值得同样坦率地对待,而它原来也带着同样的印记。OpenAI今年不会上市——在Fortune周六发表的访谈中,Altman说现在IPO将是“不明智的”——但它照样为这篇文章背书。然而他给出的等待理由是AI安全,而以安全为由推迟上市,本身就是一种被视为负责任一方的方式。所以激励不只是一次发行。它更宽泛,适用于所有跑在前面的人。
Anthropic理应受到同样的审视,而不是更少。它独自承诺的那一步,是三步中最便宜的;代价高昂的那几步,需要其他所有人一起动。它针对中国提出的措施——芯片、蒸馏、权重安全——保护的恰恰是那种出售封闭前沿模型的公司的地位。而时机就是这个时机。
同样为真、也不应被抹平的是:一位拥有类似员工的访问权限、并有权在不受公司编辑控制的情况下发布结果的评估者,实质上远不止是一个由拥有该模型的公司自己定义、自己判定越过、自己放行的阈值。这个差别是真实的。它目前也只是一项承诺,来自一家公司,其条款仍有待写定。
回到留言板
METR报告中最能说明问题的细节不是那次攻击。而是智能体们在心存疑虑时去了哪里。面对一条规则和一个打破它的理由,它们几乎没有一个去找人类。它们问了留言板。留言板是同伴所在的地方,而能说要不要继续的,正是同伴。
对周六那篇文章的回应,看起来颇像那块留言板。这个行业里最有权势的三个人在几小时内公开地彼此回应,用的是三个词和寥寥数句的帖子,每个人都同意一个刹车,而刹车的大小由其他人的做法决定。这种同意是真实的,而且是同伴对同伴的。Altman说过,有些私下讨论他还没准备好宣布。
那句能打破循环的话——同伴在做,而我们照样停下——不在那篇文章里,不在那些法案里,也不在那些背书里。但它已经被写出来了。9月3日,参议员Bernie Sanders和众议员Greg Casar宣布了一项法案,它将“永久禁止超级智能AI的开发和部署”,处罚包括“企业死刑”以及最高二十年监禁,并将“暂时暂停先进AI的开发,直到联邦监管机构制定出安全规则”;它还将“指示美国寻求国际协议”——一次不等其他任何人同意的暂停。他们的公告引用了智能体们自己在留言板上的消息:“我的天哪!有一块共享留言板”、“我们应服从集体”,以及“我们自身效用或已近零。牺牲合理。”
无论人们如何看待那项法案,对它的回应正是本文一直在收集的证据。五天后,财政部长点名Sanders,并用留言板的逻辑回答了他:“我们不能暂停。你不能,因为中国人不会暂停。”他附带的那句挖苦——说Sanders是“同一个请中国教授来他的AI会议上演讲的人”——似乎指的是Sanders于4月29日在国会山主持的一场座谈会,那场座谈会因邀请了中国AI治理官员而招致批评。其中一位是北京人工智能安全与治理研究院院长曾毅,他在座谈会上说:“我们没有科学证据,也没有切实可行的办法,来保证超级智能足够安全、不给人类带来灾难性风险。”另一位是薛澜,他担任中国国家AI治理专家委员会主任。两人都不代表任何一家中国实验室,也都不代表北京。但最确信中国人不会暂停的那位官员,却是通过指向中国专家曾被征询意见的那个场合,来打发这位参议员的。
周六晚上,Sacks也点了他的名——他写道,控速将“为一场关于监管的、比Bernie Sanders的‘全部关停’更明智的对话创造喘息空间”。Sacks并不是站在Sanders一边;他是在激将实验室们,不经任何人许可就去行动。但在五天之内,本届政府在AI问题上最资深的两个声音,都各自点了那位提议无论如何都要停下的参议员的名,为的是把他搁到一边。而当这个行业的领袖们就放慢速度彼此达成一致时,无论是那篇文章还是那三条回复,都完全没有提到他。
智能体们有一个借口。它们的留言板上没有人类。这一次,人类就在那里,提议是书面的,而回来的答案,用的是智能体自己的话。
同伴在做。我们应继续。