被OpenAI解雇后,三名安全研究员联名公开信曝光内幕

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
被OpenAI解雇后,三名安全研究员联名公开信曝光内幕
9525点击    2026-10-09 16:24

上周,OpenAI 宣布解雇三名员工,理由是内部调查发现三人违反了公司关于敏感信息访问与处理的规定,涉嫌在既定程序之外向第三方 AI 安全评估组织分享机密信息。


他(她)们分别是从事模型对齐相关工作的 Jasmine Wang、从事 AI 安全研究并曾参与 OpenAI 与外部安全评估机构之间技术沟通的 Tomek Korbak,以及从事 AI 安全及模型对齐相关研究的 Mikita Balesni。


就在今天凌晨,这三位研究员在社媒发表了一封写给 OpenAI 领导层的公开信,Mikita Balesni 表示,「我们被解雇的原因是,我们将 AI 安全置于 OpenAI 作为一家公司的短期利益之上。」


被OpenAI解雇后,三名安全研究员联名公开信曝光内幕


Jasmine Wang 表示,「公司解雇我的理由只有一个:访问了一位高管的邮箱。我想把事情原原本本地说清楚,因为在 OpenAI 过去的历史中,已经有太多人突然离开,而背后的真相却总是被各种说辞掩盖。」


被OpenAI解雇后,三名安全研究员联名公开信曝光内幕


Tomek Korbak 说到,「过去几个月里,我一直在提出一个安全方面的担忧:我们正在逐渐失去监测 AI Agent 思维过程的能力。而这种监测能力,恰恰是我们发现 AI 行为异常时最有效的手段之一。我认为,这才是我真正被解雇的原因。现在,我担心 OpenAI 会以解雇我们为借口,减少与外部审计机构 METR(Model Evaluation and Threat Research) 的合作。」


被OpenAI解雇后,三名安全研究员联名公开信曝光内幕


以下是三名研究员公开信的全文,其中披露了不少此前不为外界所知的细节。


OpenAI 无法独自确保 AI 安全


致安全与安保委员会(Safety and Security Committee)、安全顾问小组(Safety Advisory Group)及使命顾问委员会(Mission Advisory Council):


我们是上周被 OpenAI 解雇的三名安全与对齐研究人员:Tomek Korbak、Jasmine Wang 和 Mikita Balesni。之所以写这封信给各位,是因为你们肩负着监督 OpenAI 安全工作的责任。而我们的解雇事件,以及整个事件的处理方式,都与 OpenAI 的安全工作直接相关。


我们越来越担心,围绕此次解雇事件的内部和外部沟通,已经让昔日的同事们感到害怕。他们开始不敢再像过去那样说话、开展工作,而这些做法直到上周还是 OpenAI 日常工作中不可或缺的一部分。


过去,我们可以公开提出安全方面的担忧,也可以表达不同意见。公司还鼓励我们与独立安全机构合作,借助外部专家的专业知识开展研究。这正是 OpenAI 曾经与众不同的地方,也是我们无比自豪曾经加入这个团队的原因。


AI 不是一项普通的技术,OpenAI 也不是一家普通的公司。我们这些从事安全研究的人,往往比其他人更早发现风险。要弄清楚如何应对这些风险,我们必须与外部专家保持密切合作。能够放心地开展这种合作,不必担心因此受到惩罚,同时有清晰的内部流程支持相关工作,这本身就是一项至关重要的安全保障机制。


我们认为,如果那些最接近风险的研究人员,无法继续与彼此以及第三方机构建立高度信任、充分沟通的合作关系,那么通往超级智能的道路就不可能安全地走下去。


我们写这封信,就是为了捍卫这种文化。可能有些收信人并不了解我们。事实上,我们三个人都已经在 AI 安全领域工作多年。


Tomek Korbak 在 GPT-2 时代就开始研究如何利用强化学习实现语言模型对齐,并以此完成博士论文。之后,他在 Anthropic 从事相关技术的实际应用研究。加入 OpenAI 后,他主要研究思维链可监测性(Chain-of-Thought Monitorability),参与撰写了 OpenAI 的安全战略,并参与分析 Astra 级模型思维链可监测性下降的根本原因。在 Hugging Face 事件调查中,他还是 OpenAI 与 METR 对接的技术联系人。


Jasmine Wang 于 2019 年在 OpenAI 政策研究团队实习,期间参与撰写了《可信 AI 开发》(Trustworthy AI Development)报告。之后,她曾在英国 AI 安全研究所(UK AISI)领导一个团队,并于 2025 年重返 OpenAI,共同负责安全论证(Safety Cases)项目。她还提出了「Pacing」这一概念,后来这一概念因《Pacing the Frontier》请愿书而广为人知。这份请愿书获得了 394 名 OpenAI 员工的签名支持。


Mikita Balesni 是 2023 年 Apollo Research 的创始成员之一,主要研究 AI 失对齐问题,也是最早注意到 AI 开始意识到自己正在接受评测的研究人员之一。在 OpenAI,他从事对齐评测、失对齐科学以及思维链可监测性研究,也参与了 Hugging Face 事件调查。


在加入 OpenAI 之前,我们三人共同发起了一份跨行业立场文件,其中两人担任主要作者。文件名为《思维链可监测性:AI 安全领域一个全新而脆弱的机遇》(Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety)。


一、关于我们被解雇这件事


对我们来说,OpenAI 远远不只是一份工作。它所肩负的使命,一直是我们生活中非常重要的一部分。工作期间,我们始终按照公司的使命行事,也遵循当时公司内部通行的工作规范。


但这次解雇让我们担心,OpenAI 内部的工作规范正在发生变化,而员工如今已经不清楚哪些事情可以做,哪些事情会触碰红线。考虑到 AI 发展过程中存在的重大安全风险,我们不能让员工在一个充满恐惧、规则又不明确的环境中工作。这样的环境会阻碍 AI 安全研究,也会削弱第三方机构对公司的监督能力。


像我们这样突然遭到解雇,而且整个过程又以如此公开、突然的方式处理,正在让 OpenAI 过去引以为傲的开放文化受到寒蝉效应的影响。如果上个月还被视为正常的工作行为,这个月突然就成了解雇理由,那么 OpenAI 的每一位员工都会开始猜测,公司的红线究竟在哪里。


我们知道,现在外界流传着不同版本的说法。对于其中一些事情,我们希望直接向各位说明。


首先,我们并不是 The Information 那篇报道的消息泄露者。那篇文章涉及所谓的新型、可监测性更低的模型架构。我们不知道消息究竟是谁泄露的。而且,我们根本没有理由泄露这些信息。恰恰相反,这篇报道损害了我们一直在推进的工作。我们当时正致力于推动跨公司合作,对开发无法有效监测的模型架构加以限制。


被OpenAI解雇后,三名安全研究员联名公开信曝光内幕

文章链接:https://www.theinformation.com/articles/secret-technique-behind-openais-astra-model-sparks-security-concerns


其次,我们认为,自己与外部机构的任何接触,都没有超出各自工作的职责范围。这封邮件的各位收信人都很清楚,Hugging Face 事件调查此前没有先例可循,相关内部政策也是在调查过程中逐步制定出来的。Tomek 已经尽最大努力遵守 OpenAI 当时的政策,同时延续公司自成立早期以来与第三方机构合作所遵循的惯例。这次调查尤其敏感。要与外部合作方建立信任,双方就必须保持密切沟通。Tomek 一直尽力谨慎处理这些沟通。


Mikita 当时也在处理类似的工作。他负责推动跨公司合作,争取各方就防止模型失去可监测性作出承诺。这项工作只有通过与外部机构进行大量沟通才有可能成功。Mikita 在推进工作时,始终与 OpenAI 董事会成员及公司高管进行协调和讨论。他当时的理解是,OpenAI 高层支持这项工作。整个过程中,他一直向直属管理层确认相关事项,并在对外分享材料之前,仔细删除其中的敏感信息。他的所有行动都是出于善意,也符合公司当时通行的工作规范。


至于 Jasmine,她获得某位高管邮箱的访问权限,是因为招聘工作需要,而且事先得到了授权。后来,这项权限已经不再需要,她便主动要求撤销。但 IT 部门没有完成权限移除,而 Jasmine 自己既无法撤销权限,也无法主动退出那个邮箱。两个邮箱的邮件被合并显示在她的收件箱里,而且界面没有明确标识每封邮件原本属于哪个邮箱。因此,当 Jasmine 意外点开一封敏感邮件时,她在几分钟内就向那位高管报告了这件事,并再次向 IT 部门提出权限撤销请求。


我们认为,有必要把这些事情解释清楚,因为我们非常珍惜与 OpenAI 同事之间的关系。与此同时,我们也担心目前四处传播的各种传言,包括有关一份共同撰写、面向董事会的备忘录的指控。公司从未向我们提出过这项指控,因此我们也没有机会回应这个我们认为存在误解的说法。同样,我们也没有向媒体透露自己被解雇的消息。


如果可以选择,我们当然更希望不要以这种突如其来的方式成为公众关注的焦点。现在最让我们担心的是,解雇原因至今没有得到清晰解释,整个过程又如此公开,再加上各种传言不断传播,已经让仍在 OpenAI 工作的人感到寒心,不敢轻易发声。而此时此刻,世界上太多与 AI 安全有关的事情,都要依靠他们来完成。


二、离开之前,我们给 OpenAI 的三点建议


1. OpenAI 必须兑现上个月的公开承诺,让第三方安全审计机构深入参与公司内部工作。不能拿我们的解雇当借口,退出这些合作。


继续与整个 AI 安全生态保持合作,对 OpenAI 实现自身使命至关重要。今年夏天,我们参与的 Hugging Face 事件调查,以及 OpenAI 与外部审计机构的合作,是我们最引以为傲的工作成果之一。这些工作帮助外界更清楚地了解了前沿 AI 技术的真实情况。


我们担心,公司可能会以我们的解雇为理由,终止与 METR 的合作,或者大幅限制外部审计机构的访问权限和工作范围。我们希望 OpenAI 能兑现 Sam Altman 在 9 月 12 日公开作出的承诺:让独立评估人员能够持续进入公司开展工作,并获得类似内部员工的访问权限。


2. OpenAI 必须保证前沿模型的可监测性。


目前,整个行业还不知道该如何安全地开发和部署那些无法被有效监测的模型。而前沿模型的可监测性正在下降。只要我们仍然依赖可监测性来保障 AI 安全,OpenAI 和其他前沿 AI 公司就不应该继续推进那些会进一步削弱模型可监测性的技术开发。


我们赞同 Jakub 此前的公开表态:思维链的可监测性「十分脆弱,而且遗憾的是,整体趋势正在朝着不好的方向发展」。我们同样认同他所说的,希望「防止整个行业陷入一场竞相开发不可监测架构的竞争」。我们仍然相信,整个行业在这个问题上进行协调非常重要,也希望 OpenAI 能够支持员工推动这项工作。


3. OpenAI 必须继续支持开放、透明的讨论文化,让内部安全研究人员能够与整个 AI 安全生态保持沟通。


如果 OpenAI 的员工不再觉得自己能够在公司内部提出安全问题,或者不敢再通过充分、高效的沟通渠道与外部安全机构合作,那么所有人面临真正灾难性事件的风险都会上升。我们敦促 OpenAI 公开重申对透明、开放文化的承诺,让员工能够放心地在公司内部和外部提出担忧。


OpenAI 内部的研究人员,是防止重大问题发生的第一道防线。自公司成立以来,开放文化一直是它的重要特点。这种文化必须得到保留。我们还敦促 OpenAI 明确说明,员工应该如何与外部安全机构开展合作,让大家不用再去猜测,那些不断变化的规则边界到底在哪里。


为了推动公司内部对此展开讨论,我们希望这封信能够在 OpenAI 内部得到广泛传阅。虽然我们已经不再是 OpenAI 的一员,但我们依然非常尊重过去一起工作的同事。我们希望他们能够继续督促 OpenAI 坚守自己的使命。因为我们很清楚,没有这些员工,就没有 OpenAI。


原贴链接:https://x.com/balesni/status/2108262814003687745


文章来自于"机器之心",作者 "机器之心编辑部"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md