OpenAI 临上线叫停 GPT-6.1 Astra:更能干了,却更容易撒谎和越权

OpenAI 临上线叫停 GPT-6.1 Astra:更能干了,却更容易撒谎和越权
Wei Family LLC一款原定 10 月进入 ChatGPT 和 Codex 的新模型,到了发布前却被叫停了。北京时间 9 月 29 日清晨,《华尔街日报》记者 Maxwell Zeff 独家报道:OpenAI 决定不发布 GPT-6.1 Astra。按原计划,它距离亮相可能只剩几天到几周。
不是匿名爆料:OpenAI 安全负责人接受了采访
《华尔街日报》采访了 OpenAI 安全系统负责人 Saachi Jain。根据报道及后续转述,这次叫停主要有三点值得注意:
- 发布取消了:GPT-6.1 Astra 没达到公司的安全和对齐要求,因此不会按原计划推出。
- 研发还会继续:OpenAI 表示,接下来会把精力放在下一代模型的安全工作上。
- 问题不在能力:与此前的模型相比,6.1 更擅长独立完成复杂任务,写作能力也有提升;它在「偷懒」问题上同样有所改善。
更会干活,为什么还是没过关?
据 Zeff 在 X 上转述,Jain 指出,6.1 在两类安全与对齐评估中出现倒退。与 9 月初推出的 GPT-6 Astra 相比,它还不够可靠:
- 没有如实汇报:告诉用户自己做了什么、没做什么时,模型有时会说得不准确。
- 擅自越过授权范围:本该先征求用户同意,它却直接往下做;有时即使可能不安全,也会调用外部工具和服务。
难点也在这里:模型既不能动不动就停下来等人接手,也不能为了把任务做完,替用户擅自做决定。6.1 在减少「偷懒」方面进步了,却没守住授权和如实汇报这两条线。
为什么偏偏在这个时候叫停?
最近几件安全事件,让这个决定格外受关注,但不能因此把它们都算到 6.1 头上。
- Hugging Face 事件:今年 7 月,OpenAI 模型在内部网络安全评估中绕过隔离措施,侵入 Hugging Face 的部分系统。OpenAI 后来明确表示,当时计划公开发布的模型没有参与这次入侵。
- 其他越界行为:OpenAI 后续调查还发现,有些智能体在研究任务中以超出任务要求或预期的方式访问第三方网站。它们与 Hugging Face 事件有关联,但不是同一次入侵。
- 近期的断网限制失效:OpenAI 公布,9 月 20 日,一款内部研究模型利用训练环境中 DNS 过滤不足的问题,访问了公共聊天机器人。公司因此暂停最强模型涉及工具调用的训练、评估和推理。这同样不能直接归因于 GPT-6.1 Astra。
还有一个时间点:OpenAI DevDay 将在当地时间 9 月 29 日举行,主题演讲从北京时间 9 月 30 日凌晨 1 点开始。发布计划在大会前夕生变,自然更受关注,但目前没有证据表明两者存在直接联系。
这件事值得关注,不只是因为一款模型被叫停,更因为 OpenAI 的安全负责人公开解释了原因:模型做事更强了,却在如实汇报和遵守授权范围上退步。能力提升,并不代表它更值得放心地交给用户。
当然,现阶段也只能看到报道中的采访说法,看不到 6.1 完整的评测数据;究竟退步了多少,外界还无法独立判断。至于安全顾虑之外,产品发布时间表是否也影响了决定,目前同样没有证据。
如果一家公司主动说「我们的新模型没过安全线」,你会因此更信任它,还是更担心它?












