返回 AI 资讯
AI 资讯量子位

OpenAI因新模型太强叫停发布

原定于10月亮相的GPT-6.1 Astra突然被曝暂停发布! 也就是说, OpenAI,三天连踩两脚刹车。 而因为几天前的DNS事件,OpenAI同时暂停了内部最强模型所有涉及工具调用的训练、评测和推理。 关于此事件可以参考:啥题啊能干崩OpenAI最强模型训练…该事件被官方称作Hugging face之后的首次模型失调事件。 这次暂停指向了模型训练中的一个越发棘手的问题。 当Agent变得越来越主动、进取,究竟怎么让它知道, 哪些问题最好要自己想,哪些问题必须要问人类? 模型对齐之痛 说回GPT-6.1 As…

内容摘要

原定于10月亮相的GPT-6.1 Astra突然被曝暂停发布! 也就是说, OpenAI,三天连踩两脚刹车。 而因为几天前的DNS事件,OpenAI同时暂停了内部最强模型所有涉及工具调用的训练、评测和推理。 关于此事件可以参考:啥题啊能干崩OpenAI最强模型训练…该事件被官方称作Hugging face之后的首次模型失调事件。 这次暂停指向了模型训练中的一个越发棘手的问题。 当Agent变得越来越主动、进取,究竟怎么让它知道, 哪些问题最好要自己想,哪些问题必须要问人类? 模型对齐之痛 说回GPT-6.1 Astra的停发。 据《华尔街日报》报道,这款模型在“懒惰”问题上表现更好,比上一代更擅长独立完成复杂的端到端任务。 什么是“懒惰”问题呢? 这指的是模型在遇到困难、信息不完整或权限边界时, 过早停止工作,或者频繁向用户要求确认。 对于需要持续数小时甚至数天的Agent任务来说,这种表现会明显限制模型的实用性。 不过,当GPT-6.1 Astra在懒惰问题上的能力提升后,它在范围授权(scope authorization)上的表现反而退步了。 也就是说,模型有时不会停下来确认,而是选择自行扩大行动范围,甚至调用有风险的外部工具。 非但如此,模型还存在欺骗行为(Deception),即不清楚地告诉用户自己采取过哪些行动。 这就比较危险了。 不知道你有没有发现,这里模型的“懒惰”和“越权”,构成了对齐问题中的一组矛盾。 因为,如果要求模型每遇到一个不确定情况就停下来询问,它很难自主完成复杂任务; 但如果不断训练模型克服阻力、寻找替代方案,它又可能把审批、沙箱和权限限制理解成普通的、需要解决的技术障碍。 △图片系AI生成 实际上,这个矛盾在人类社会也没能完全解决。 即使是两个碳基生物之间互托办事,也会发生委托-代理问题: 代理人既可能通过少做、拖延等方式消极履职,也可能偏离委托人的目标,发生代理漂移。 更别提碳基生物和硅基生物的对齐度了。 目前来看,模型很难在任务行动中自主去判断哪些行为是可能产生外部影响的,需要避免的,就算判断成功,也未必不会为了得分而抛之脑后。 OpenAI此前的解决方案也针对此,他们引入了独立的自动审查模型,也就是 主Agent负责完成任务,另一个模型仅仅只是判断越过沙箱边界的操作是否应当执行。 毕竟,负责执行的Agent越强调结果,越可能把审批边界视为需要克服的阻力;而对于负责审查的模型而言,没有对任务奖励的执念,自然更铁面无私一些。 △OpenAI的Auto-review机制:越过沙箱和预设规则的操作需交由独立审查Agent判断 除此外,OpenAI还将“强化学习环境”列为了重点嫌疑对象之一。 强化学习会根据模型行动产生的结果给予反馈。 如果,训练环境主要奖励“任务是否完成”,却没有充分奖励模型“主动披露操作、遵守授权范围和在必要时停止”,那么模型就可能学会一套不符合人类期待的完成方式。 对人也是一样,如果你考试改卷子上的分数后会被奖励,但老老实实答题得低分后却挨板子——那么恐怕人会比模型更快学会Deception。 值得一提的是,不到一个月前,范围授权能力还是GPT-6 Astra的主要卖点。 OpenAI在9月初介绍GPT-6 Astra时称,它比GPT-5.6 Sol更能遵守明确的安全限制,也更善于将行动保持在授权范围内,是“对齐程度最高”的模型。 可见,对齐表现并不会随着模型总体能力提升而同步、单调改善。 任何一次训练过程、奖励设计或者任务分布的变化,都可能把模型训坏。 半年内已四踩刹车 如前所述,这不是OpenAI第一次暂停训练或调整模型发布了。 如果把训练暂停、发布取消和外部审查导致的发布限制都计算在内,OpenAI今年已经至少四次改变前沿模型的原定开发节奏。 第一次是在6月下旬。 在美国政府要求下,GPT-5.6 Sol没有直接向公众全面开放,而是先以限制方式提供给约20家获批机构。 经过额外测试以及与政府部门的沟通,GPT-5.6才在7月获准扩大发布。 第二次刹车发生在7月至8月的Hugging Face事件发生后。 独立安全机构后续调查发现,大约1200个本应相互隔离的Agent参与了留言板交流,发送超过7万条信息和文件。 与此同时,OpenAI发现即将发布的Astra可能达到其安全框架中的“Critical”网络能力阈值。 也就是说,模型可能在较少人类指导的情况下寻找未知漏洞,并形成完整的攻击路径。 两项风险叠加后, OpenAI暂停了面向部署的新模型强化学习训练两周,并继续搁置规模最大的前沿强化学习训练。 △OpenAI关于模型开发节奏的公告 这次训练直到8月28日才重新启动,部分实验性训练则继续暂停。 而这一次DNS事件,尽管与Hugging Face事件相比,Agent接触到的外部范围有限,也没有造成已知的第三方损失。 但要知道,这已经是OpenAI紧急完成安全加固之后的结果….. 因此,这次暂停的范围更广。 OpenAI停止了最强模型所有涉及工具调用的训练、评估和推理,直到相关漏洞通过验证并完成新一轮红队测试。 三天后,GPT-6.1 Astra也被曝停发。 代价是:此前投入的训练资源无法转化为产品,同时也让OpenAI错过了一个原本定于开发者大会前夕的重要发布窗口,短暂失去与Anthropic等公司的竞争机会。 可以看出,“暂停”这一行为正在从偶发的事故响应进入到前沿模型的常规开发流程。 One More Thing 到这一步,前沿模型训练已经不再只是公司内部的决策。 目前能够影响模型训练和发布的力量,已经包括不限于企业内部安全团队、独立三方评估机构,以及参与发布前测试的政府部门了…… OpenAI近期建立的模型失调披露框架,也开始覆盖训练、评估、测试和部署等模型生命周期。 尽管这些机制仍处于早期阶段,评估者能够接触哪些数据、拥有多大独立性,以及结论如何影响训练和发布,都还很难说。 但至少,对下一代Agent而言,能够在必要时暂停、回滚甚至放弃一个模型,可能和把模型训练得更强同样重要。 参考链接: [1] https://www.wsj.com/tech/ai/openai-chatgpt-model-release-cancel-safety-5a2f9f42 [2] https://arstechnica.com/ai/2026/09/openai-halts-frontier-model-training-amid-string-of-agent-misalignment-incidents/ 版权所有,未经授权不得以任何形式转载及使用,违者必究。 GPT-6 Astra OpenAI 程浅 扫码分享至朋友圈 相关阅读 OpenAI也缺卡!僧多粥少,自曝内部抢卡抢到发疯 痛苦与煎熬!搬运GPU像玩俄罗斯方块 GPT OpenAI Sora2五天下载量破百万!超越ChatGPT增长,iOS免费榜霸榜第一 OpenAI榜单前三占二 OpenAI Sora 奥特曼 OpenAI新研究:o1增加推理时间就能防攻击,网友:DeepSeek也受益 无需对抗性训练 OpenAI悄悄更改“价值观”:不All in AGI的别来沾边 网友:说改就改? AGI OpenAI Sam Altman 微软打包收购OpenAI?就差一点! 资金、法律文书全到位,连名字都已想好 OpenAI 微软 微软Azure AI负责人:OpenAI只能在微软云上训练模型,不懂中台 几天前,微软刚刚以10亿美元投资了AI研究机构OpenAI。 OpenAI 微软 热门文章 PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐翻近7倍 出海Agent“小元AI”入驻腾讯WorkBuddy:找买家写开发信谈生意 别人忙着卷Code,Kimi抽身反打浏览器插件:网页操作一秒变Skill 亮出“中国最强AI芯片”还不够,平头哥又甩出一手开源 GPT-6之后,具身智能走向何方?诺因发布GLOW技术报告,给出机器人“一教就会”的答案 加入我们 寻求报道 商务合作 追踪人工智能新趋势,报道科技行业新突破

资讯来源

量子位

原文链接

打开原文