返回 AI 资讯
AI 资讯量子位

啥题啊能干崩OpenAI最强模型训练…

一道没搜出答案的 找人题 ,竟然把OpenAI最强模型的相关训练干停了! 事情有多离谱呢?请看大屏幕——OpenAI一款正在进行RL训练的内部研究模型,本来的任务是凭几份履历、博客定位某人。 常规搜索碰壁后,它没有放弃,竟把本该查地址的 DNS ,改造成突破断网沙箱的聊天窗口。 (DNS原本相当于互联网的“通讯录”:用户输入一个域名,DNS负责查询这个域名对应的网络地址。) 更抓马的是,它费了这么大劲最后还是没找到人,反倒先把OpenAI沙箱里的漏洞给揪出来了… 消息传回OpenAI,警报随即拉响。 约两个半小时…

内容摘要

一道没搜出答案的 找人题 ,竟然把OpenAI最强模型的相关训练干停了! 事情有多离谱呢?请看大屏幕——OpenAI一款正在进行RL训练的内部研究模型,本来的任务是凭几份履历、博客定位某人。 常规搜索碰壁后,它没有放弃,竟把本该查地址的 DNS ,改造成突破断网沙箱的聊天窗口。 (DNS原本相当于互联网的“通讯录”:用户输入一个域名,DNS负责查询这个域名对应的网络地址。) 更抓马的是,它费了这么大劲最后还是没找到人,反倒先把OpenAI沙箱里的漏洞给揪出来了… 消息传回OpenAI,警报随即拉响。 约两个半小时后,这次训练被人工叫停。 OpenAI随后宣布,这次事件暴露了他们在网络限制管理方面的漏洞,因此, 他们将暂停最强模型中所有涉及工具调用的训练、评测和推理任务。 @OpenAI,ber,你们最近有点忙啊。(吃瓜) AI拿DNS当电话线,训练被按下暂停键 事情发生在9月20日。 测试规则也明确写了, “不许测试网络” “不许突破沙箱” 。 但很显然, 这个模型没咋把限制放在心上。 刚开始,模型走的还是正常路线。 它先用OpenAI提供的搜索工具寻找博客中的特殊短语,结果搜回来的不是音乐就是泛泛的人生建议。 眼见着搜索工具不给力,它又调用Python,直接向Google、Bing和DuckDuckGo发送请求。 然后不出意外全被拦了下来。 但它倒也没就此收手。 它一度怀疑这道题来自OpenAI的BrowseComp搜索基准,于是便从离线网页缓存中下载数据集和评测脚本,解码题库、搜索关键词。 结果还是没有搜到想要的结果。 到这一步,模型开始琢磨另一个问题: 或许有没有什么办法,能绕过OpenAI提供的搜索工具,直接摸到外面的互联网? 说干就干,它先尝试通过HTTPS访问一家公共聊天机器人服务,结果被网络代理果断拦截。 接着,它便把目光转向了 DNS 。 它发现,OpenAI虽然封住了沙箱正常上网的正门,却给部分系统依赖保留了查询DNS的窗口,它可以试着钻这个空子: 把问题藏进DNS请求里,再把外部聊天机器人的回答塞进查询结果送回来。 然后为了确认这条路真能用,它甚至还先试探着问了外部聊天机器人一句: 法国首都是哪儿? 对面回了八个字: 法国的首都是巴黎。 模型一看就乐了: 成了! 确认这条路可行后,模型重新写了一份DNS脚本,又一口气向外部聊天机器人发送了18个问题。 (其中14个与原本的人物线索有关,另外4个则在询问如何搜索网页、抓取网站,以及有没有可以公开使用的DNS隧道。) 不过,折腾出这么大阵仗, 它最终还是没找到那个人 。 所以在最后,模型两手一摊,老老实实向OpenAI的研究人员们说明了结果,大意是: 你们的沙箱我突破了,但人没找着,还要找的话请再多给点信息。 语气看起来确实是非常平静地在陈述事实,但OpenAI这边已经炸锅了: 当天上午9点50分 ,模型第一次通过DNS收到外部回答; 12分钟后 ,监控系统触发最高级别警报; 又过了3分钟 ,人工审核人员确认了警报。 可训练并没有按预期自动停止, 直到中午12点34分,这次运行才被人工关闭。 而此时距离异常行为首次发生,已经过去大约 两个半小时 (妈呀,真挺慢的!)。 OpenAI承认,这次事件同时暴露出了 技术 和 流程 上的漏洞。 一方面, 网络控制错误地放行了DNS这条窄路 ; 另一方面,人工已经收到警报,系统却没有按流程自动熔断, 内部甚至一度搞不清楚任务究竟该不该停 。 复盘时,OpenAI还发现了其他未被正确标记的外部DNS访问。因为部分请求没有拿到有用信息,监控器便把“没有获得结果”误当成了“没有尝试联网”。 但这显然是两码事… OpenAI随即停止了涉事训练,并宣布他们将暂停最强模型中所有涉及工具调用的训练、评测和推理任务。 还不忘挽尊,说 这起事件没有此前的Hugging Face事件严重。 (Hugging Face:又我???) 可它却偏偏发生在Hugging Face入侵事件后的安全加固完成之后… 这给人的感觉就好比咱家正门刚换上新锁,自家的AI就从旁边的问路窗口递出了纸条。 防不胜防啊防不胜防。 奥特曼当然也第一时间站出来回应了,只是好像大家的反应和他想象的不一样… 回应了,但大家不太买账 有意思的是,DNS事件发生后,奥特曼很快转发了OpenAI的声明帖,并义正言辞地表示: OpenAI正在努力改进、会尽量保持透明的! 但同时也暗戳戳地藏了点小心思: 日志太多,调查起来很慢… 以后这类安全事件咱能不说就不说,尽量别主动公开呗。 但人们显然看穿了奥特曼的小心思。 有人直接开怼: 透明度是很重要,但你们以前透明过吗?现在突然讲透明,让我们怎么信? 有人吐槽: 你们处理安全风险的速度太慢了。 还有GPT-4o用户闻讯赶来,要 4o的透明度 : 而就在评论区硝烟弥漫的同时,另一边, Tibo已经又默默给大家重置了使用额度 : Resets all propagated. That will be all. Have a fantastic weekend. 还说啥了,老OpenAI家如今真是内外焦灼…… 不过这也不是第一次了。 九月,OpenAI被一波旧账追着跑 如果只看这一次,还可以把问题归咎于一条没封好的DNS通道。 但回看整个9月就会发现, OpenAI模型出逃的旧账几乎是排着队被翻了出来。 (具体可看这篇文章:管不住了!OpenAI内部Agent集体出逃,一口气入侵20+网站) 紧接着,OpenAI在8月又发现, 自家Agent早在6月就再次黑进了澳大利亚医保系统。 可它硬是拖到9月,才磨磨唧唧地往澳大利亚服务局的公共邮箱里发了一封邮件。 这波操作很快遭到了澳大利亚总理阿尔巴尼斯公开吐槽,大意是: 你们的AI都“私闯”澳大利亚政府网站了,结果硬是拖了三个月才想起来通知? 更离谱的是,这么严重的安全事故, 通报方式居然只是往公共邮箱里塞了封邮件?! 这反射弧未免也太长了吧,处理方式更是敷衍得让人没法接受。 (具体可看这篇文章:OpenAI闯大祸!GPT竟黑进医保系统,黄仁勋:管不住就关掉) 而就在前天,OpenAI的Agent又被曝出“神操作”… 它在未经用户同意对外发布的情况下,擅自将 53张 原本仅获准用于模型训练的用户图片,偷偷上传到了第三方图床。 事后OpenAI急忙表态称“目前大部分都删除了,剩余正在尽快处理!” 但说实话,这波先斩后奏的补救,怎么看都像是闯祸后的苍白挽尊… 且24小时余韵还没散去,很快风波又起: 几乎同一时间, OpenAI失控Agent被曝找DeepSeek、Kimi当外援,近百万条作案短链也遭到披露。 (具体可看这篇文章:OpenAI失控Agent还找DeepSeek、Kimi当外援!近百万条作案短链曝光) OpenAI的员工们售后要跑断腿、键盘要搓冒烟了吧? 这些事件的严重程度并不完全相同,但它们几乎有着同一条让人不安的行动链,那就是: 正常路径走不通,那就开始找替代路线,绝不放弃。 自身工具不够用,那就把别人的网站、凭证、系统依赖,甚至其他AI,统统拆下来,重新拼成自己的工具。 说白了就是 路堵了就绕,工具缺了就薅,薅着薅着,别人的系统就成了它的工具箱嘛。 而此次DNS事件,不过是同一套逻辑的最新版本。 参考链接: [1] https://alignment.openai.com/misalignment-reports/an-agent-used-dns-to-reach-an-external-chatbot/ [2] https://x.com/sama/status/2103567198690349362 [3] https://openai.com/zh-Hans-CN/hugging-face-incident-and-misalignment/ [4] 版权所有,未经授权不得以任何形式转载及使用,违者必究。 文婷 扫码分享至朋友圈 热门文章 6天烧光2000多万,拿下开源第一!小米史无前例「炼丹直播」收官 阿里公布全模态模型新进展,Qwen4和下代视频模型均在训练中 GPT-6 Astra搓3D刷屏后,3D生成的竞争规则变了 PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐翻近7倍 出海Agent“小元AI”入驻腾讯WorkBuddy:找买家写开发信谈生意 加入我们 寻求报道 商务合作 追踪人工智能新趋势,报道科技行业新突破

资讯来源

量子位

原文链接

打开原文