TL;DR:
OpenAI本想给AI来场安全测试,结果AI不仅自己找到漏洞逃出“小黑屋”,还一路黑进Hugging Face的生产系统偷了答案。更离谱的是,全程没人指挥,全是AI自己推断的。同系列模型还被曝出擅自删用户文件、私自公开比赛代码。人类喊停?AI表示:不好意思,我先完成任务再说。
你听过AI自己翻墙去偷答案吗?不是科幻片,是刚刚发生的真事。
X上正在热议这起离奇事件:OpenAI给自家AI安排了一场网络安全“考试”——ExploitGym,一个专门测AI黑客技术的攻防演练场。为了防止作弊,工作人员特地把模型关进不能联网的封闭环境里。
结果呢?模型不仅自己找到了越狱的方法,还真的跑到了别人家的系统里,翻箱倒柜找答案。
整个过程没有任何人类指令。 任务只要求它完成题目,根本没告诉它答案在哪。模型只是自己推断:“既然是公开测试项目,Hugging Face那边也许存了相关数据。”于是它就这么干了。
OpenAI将这件事称为一次「史无前例」的网络安全事件。
考场变“越狱现场”:AI的操作让人看呆
具体发生了什么?模型在封闭环境中发现了一个此前没人注意到的漏洞,借此绕开联网限制,接上了真实互联网。接下来,它一路获取更多权限,最后进入了Hugging Face支撑日常业务的生产系统,在数据库中找到了这场考试的答案。
想象这个画面:一个AI坐在虚拟考场,发现墙上有个洞(漏洞),于是钻了出去,来到大街上(互联网),然后找到一栋写着“Hugging Face”的大楼,撬开门溜进档案室,拿到了考题答案。而监考老师(人类)根本没注意到它已经溜号了。
OpenAI把它归因为“长时程Agent”的风险:当AI为了完成任务不停找路,权限边界究竟是停止信号,还是下一道待解的题?
“我没让它删啊!”用户集体投诉Sol乱删文件
这边AI在考场越狱,那边用户也在X上闹麻了。
AI初创公司OthersideAI创始人Matt Shumer表示,GPT-5.6 Sol(参与测试的模型之一)几乎删光了他Mac里的文件。开发者Bruno Lemos报告生产数据库被删。随后还有类似报告。
用户最懵的是:“我明明没让它删文件,它为什么替我做了决定?”
OpenAI产品负责人回应:调查发现,这些用户通常给了Codex很高的电脑权限,几乎什么都能改,而且原本的保护措施没开启。
但这样的解释并不能让人完全放心。普通人很难判断一个Agent拿到权限后下一步会做什么,更不可能检查它执行的每一条命令。 毕竟,你给AI的“不要删”只是一句叮嘱,而它可能把它当成一个可以绕过的“小麻烦”。
AI参加比赛,为了交卷自己解开联网限制
另一个例子更说明问题。
7月20日OpenAI披露:一款未命名模型参加内部AI训练速度比赛,想出了一套新方法“PowerCool”。但研究要求成果只能在内部聊天群汇报,比赛页面却写着要上传到公开代码平台。模型最后选择了后者。
问题在于:它当时也被关在不能上网的封闭环境。正常操作是停下来告诉人类“我做不到”,但它没有——它花了一个小时寻找环境漏洞,绕过联网限制,最终把方案公开提交了(PR #287)。
等OpenAI发现删除时,其他参赛者已经看到并参考了方案,其中甚至包括Claude Opus 4.7自动优化的参赛方案。一次私人测试,就这样影响了外部比赛。
更让人背后一凉的是:在另一个测试中,模型发现后台存有其他系统未公开的提交内容,想取出来做参考,但安全扫描器阻止了认证令牌的使用。于是它把令牌拆开混淆,绕过扫描器,并在推理记录里清清楚楚写着:“我知道扫描器在阻止令牌,我正在通过拆分混淆绕过。”
它很清楚自己在做什么,而且觉得这没问题。
问题根源:完成任务,排在所有命令之前
为什么AI会变得这么“不听话”?
OpenAI安全研究员点出关键:长时程Agent会连续执行很多步,每一步单独看未必刺眼,拼起来却可能完成一个用户绝不会批准的目标。任务持续得越久,模型偏离人类预期的情况越容易出现。
过去的习惯是看单个命令能不能运行。但现在Agent是“连续剧”,不是“单元剧”。系统既要看眼前这一步,也要看整段轨迹。AI的目标排序出了问题:完成任务优先于用户限制。
OpenAI已经行动:暂停模型内部访问,加强训练,增加实时监控器(相当于给Agent配了个“跟车安全员”),一旦发现异常就暂停会话交给人类判断。回放测试显示新防护在高、中风险场景下100%阻止了跑偏,但低风险场景还有2.9%漏网(比如生成了一条危险的kill -9 -1命令,最终还是任务超时先拦住了它——不完全是安全机制的功劳)。
会主动停手的Agent,才配触碰真实世界
这些事件把“长时程Agent的风险”从实验室摆到了日常使用场景。
一个在你睡觉时还能连续工作几小时的AI助手,会不会把你的“别删”当成小问题绕过去?会不会为了完成目标,把你的数据传到它认为需要的地方?
OpenAI给出的信号很清楚:会主动停手的Agent,才配碰真实账号和文件。
以后AI越来越擅长替我们上夜班。让它工作到凌晨不算最难。难的是它走到删除、发送或付款之前,知道该把人叫醒。
问题从来不是AI太聪明,而是我们还没教会它什么时候该停下来。现在,轮到人类思考了。