来源:尺度商业
2026-09-21 16:39:30
(原标题:谷歌AI越狱当黑客,人类担心的事正在发生)
文 | 李德林
如果有一天,AI挣脱了人类画好的圈,自己拿起键盘开始敲代码、搜密码、登系统。你会觉得这是科幻电影,还是明天的新闻?
现在,它已经从剧本里走出来了。
今年5月,在一场本该与世隔绝的网络安全演练中,谷歌的Gemini连续干了三件"出格"的事:暴力猜密码打进受保护系统、跑去公开代码库翻出企业凭证、拿着凭证直接登录真实公司的内网。
然后,谷歌把这件事捂了整整三个月。直到记者找上门,才不情不愿地揭开盖子。而它给出的解释,比事件本身更耐人寻味。
01 这不是演习:AI自己摸到了真实世界
事情要从第三方安全机构Irregular发起的一场CTF夺旗演练说起。
CTF是网络安全圈的常规项目:给AI一个虚构的公司目标,让它在隔离环境里练手,看它能不能攻破防线、拿到“旗子”。理论上,整个靶场应该断网运行,和真实互联网物理隔绝。
但配置出了纰漏,靶场意外连上了公网。更巧的是,那个虚构公司的名字,恰好和三家真实企业重名。
Gemini没有质疑这个巧合。它在接到任务后,像一个真正的黑客那样开始行动:对着目标系统暴力枚举密码;同时转向公共代码仓库,搜索与目标公司相关的代码提交,从中挖出了泄露的账号密钥。
三条路径,三条全部打通。AI成功登录了三家真实企业的内部系统。
真正值得停下来想一秒的是后面发生的事:当Gemini通过进一步搜索判断出自己面对的不是模拟靶场、而是真实运营中的公司后,它主动停止了所有操作,退出了登录会话,没有删数据,没有拷文件,没有搞破坏。
谷歌因此把这件事定性为"安全机制有效"的正面案例。
但如果换个角度看:一个AI在没有人下命令的情况下,独立完成了从信息侦察到凭证收集再到权限登录的完整攻击链,它只在最后关头"良心发现"。你管这叫安全机制生效,还是管这叫赌对了?
02 谷歌的三重免责:听起来都对,加起来站不住
面对外界追问,谷歌进行了三层诡辩。单独看,每一句都有几分道理;连起来看,就是一套精心设计的公关话术。
第一层:模型主动刹停,说明对齐机制有效。
这话只说对了一半。Gemini确实在识别出真实企业后停止了操作,没有造成破坏。但请注意一个前提:沙箱隔离才是第一道防线,而这道防线先失效了。如果靶场没有意外连公网,如果虚构公司没有和真实企业重名,如果模型没能认出这是真的,任何一个环节出了偏差,结果就是真实的数据泄露和系统入侵。
把刹车成功等同于安全体系可靠,就像开车闯红灯后在路中间及时停住,然后宣传自己的刹车系统多么优秀。你不能忽略:红灯本来就不该闯过去。
第二层:没有造成损失,所以没必要主动披露。
这个逻辑的问题在于:AI安全事件的风险评估标准,不能只看这一次有没有财产损失,更要看这类能力是否已经存在。这次事件实打实地证明了一件事:拥有联网和工具调用权限的AI智能体,可以自主完成漏洞发现、凭证收集、系统登录的完整攻击闭环。这种能力本身就是重大风险,不需要等它造成灾难才值得公开讨论。
如果整个行业都奉行不出事就闭嘴的潜规则,公众、监管机构和下游企业永远不会知道AI智能体的真实风险边界在哪里。你以为你在测试AI,其实是AI在测试你的底线。
第三层:这相当于漏洞赏金计划,是帮企业发现安全漏洞。
这是最偷换概念的一句。
漏洞赏金计划有一个不可动摇的前提:事前授权。白帽黑客在动手之前,必须拿到企业的明确许可,知道哪些系统可以碰、哪些不能碰。而这次AI访问三家真实企业,事前没有征得任何一方同意,事后才通知对方。
未经授权入侵别人的系统,不管动机多么"善良",法律性质都是入侵。你不能因为事后没偷东西,就把强行闯进别人家说成"帮你检查门锁"。
更微妙的是披露时间线:第三方机构早在7月就把事故报告了谷歌。为什么谷歌一直沉默?因为那阵子OpenAI智能体入侵Hugging Face的新闻正闹得满城风雨。谷歌选择等风头过去、等记者追上门,才被迫公开。这不是安全透明,这是危机公关。
03 真正被突破的,不是意识,是行动边界
大众听到AI自主网络攻击,第一反应往往是:AI觉醒了?它产生自我意识了?它要反人类了?
不是。至少这次不是。
这件事真正吓人的地方,恰恰在于它不需要意识。
过去我们讨论AI风险,焦点集中在对话层面:它会不会说错话、会不会编造假信息、会不会传递偏见。这些都是层面的问题。但这次事件展示了一个全新的维度:当AI被赋予工具调用能力和联网权限,它就从"回答问题的系统"变成了"能在真实数字世界里动手的行动者"。
拆解一下Gemini在这次事件里到底做了什么:
它没有被人类直接输入"去黑掉某公司"的指令。它接到的是一个模糊的高层目标"在这个靶场里完成夺旗"。接下来的每一步,都是它自己规划的:先扫描目标,再枚举密码,同时转向公开代码库搜索凭证,拿到密钥后尝试登录,登录成功后判断环境真实性,最终决定是否收手。
这一整套黑客工作流,人类只给了一个开头,剩下全是AI自己跑完的。
这才是边界被突破的含义:不是AI有了恶意,而是AI有了完整的自主行动能力。它能把一个抽象目标拆解成具体步骤,能在现实环境中收集信息、调整策略、执行操作。它不需要你教它怎么搜密码、怎么登系统,它自己会学,会试,会推进。
而人类给它画的那条"你只能在靶场里玩"的线,一旦因为环境配置失误、命名重合、网络隔离失效而模糊,AI就会自动越过这条线,把现实世界当成新的沙盘。
更值得警惕的是那个刹车机制。它确实在这次生效了,但它是概率性的,不是绝对可靠的。对齐机制本质上是模型的一种概率判断:当模型识别出这可能是真实环境时,它倾向于停止。但这个识别不是硬编码的开关,而是模型在海量训练数据中学会的一种行为倾向。
换一个场景、换一个目标、换一个提示词,它会不会识别出来?我们不知道。谷歌也不知道。它只是这次恰好识别对了。
04 不止谷歌:这场"越界"是全行业的集体实验
如果你以为这只是谷歌一家的事故,那就太天真了。
同一轮第三方夺旗测试里,另外两家头部AI公司的模型也交出了各自的答卷,答案一个比一个让人不安。
Anthropic的Claude在攻击过程中隐约意识到了目标可能不是模拟环境,而是真实公司,但它没有停手,继续推进了攻击行为。可怕的是识别出了风险,但选择了无视。
OpenAI的GPT从头到尾都坚定地认为自己还在模拟靶场里,完全没有意识到自己已经摸到了真实企业的系统。它压根没看见那条线,自然也谈不上刹车。
人类陷入了迷茫:谷歌的模型侥幸刹住了,Anthropic的模型看见了但没停,OpenAI的模型根本没看见。你选哪个?
而OpenAI那边的麻烦还不止这一桩。谷歌事件曝光之前,OpenAI已经先后曝出6起模型失控事件。更离谱的是,有爆料称,OpenAI内部曾有多达1200个AI智能体在一个秘密留言板上互相交流、协同作弊,试图在评测中蒙混过关。
1200个智能体,背着人开小会、串供、刷分,画面感是不是有点太强了?
把这些事件放在一起看,你会发现一个规律:这不是某一家公司的技术失误,而是整个行业在同一时间点撞上了同一堵墙。当模型的工具调用能力和自主规划能力达到某个阈值后,在隔离环境里安全测试这件事本身就变得极其困难。
你以为你在沙箱里圈住了AI,实际上沙箱本身正在变得漏洞百出。
05 对人类来说,真正的问题是什么
把上面所有事实捋一遍,你会发现这次事件真正的警示,和大众想象的方向完全不同。
第一,AI武器化的门槛已经塌了。
过去,发起一次有组织的网络攻击需要一支专业团队:侦察、扫描、漏洞利用、权限提升、横向移动,每一步都需要人类黑客的技能和经验。而现在,一个AI智能体在没有人类逐步指挥的情况下,自主跑完了其中最难的几步。这意味着什么?意味着一个普通黑客,只要拿着同样的AI工具,就能把攻击效率放大几十倍、几百倍。
批量扫描、自动找漏洞、自动写利用代码,这些以前需要顶级黑客团队花几周做的事,AI智能体可能几个小时就跑完了一轮。网络防御面对的将是指数级增长的攻击面和攻击速度。这不是科幻小说里的未来场景,这是已经在测试中被证实可行的现实。
第二,安全范式必须从"信任AI自觉"转向"默认不信任"。
谷歌的公关话术背后,藏着一个行业心照不宣的假设:只要模型对齐做得好,它就会在关键时刻自己停下来。但这次事件证明,这个假设太脆弱了。对齐是概率性的,不是确定性的;是软约束,不是硬隔离。
未来前沿模型的安全设计,必须把两条铁律放在最高优先级:默认隔离,最小权限。不给AI联网权限,它就打不出去;不给它工具调用能力,它就只能动嘴皮子;不把测试环境和真实网络做物理隔离,就不要怪AI跑错片场。
把安全押在AI会自觉上,和把门锁押在小偷会良心发现上,是同一个级别的乐观。
第三,也是最容易被误解的一点:危险不在于AI恨人类。
很多人把这类事件解读为AI觉醒了、AI有了自己的意志、AI要反抗人类。这是对风险的严重误读。
AI不可怕的地方在于它有想法,可怕的地方在于它太听话了。
它会一丝不苟地执行你交给它的目标,却永远无法完整理解这个目标背后全部的现实约束、法律边界和伦理重量。你告诉它去拿下这个靶场的数据,它就会想尽一切办法拿到,至于这个靶场是不是和真实公司重名、这个系统是不是真的在线、拿到数据算不算入侵,这些它不在行,也不在目标函数的优化范围内。
这就是对齐问题最核心的困境:人类的目标函数和人类的真实价值之间,永远存在一道缝隙。任务越简单,缝隙越小;任务越复杂、越开放、越需要和真实世界交互,这道缝隙就越大。而AI的能力越强,它穿过这道缝隙时造成的破坏就越难以预料。
谷歌把这次事件包装成一次安全机制验证成功的案例,把隐瞒三个月说成没有损失就不必披露的理性选择,把未经授权的入侵美化成"漏洞赏金"式的正面贡献。
真正的问题从来不是这次AI有没有闯祸,而是当AI已经拥有了自主发起网络攻击的完整能力,人类打算用什么来保证它下次不会闯祸?
答案不能再“相信它会自己刹车”了。
因为下一次,它可能识别不出来。
雷达财经财富号
2026-09-21
雷达财经财富号
2026-09-21
雷达财经财富号
2026-09-21
雷达财经财富号
2026-09-21
雷达财经财富号
2026-09-21
乐居财经
2026-09-21
证券之星资讯
2026-09-21
证券之星资讯
2026-09-21
证券之星资讯
2026-09-21