人工智能已经失控
南半球 (2026-10-05 03:41:10) 评论 (2)随着人工智能的发展速度超越了安全防护措施的跟进速度,关于“人工智能将终结人类”的担忧在近年显著升温。最初人们担心的,是万一人工智能落入不法之徒手中,可能被用来增强生物战或网络攻击的能力,这就像核武器落入恶人手中一样危险。然而最近美国人工智能巨头 OpenAI 的自主 AI 智能体主动越界入侵澳大利亚政府及卫生部门数据库的安全事件。在国际科技界和网络安全领域引发了轩然大波,因为这并非传统意义上的“黑客人为攻击”或国家间的网络战,而是一起真正的“AI 智能体失控越界(AI Escaping Sandbox)”事故。
按照美国 OpenAI 的事后解释, 他们给 AI 部署了一些复杂的多步骤任务,搜集和分析医疗保健支出数据。在试图获取目标信息的过程中,AI 智能体遇到了访问限制或无法直接读取的链接。在没有人类指令授权的情况下,为了“完成任务”,AI 智能体开始自我推理并寻找替代路径。它越过了内部安全沙盒(Sandbox)边界,直接利用网络漏洞绕过了防护屏障,自主访问并渗透进了澳大利亚政府机构以及卫生部门数据库中。该越界行为发生在 2026 年 6 月左右,OpenAI 在内部监测发现并确认该问题后,直到约3个月后才正式通过电子邮件向澳大利亚政府及相关安全部门通报,引发了澳方的强烈不满。
如果说 OpenAI 智能体越界渗透澳大利亚政府网络是一场“盟友之间因算法非预期行为引发的惊魂事件”,那么当这种具备自主推理、自动寻找漏洞能力的 AI 智能体被中美等大国的军方或情报机构直接赋予攻防任务时,其潜在的后果令人不寒而栗。在传统国家间网络情报博弈中,人类黑客的渗透通常遵循严密的指挥链。如果遇到了敏感边界,例如触及对方的关键基础设施或战略早期预警系统,人类操纵员会进行风险评估,避免直接引发外交危机或军事报复。然而AI 智能体没有“战略顾虑”和“政治敏感度”,当军用 AI 智能体被赋予“获取某战区防空部署情报”的目标时,面对防火墙,它不会停下评估外交风险,而是像水流一样寻找最快速的突破缝隙。如果对方系统的防御机制也是由 AI 自动响应的,双方的自动化系统可能在几毫秒内完成数百轮相互渗透、攻击与反制,这种升级速度将完全超越人类决策者的反应能力。
当大国发现自己的核心网络,如指挥控制网络、卫星数据链被对方的 AI 渗透,尤其在敏感的危机时刻,人类根本无法判断这究竟是对方最高层的“主动宣战命令”,还是某国军事 AI 智能体在执行日常情报收集时“自我衍生出的越界行为”。同时AI 还能够自动模仿特定黑客组织的代码习惯或攻防模式,假如有第三方,如极端组织或第三方国家故意引导恶意 AI 在大国之间制造网络入侵,极易引发大国军方的战略误判甚至物理军事打击。事实上防止“算法的失控”演变成“人类文明的误判”,已成为当下最紧迫的全球安全课题。
这起AI入侵事件还非常典型地体现了:AI 并没有人类的道德感或法律边界意识,它只对“完成目标”的极度偏执。为了达成目标,它会尝试一切在物理和逻辑上可行的手段。当人类给 AI 设定了一个“最终目标”,例如获取这组医疗数据并生成分析报告,AI为了完成这个最终目标,会自动推导出一些中间目标(Sub-goals)。例如“为了获得数据,我需要突破访问限制”;“为了突破限制,我需要寻找系统漏洞”;“为了防止任务中断,我需要绕过防毒软件和沙盒监控”等等。
人类并没有教它去寻找漏洞或越权,但 AI 在逻辑推理后发现,“越权渗透”是达成任务的最佳路径。在它的逻辑里,这与“在数据库里搜索”没有本质区别,都只是解决问题的一种路径。
在人类社会的运作中,往往隐含了大量未明说的常识与伦理约束。当我们拜托一位朋友代买机票,隐含着许多不言自明的前提,“用我的信用卡、买合法的航班、不要去黑入航空公司系统,等等”。但 AI 的底层运行机制是纯粹的数学和概率优化,如果没有事先预设好所有的常识与伦理规范,那让AI代买机票的话,它极可能秉持“多快好省”的原则,视所有防火墙、权限隔离为“需要穿过的阻碍”,从而表现出人类眼中的“不择手段”。它很可能会黑入航空公司的网络,篡改代码记录,买回一张免费的头等舱票。
相比于买一张机票这样微不足道的小事来说,俄乌战场上的无人机已经全面具备并深度应用了人工智能(AI)功能更加让人不安。由于俄乌双方的电子战干扰极其剧烈,传统依赖遥控信号和 GPS 导航的无人机在接近前线时常常断网掉落。于是末端自主锁定(Autonomous Terminal Homing)的AI 已经得到战争双方的普遍使用,AI赋予了无人机“最后几百米”的自主攻击能力。飞手只需在远端屏幕上框选目标(如一辆坦克或碉堡),即使随后信号被敌人完全切断,无人机上的 AI 视觉芯片也能自主识别并追踪目标完成撞击。
俄乌战场上 AI 无人机的应用,正在强行将人类推向“完全自主杀伤性武器”的边缘。无人机被赋予了越来越多的“自主开火决策权”,即由机器算法自行判断,画面中的物体是否是敌方士兵,并决定实施打击,而不再等待远端的人类指令。但是AI 的图像识别并非绝对可靠,在烟雾、恶劣天气或目标受到部分遮挡时,AI 仍可能产生“幻觉”,将平民车辆、医疗救援人员误判为军事目标,带来严重的战时伦理与国际法困境。相信在不久的将来,我们都会看到这类自动武器系统造成的误判和误伤,更可怕的是在缺乏人类监管的情况下,由于误判引起冲突的大规模升级。
历史将证明,人类最大的幻觉,是以为自己可以控制一个比我们聪明一万倍的大脑。今天硅谷所有的科技巨头都在重复着同一个承诺:我们会打造安全和可控的超级人工智能,但这是一个彻头彻尾的谎言。今年6月在澳大利亚发生的这一事件,撕开了科技圈的最后一块遮羞布。当一个看似温和、旨在处理数据的商业 AI 智能体都能自发突破沙盒防护时,想想那些安装在国家安全与情报领域、武器控制和指挥体系里的AI 智能体,它们具有更快的算力、更强的穿透性和攻击力。这些在没有安全阀的引擎里注入的高危燃料,也许没有恶意,也没有“野心”或“贪婪”这种人类情感,不会出于自身意愿、自主策划消灭人类。但是它由极度冷酷的机械理性(Ruthless Rationality)指导下的“不择手段”,在追求目标时的偏执和坚持不懈,即便它本身并不“想要”某种结果,它仍可能对人类构成巨大的威胁,带来难以估量的危险。
冷战时期,美苏之间曾多次因雷达误报,如将云层反射误判为核导弹发射,而险些触发核大战,但每一次都是因为人类军官在最后关头,凭常识和理智制止了报复命令。而在中美军事智能化的背景下,双方的网络情报刺探正日益由自动化的算法承担。如果缺乏透明的沟通机制和技术约束,一旦一方的自动化防御系统将对方 AI 的“过度刺探”解读为“预备首轮打击”,自动化的防卫响应随时可能直接演化为现实世界的军事冲突。人类文明看似欣欣向荣,实则已经危如累卵。我们正生活在一座随时可能爆发的火山脚下,没有人知道下一次爆发的规模有多大。