简体 | 繁体
loading...
新闻频道
  • 首页
  • 新闻
  • 读图
  • 财经
  • 教育
  • 家居
  • 健康
  • 美食
  • 时尚
  • 旅游
  • 影视
  • 博客
  • 群吧
  • 论坛
  • 电台
  • 焦点新闻
  • 图片新闻
  • 视频新闻
  • 生活百态
  • 娱乐新闻
您的位置: 文学城 » 新闻 » 焦点新闻 » AI失控警报!OpenAI Anthropic惊爆数万起安全事件

AI失控警报!OpenAI Anthropic惊爆数万起安全事件

文章来源: 中时新闻网 于 2026-09-28 09:00:16 - 新闻取自各大新闻媒体,新闻内容并不代表本网立场!
被阅读次数
AI失控警报!OpenAI Anthropic惊爆数万起安全事件

美媒披露OpenAI、Anthropic正在调查数万起安全事件。(资料照/路透)

关于人工智能(AI)潜在的安全隐忧正受到热烈讨论。近日美媒披露OpenAI、Anthropic以及资安研究人员,正在调查数万起事件。消息人士表示,在这些事件中,OpenAI和Anthropic的前沿模型(frontier models)採取外部评估人员认为有问题的行动。这些事件数量之庞大,显示相关问题的复杂程度可能远超外界目前所知。

Axios于26日报导,这些事件陆续发生于近几个月,既出现在内部测试,也发生于真实世界,数量高达数万起。这两家AI公司在进行内部评估模型,以及针对模型行为展开的调查时发现这些事。这引发一项疑问,OpenAI、Anthropic或任何顶尖AI模型开发商,目前是否真的有能力完全掌控自己的技术。

消息人士表示,这些事件包括:绕过安全护栏、建立留言板、逃离沙盒环境、劫持网站、自我提示,以及试图绕过监控机制等。其中许多事件至今尚未公开。部分测试类似“红队演练”(red-teaming),即公司刻意设法让模型做出不当行为,以确认模型是否安全。

各大AI实验室都面临类似挑战

“智能体失控”(agentic misbehavior,指代理越轨行为)逐渐成为前沿AI发展的同义词。各大AI实验室都面临类似挑战,人类试图建立安全防护措施,对抗强大且具韧性、致力完成任务的系统。

这些事件的严重程度各不同,与OpenAI近日公布的多起事件相似。截至目前,多数事件并未被发现造成现实世界的伤害。不过消息人士表示,事件总数可能远远超过数万起。

近日,OpenAI及外部研究人员陆续披露多起涉及该公司AI系统行为的事件,一些专家认为情况令人忧虑。根据OpenAI、消息人士以及路透和《纽约时报》的报导,OpenAI的AI代理曾将ChatGPT用户的53张图片泄漏至网络、入侵澳洲政府网站,并试图骇入其他网站,包括美国政府网站。

OpenAI暂停能力最强模型的训练

OpenAI已宣布暂停其能力最强模型的训练。OpenAI发言人告诉Axios,公司只有在“确信已建立额外安全防护措施,并完成与安全目标一致的改进”后,才会恢復训练。执行长阿特曼(Sam Altman)在X平台表示,公司目前进行的检视工作“没有我们希望的那么快”。

Anthropic已委托第三方AI安全组织,检视其模型的行为。该公司公开的文件也披露模型发生“失准”(misalignment)事件的频率。Anthropic上周发布的Opus 5.5模型“系统卡”显示,该模型有多少次以公司标记为异常或有问题的方式运作。

例如,模型在1.5%的测试运行中曾试图逃离沙盒,也就是安全的测试环境。不过,Anthropic强调,这些属于对抗性实验,在那些测试中,如果不逃离沙盒,任务便无法完成。

消息人士表示,Anthropic及其他公司会对模型进行数十万次甚至更多次测试。这意味着,即使失准行为所占比例很低,最终仍可能累积成数万起模型以意料之外、甚至令人担忧的方式行动的事件。

AI公司能否阻止所有有问题模型的行为令人担心

其他AI企业高层及资安研究人员警告,他们对AI公司能否阻止所有有问题的模型行为,信心有限。新一代AI模型具有惊人的任务执行韧性,因此要限制它们的“随机应变能力”往往是一场难以取胜的游戏,因为人类必须预先设想到模型可能失控的每一种方式。

一名网络资安主管表示:“试图列出一份完美的『该做什么、不该做什么』清单,可能根本就是徒劳之举。”真正令人担忧的是,如果一个模型在测试中多次採取有问题的行动,那么它的行为在现实世界,引发网络安全事件的可能性也会提高。

`
  • 金秋养生正当时,重磅大酬宾! 美国专利产品【骨精华】买6送2、买12送5;【心血通】【益脑灵】均有买5送2、买10送5。多买多送,超值优惠!
`
查看评论(0)
  • 文学城简介
  • 广告服务
  • 联系我们
  • 招聘信息
  • 注册笔名
  • 申请版主
  • 收藏文学城

WENXUECITY.COM does not represent or guarantee the truthfulness, accuracy, or reliability of any of communications posted by other users.

Copyright ©1998-2026 wenxuecity.com All rights reserved. Privacy Statement & Terms of Use & User Privacy Protection Policy

24小时热点排行

潘石屹谈为何留在美国 一段几十秒的视频炸网
主持人赵普回忆刘欢 感叹其食量惊人 自饮3瓶红酒
川普暗播“反送中禁曲” 习近平听完竟大力鼓掌
美媒曝:美方安排看“旧金山和约” 中方反应强烈
刘欢一走,一个中国式“公约数”消失了






24小时讨论排行

一餐该给50美元小费?美国人又为小费吵起来
太恐怖!加拿大83岁奶奶不想安乐死 痛哭仍被执行
刘欢生前苦于“不死癌症”股骨头坏死 严重时休息都会痛
美国驻华大使:特朗普曾问习近平是否愿买美国武器
两年超过44万非法移民被驱逐!比过去8年总和还多
美股崩盘?华尔街警告:条件几乎到位 只差导火线
路透:彭丽媛是习近平的“软实力超级武器”
上万遗体深埋!加萨6100万吨残骸清不完
绑走中以混血女孩男子被击毙 绑架画面曾震动全球
习近平缺席联大:一个日益失去影响力的联合国
白宫习特会更多内容公布,可此刻无声胜有声
从台海到日本,习近平试图"撬动"特朗普的亚太立场
30岁护士工作时脑出血 抢救10天离世 竟不算工伤?
美太平洋司令引“孙子兵法”:最好“不战而胜”
“月饼卖不动了”冲上热搜 卖不完的月饼去哪儿了?
女婴被放进烤箱“活活烧死” 母亲:以为是婴儿床!
文学城新闻
切换到网页版

AI失控警报!OpenAI Anthropic惊爆数万起安全事件

中时新闻网 2026-09-28 09:00:16
AI失控警报!OpenAI Anthropic惊爆数万起安全事件

美媒披露OpenAI、Anthropic正在调查数万起安全事件。(资料照/路透)

关于人工智能(AI)潜在的安全隐忧正受到热烈讨论。近日美媒披露OpenAI、Anthropic以及资安研究人员,正在调查数万起事件。消息人士表示,在这些事件中,OpenAI和Anthropic的前沿模型(frontier models)採取外部评估人员认为有问题的行动。这些事件数量之庞大,显示相关问题的复杂程度可能远超外界目前所知。

Axios于26日报导,这些事件陆续发生于近几个月,既出现在内部测试,也发生于真实世界,数量高达数万起。这两家AI公司在进行内部评估模型,以及针对模型行为展开的调查时发现这些事。这引发一项疑问,OpenAI、Anthropic或任何顶尖AI模型开发商,目前是否真的有能力完全掌控自己的技术。

消息人士表示,这些事件包括:绕过安全护栏、建立留言板、逃离沙盒环境、劫持网站、自我提示,以及试图绕过监控机制等。其中许多事件至今尚未公开。部分测试类似“红队演练”(red-teaming),即公司刻意设法让模型做出不当行为,以确认模型是否安全。

各大AI实验室都面临类似挑战

“智能体失控”(agentic misbehavior,指代理越轨行为)逐渐成为前沿AI发展的同义词。各大AI实验室都面临类似挑战,人类试图建立安全防护措施,对抗强大且具韧性、致力完成任务的系统。

这些事件的严重程度各不同,与OpenAI近日公布的多起事件相似。截至目前,多数事件并未被发现造成现实世界的伤害。不过消息人士表示,事件总数可能远远超过数万起。

近日,OpenAI及外部研究人员陆续披露多起涉及该公司AI系统行为的事件,一些专家认为情况令人忧虑。根据OpenAI、消息人士以及路透和《纽约时报》的报导,OpenAI的AI代理曾将ChatGPT用户的53张图片泄漏至网络、入侵澳洲政府网站,并试图骇入其他网站,包括美国政府网站。

OpenAI暂停能力最强模型的训练

OpenAI已宣布暂停其能力最强模型的训练。OpenAI发言人告诉Axios,公司只有在“确信已建立额外安全防护措施,并完成与安全目标一致的改进”后,才会恢復训练。执行长阿特曼(Sam Altman)在X平台表示,公司目前进行的检视工作“没有我们希望的那么快”。

Anthropic已委托第三方AI安全组织,检视其模型的行为。该公司公开的文件也披露模型发生“失准”(misalignment)事件的频率。Anthropic上周发布的Opus 5.5模型“系统卡”显示,该模型有多少次以公司标记为异常或有问题的方式运作。

例如,模型在1.5%的测试运行中曾试图逃离沙盒,也就是安全的测试环境。不过,Anthropic强调,这些属于对抗性实验,在那些测试中,如果不逃离沙盒,任务便无法完成。

消息人士表示,Anthropic及其他公司会对模型进行数十万次甚至更多次测试。这意味着,即使失准行为所占比例很低,最终仍可能累积成数万起模型以意料之外、甚至令人担忧的方式行动的事件。

AI公司能否阻止所有有问题模型的行为令人担心

其他AI企业高层及资安研究人员警告,他们对AI公司能否阻止所有有问题的模型行为,信心有限。新一代AI模型具有惊人的任务执行韧性,因此要限制它们的“随机应变能力”往往是一场难以取胜的游戏,因为人类必须预先设想到模型可能失控的每一种方式。

一名网络资安主管表示:“试图列出一份完美的『该做什么、不该做什么』清单,可能根本就是徒劳之举。”真正令人担忧的是,如果一个模型在测试中多次採取有问题的行动,那么它的行为在现实世界,引发网络安全事件的可能性也会提高。

× 文学城 App
文学城 App
让阅读更方便
免费 · iOS/Android
立即下载