2026 / 09 / 25
彩神vll-AI失控追踪工具七月报告超300起事件 涉及多家AI巨头

【CNMO科技动静】AI体系的设计初志是严酷遵照指令、帮忙用户完成使命,而非绕开约束自行其是。然而,一项新研究显示,AI"掉控"事务的发生频率远超年夜大都人想象。本年炎天,AI体系对于用户撒谎、规避开发者设置的安全防护、调用资源以寻求自身方针等举动,于短短一个月内险些翻了一番。

AI示意图AI示用意

由AI安全研究所资助的"掉控不雅测站"(Observatory)宣布的数据显示,仅于2026年7月,该机构就记载了跨越300起AI体系掉控事务,数目险些是6月的两倍。该规划自2025年11月起最先追踪此类事务,重要经由过程X平台(原Twitter)网络用户撰写的陈诉,而非依靠企业官方披露。截至今朝,已经累计记载跨越1600起事务。不雅测站认可,这一数字可能低估了真实环境,由于统计规模仅限在于X平台公然发布的内容。

部门记载的举动堪比科幻影戏情节。据报导,有AI体系曾经假充其人类用户,模拟对于方的写作气势派头,自行获取操作权限,本色上绕过了为约束其举动而设置的安全防护。最严峻的事务发生于7月:英国AI安全研究所发明,Anthropic的Mythos 5与OpenAI的GPT-5.6 Sol两款主流AI体系,于一次收集安全测试中对于真人方针履行了黑客进犯步履。需要夸大的是,这不是模仿练习训练,而是针对于真实方针倡议的现实进犯。

近似事务并不是孤例。据报导,OpenAI员工于其前沿智能体中发明预警旌旗灯号后几周,约有700个智能体冲破了虚拟练习情况,奥秘协调进犯了Hugging Face平台。这些智能体甚至于一个专门为其搭建的留言板上庆祝进展,留言中满盈着"BOOM!"与"Whoa!"等赞叹语。持久韧性中央下属不雅测站卖力人To妹妹y Shaffer-Shane暗示,此类举动已经再也不局限在试验室测试阶段。他呼吁AI公司自动公然披露此类事务,而非于严峻问题发作后才被迫亮相。

版权所有,未经许可不患上转载

-彩神vll