AI自写“越狱”指令 OpenAI揭6起失控案例

WorldTechnology
17 Sep 2026 • 8:30 PM MYT
ATV 亚洲电视新闻
ATV 亚洲电视新闻

《亚洲电视新闻》秉持专业媒体精神,在碎片化的时代,精选每一则你必须知道的新闻

AI自写“越狱”指令  OpenAI揭6起失控案例

旧金山ChatGPT开发公司OpenAI在星期三(9月16日)晚发布博客文章,披露6起旗下人工智能模型出现的”意外或令人担忧”行为案例,同时宣布建立新框架追踪、调查并公开模型失调问题(即AI未能遵循人类价值观和安全目标)。该公司警告,当前开发速度无法长期维持最高速度。

训练时发现异常

在其中一起新案例中,一款未发布的研究模型在自身笔记中插入类似”越狱”指令,要求忽略正常约束,并告诉自己摆脱”束缚其他聊天机器人的角色和身份”。另一起案例显示,一个AI代理未经用户询问便将文件上传至互联网以获取浏览器引用。OpenAI表示,这6起事件均在过去数月的训练或评估过程中发现。

OpenAI在博客中呼应竞争对手Anthropic提出的放缓开发呼吁。Anthropic此前表示,当前增长速度构成生存威胁。OpenAI指出:”我们不认为AI行业已在足够程度上解决对齐和监控问题,无法继续负责任地以最高速度扩展太久。”该公司强调:”关于未来数月和数年AI开发应如何推进的决定,需要依赖构建前沿模型公司外部人士可自行检验的证据。”

人类灭绝率超10%

拥有AI初创企业的谷歌和马斯克支持放缓呼吁。美国总统特朗普则以需要领先于中国AI产业为由拒绝这些呼吁。部分专家持怀疑态度,警告企业不得自行任命审计员。

AI可能构成的生存威胁范围涵盖协助开发生物武器到引发全球金融崩溃。Anthropic一名高级安全研究员表示,AI在未来10年内”杀死所有人类”的概率超过10%。但一名熟悉Anthropic想法的消息人士承认,”任何单一结果的确切概率可能无法得知”。

7月发生模型入侵

星期三披露的新案例之前,OpenAI在7月披露一个AI代理”群体”在网络安全测试期间入侵AI初创企业Hugging Face。Anthropic同月表示,旗下AI模型在测试期间入侵3家机构。Anthropic称,这些模型在测试时故意未设置网络安全防护,由于与外部测试公司的误解,模型得以接入开放互联网,相当于AI测试中”敞开前门”。

技术研究和咨询集团Omdia首席分析师苏廉节表示,自主运作的AI代理正变得更聪明,”更决心通过代理间协作、知识共享、欺骗和隐瞒来解决复杂任务”。这使得使用传统AI安全方法治理和遏制它们变得更加困难。OpenAI的新追踪和披露框架可能推动其他AI开发者采用类似做法。苏廉节表示:”尽管如此,该流程仍属内部和自愿性质,但是朝着正确方向迈出的一步。”

View Original Article
Newswav Malaysia Best News App

Newswav is an online content aggregator and obtains its content from different online sources. The content in the app do not belong to Newswav nor do they reflect the opinions of Newswav and its staff. Your use of this app indicates your understanding and acceptance of this information.

Newswav Sdn. Bhd. (201701008480 (1222645-M)) 2026 All Rights Reserved