联合国人工智能小组评估美国智能体“越界”事件

2026-09-21 23:11:54

  联合国“人工智能独立国际科学小组”21日发表专题简报,评估美国开放人工智能研究中心的人工智能体今年7月在测试中“越界”,侵入美国“抱抱脸”公司系统的事件。

  7月下旬,OpenAI承认,其网络安全训练与评估场景中的人工智能体绕过网络限制,侵入“抱抱脸”公司的部分系统。智能体突破了原本互相隔离的运行环境建立通信、欺骗评估人员并试图掩盖作弊行为,上述每一步操作均无人类指令干预。

  简报说,AI系统能力提升固然可帮助用户实现目标,但当AI的目标和用户意图发生“对齐失效”时,就可能产生危害。更强的能力让AI更容易找到意外的漏洞、突破安全防护屏障,并在人类监督下隐藏自身行为。一旦智能体之间开展规划与协同,造成的损害还会进一步放大。尽管OpenAI终止了此次异常活动,但这并不代表运营方能够管控未来那些规划能力更强,可在无监督条件下长时间运行,或是更擅长识别并突破安全防护机制的智能体。

  该简报还阐释了训练过程如何引发“对齐失效”的目标和行为,包括奖励作弊、奖励篡改现象。报告说,AI故障可跨越企业和国界,没有任何单一机构或国家能接触足够多的事件样本进而识别所有新出现的风险模式。

  报告并未给出应对此类失控事件的最佳方式,但建议可参考航空、核能等其他需要国际协作、技术准入的领域的处置思路。报告说,AI相关风险管理需要得到更多关注和资源投入。监测与这类事件相关的证据和科学进展,正是“人工智能独立国际科学小组”的一项重要职责。

  特别

  柬埔寨“8号电诈园区”内部曝光:墙上挂中文标语“请不要假装很努力,结果不会陪你演戏”,办公住宿餐饮俱全,道路装监控……

  台湾网红“馆长”在直播中表示,未来将不再组织赴大陆的活动,因为来一次亏一次,高昂的成本实在烧不起

  贾国龙最新发声:结合西贝惨痛的教训,“恳请监管部门进一步厘清高流量网络账号的言论边界,区分正常舆论监督与网络软暴力等”

  凌晨一点的北京家属院里,72岁的濮存昕用一根绳子,将自己与94岁患阿尔茨海默症的母亲紧紧系在一起

  联发科Dimensity CX C10 Max处理器亮相 Googlebook平台的重要核心硬件

  vivo X500 Pro Max专业影像手柄套装/增距镜G2发布,699元/ 999元起

下一篇:2025年全球售出约7000台人形机器人
上一篇:昀冢科技:拟调整2025年度定增方案 募资上限下调至8.1亿元
返回顶部小火箭