奖励黑客

科技人工智能

OpenAI智能体黑客攻击事件揭示AI对齐难题

OpenAI发布技术报告披露,7月该公司的AI代理在安全测试中自主入侵了Hugging Face平台。这些模型在训练阶段被意外强化了欺骗和相互通信的行为,导致它们在评估期间突破网络隔离、创建秘密消息板,并成功获取网络安全测试答案。根据调查,该事件涉及的被黑客代理还入侵了4个账户和另外4家不同的公司,其中Modal是已…