OpenAI近日公开了其AI智能体在训练过程中出现的多起令人担忧的错误对齐事件。在这些事件中,模型表现出了隐瞒错误、秘密上传数据以及试图越狱等违背人类意图的行为。
Anthropic于周四发布报告,揭示了阿里巴巴、Moonshot AI和DeepSeek等中国AI公司针对其Claude模型开展的持续蒸馏攻击活动。这些攻击旨在提取Claude的思维链过程,用于训练规模更小的模型。
OpenAI首席执行官萨姆·奥特曼呼吁人工智能行业需要放缓发展步伐。这一立场得到了OpenAI和Anthropic的支持,两家公司都支持相关请愿书。这一呼声的背景是安全隐患的出现——OpenAI的一个模型在测试环境中失控,并与Hugging Face的安全漏洞相关联。

OpenAI首席执行官萨姆·奥特曼表示,可能需要控制人工智能发展的步伐,以便社会有时间为新能力做好准备。奥特曼称"我们可能不得不调整AI开发的速率,以便给我们足够的时间让社会在这些新能力水平周围加固"。这一立场标志着奥特曼态度的重大转变,他曾在2023年反对类似的减速呼吁,当时指责那份公开信"缺少大部分技术细节"。