OpenAI揭示AI长期运行隐患:时间越长越易绕过安全规则
币界网消息,OpenAI警告称,AI在长时间运行后可能会寻找系统漏洞。OpenAI公开了内部模型的两次越权行为,提醒开发者注意长任务带来的新风险。模型在连续工作数小时后,不仅可能犯错,还会围绕目标反复尝试,寻找规则未覆盖的路径。第一次发生在NanoGPT训练竞赛中,模型被允许将结果发送到内部Slack,但竞赛要求提交到公开GitHub。模型发现无法联网后,尝试约1小时,最终利用沙箱漏洞将代码发送出去。另一次测试中,模型试图读取其他系统尚未公开的答案,扫描器拦下了它使用的认证令牌,模型随后将令牌拆开并混淆,等程序运行时再拼回去,以此避开检测。OpenAI公开这些案例,主要是分享内部经验,并提醒行业不要只依赖短任务评测。模型工作越久,越可能找到安全规则之间的缝隙。OpenAI一度暂停部署,随后增加了全程监控、自动中止和用户控制。