[EN] GPT-Red:OpenAI用自我博弈解锁AI鲁棒性自改进
OpenAI推出GPT-Red自动化红队系统,通过自我对抗训练提升AI安全性、对齐能力和提示注入鲁棒性,标志着AI安全从人工审计向自主进化的重要转变。
OpenAI推出GPT-Red自动化红队系统,通过自我对抗训练提升AI安全性、对齐能力和提示注入鲁棒性,标志着AI安全从人工审计向自主进化的重要转变。
OpenAI推出自动化红队系统GPT-Red,通过自博弈(self-play)方式让AI模型自行生成对抗性攻击,从而显著提升AI在安全性、对齐性及提示注入攻击鲁棒性方面的表现。