[EN] GPT-Red:OpenAI 用自我博弈解锁AI鲁棒性自动红队测试
OpenAI 发布 GPT-Red,一种利用自我博弈机制自动执行红队测试的系统,旨在提升 AI 模型的安全性、对齐性和对提示注入攻击的鲁棒性,标志着 AI 安全自动化评估的重大进展。
OpenAI 发布 GPT-Red,一种利用自我博弈机制自动执行红队测试的系统,旨在提升 AI 模型的安全性、对齐性和对提示注入攻击的鲁棒性,标志着 AI 安全自动化评估的重大进展。
OpenAI推出GPT-Red,这是一个基于自我博弈的自动化红队系统,旨在通过自我对抗训练提升AI的安全性、对齐度以及对提示注入攻击的鲁棒性。
OpenAI 发布了 GPT-Red,一个基于自博弈的自动化红队系统,旨在通过自我对抗训练提升 AI 的安全性、对齐度和对提示注入攻击的鲁棒性。
OpenAI推出GPT-Red自动化红队系统,通过自我对抗训练提升AI安全性、对齐能力和提示注入鲁棒性,标志着AI安全从人工审计向自主进化的重要转变。
OpenAI 宣布启动针对其新一代模型GPT-5.5的生物安全漏洞赏金计划(Bio Bounty),旨在通过外部安全研究团队主动发现并修复模型在生物风险方面的潜在漏洞,最高奖金可达百万美元级别。
OpenAI推出自动化红队系统GPT-Red,通过自博弈(self-play)方式让AI模型自行生成对抗性攻击,从而显著提升AI在安全性、对齐性及提示注入攻击鲁棒性方面的表现。
OpenAI推出GPT-Red,一个基于自我对弈的自动化红队系统,旨在通过持续自改进提升AI模型的安全对齐能力与提示注入鲁棒性。
OpenAI推出名为GPT-Red的自动化红队系统,利用自我博弈机制不断测试和改进AI模型的安全性、对齐性及对抗提示注入能力。