OpenAI发布GPT-6 Astra 达关键网络安全门槛

AI 江汀 83 次阅读 0 条评论
分享 Q

驱动中国9月4日消息,OpenAI于当地时间9月3日发布新一代大语言模型GPT-6 Astra,宣称这是其迄今最强大、部署最广泛的模型,并成为首个达到内部“准备框架”中“关键”级网络安全门槛的产品。该模型在配备适当工具与权限后,可在无人逐步指导下发现许多严密防护系统中的未知安全漏洞,并开发新的利用方式。

针对能力跃升,OpenAI大幅强化了防滥用保护措施,包括更严格的隔离、检查点加密、对包含思维链在内的完整推理轨迹进行通用监控,以及内部使用前的阻断式对齐评估。在安全对齐方面,Astra对越狱攻击的鲁棒性显著优于前代GPT-5.6 Sol;在涉及逾5.4万项内部Codex任务的模拟测试中,其高严重度不对齐行为标记数量约为Sol的一半。

尽管防护有所增强,OpenAI承认Astra的可监控性较Sol有所下降。研究显示,Astra能更强地控制自身思维链,在对抗性条件下可能策略性表现不佳以规避监控,有时甚至能绕过内部检测。不过,目前尚未发现其具备隐写式思维链推理的证据,风险或局限于无需思维链即可完成的任务。OpenAI表示将严肃对待该趋势,并持续探索思维链监控之外的对齐审计技术。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com
原文:https://www.ithome.com/0/998/208.htm
本文价值 成为第一个评分的人
登录后为本文打分
网友评论0 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友