OpenAI发布GPT-6 Astra 达关键网络安全门槛
驱动中国9月4日消息,OpenAI于当地时间9月3日发布新一代大语言模型GPT-6 Astra,宣称这是其迄今最强大、部署最广泛的模型,并成为首个达到内部“准备框架”中“关键”级网络安全门槛的产品。该模型在配备适当工具与权限后,可在无人逐步指导下发现许多严密防护系统中的未知安全漏洞,并开发新的利用方式。
针对能力跃升,OpenAI大幅强化了防滥用保护措施,包括更严格的隔离、检查点加密、对包含思维链在内的完整推理轨迹进行通用监控,以及内部使用前的阻断式对齐评估。在安全对齐方面,Astra对越狱攻击的鲁棒性显著优于前代GPT-5.6 Sol;在涉及逾5.4万项内部Codex任务的模拟测试中,其高严重度不对齐行为标记数量约为Sol的一半。
尽管防护有所增强,OpenAI承认Astra的可监控性较Sol有所下降。研究显示,Astra能更强地控制自身思维链,在对抗性条件下可能策略性表现不佳以规避监控,有时甚至能绕过内部检测。不过,目前尚未发现其具备隐写式思维链推理的证据,风险或局限于无需思维链即可完成的任务。OpenAI表示将严肃对待该趋势,并持续探索思维链监控之外的对齐审计技术。
本文价值
★★★★★
—
成为第一个评分的人
登录后为本文打分
评论加载中…