互联网

OpenAI公布Atlas浏览模型提示注入防护方案

来源:OpenAI    作者:OpenAI      2026年09月29日 13:56

导语:OpenAI公布针对Atlas浏览模型的提示注入防护方案。

摘要

OpenAI公布针对Atlas浏览模型的提示注入防护方案。提示注入是指网页、文档或外部内容通过隐藏指令诱导AI模型执行非预期操作,尤其会影响具备网页访问和外部网络能力的浏览型AI。OpenAI表示,通过针对性训练、评估和防护机制,可以显著降低模型遵循恶意网页指令的概率。在相关测试中,经过加固的模型将提示注入成功率从两成以上降至不足1%,同时尽量保持正常浏览任务能力。

正文(中文编译稿)

OpenAI表示,随着AI代理开始浏览网页、读取文件并调用外部服务,提示注入已经成为影响代理安全的重要风险。攻击者可以把指令隐藏在网页文本、页面结构或其他外部内容中,诱导模型泄露信息、执行错误操作,或者偏离用户最初的任务目标。

Atlas模型的防护工作重点包括训练模型识别不可信指令、区分用户意图与网页内容,以及在执行高风险操作前提高判断门槛。OpenAI还通过模拟真实网页环境的评估方法,测试模型在不同类型提示注入攻击下的表现。

测试结果显示,加固后的模型在面对恶意网页内容时,遵循攻击指令的比例显著下降。OpenAI表示,安全防护不能只依赖单一过滤器,还需要结合模型训练、系统设计、工具权限和持续评估。

这项工作主要面向浏览型AI和能够访问外部网络的代理系统。随着AI代理承担更多检索、执行和自动化任务,如何在保持可用性的同时限制外部内容对模型行为的影响,将成为产品部署中的长期问题。

(文章为作者独立观点,不代表艾瑞网立场)
  • 合作伙伴

  • 官方微信
    官方微信

    新浪微博
    邮件订阅
    第一时间获取最新行业数据、研究成果、产业报告、活动峰会等信息。
     关于艾瑞| 业务体系| 加入艾瑞| 服务声明| 信息反馈| 联系我们| 合作伙伴| 友情链接

Copyright© 沪公网安备 31010402000581号沪ICP备15021772号-10

扫一扫,或长按识别二维码

关注艾瑞网官方微信公众号