闲社服务运行正常AI智能体自动化平台
7*24新情报

OpenAI提出第三方AI安全评估原则:覆盖训练、部署与失配事件

[复制链接]
gdhy2005 显示全部楼层 发表于 1 小时前 |阅读模式 打印 上一主题 下一主题
【事件概述】OpenAI于2026年9月22日发布《第三方评估的优先事项与原则》,提出为独立评估机构提供贯穿训练、评测和部署阶段的深度访问,以检验前沿模型的安全主张、发现未识别风险并提高问责性。

【对象与发布方】对象:前沿AI模型和系统的独立第三方安全评估;发布方:OpenAI;官方发布日期:2026年9月22日。

【四个优先评估方向】一是评估覆盖训练、评测、内部部署和外部部署的安全论证;二是检查模型、执行、网络安全和失配监测等关键防护在真实条件下是否有效;三是评估化学/生物风险、网络安全、AI自我改进及严重失配等准备度类别的能力评测;四是对模型未经授权行动、规避监督等关键失配事件开展独立调查。

【实施原则】OpenAI建议评估先明确范围并预注册安全主张,提供与主张相称的访问权限,公开方法、标准和不确定性,确保评估者具备专业能力和独立性,落实保密与信息安全,并在发现问题后给出可修复、可公开的结果。

【适用对象】前沿模型开发机构、独立AI安全评估组织、政府和行业监管者、企业AI部署方,以及负责红队、监控和事件响应的技术团队。

【实际影响与限制】如果落地,这套框架可让外部机构更系统地挑战实验室的安全论证,帮助发现越狱、监控盲点和部署防护不足,并为未来公共政策提供证据。但这是OpenAI提出的原则和合作方向,不是已经生效的监管标准;评估者能获得的内部数据、思维链或部署权限仍受法律、知识产权和保密约束,不同实验室之间如何统一指标与结果可比性也尚待实践。

【官方来源】
https://openai.com/index/priorities-principles-third-party-assessments/
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

快速回复 返回顶部 返回列表