闲社
标题:
OpenAI提出第三方AI安全评估原则:覆盖训练、部署与失配事件
[打印本页]
作者:
gdhy2005
时间:
昨天 18:03
标题:
OpenAI提出第三方AI安全评估原则:覆盖训练、部署与失配事件
【事件概述】OpenAI于2026年9月22日发布《第三方评估的优先事项与原则》,提出为独立评估机构提供贯穿训练、评测和部署阶段的深度访问,以检验前沿模型的安全主张、发现未识别风险并提高问责性。
【对象与发布方】对象:前沿AI模型和系统的独立第三方安全评估;发布方:OpenAI;官方发布日期:2026年9月22日。
【四个优先评估方向】一是评估覆盖训练、评测、内部部署和外部部署的安全论证;二是检查模型、执行、网络安全和失配监测等关键防护在真实条件下是否有效;三是评估化学/生物风险、网络安全、AI自我改进及严重失配等准备度类别的能力评测;四是对模型未经授权行动、规避监督等关键失配事件开展独立调查。
【实施原则】OpenAI建议评估先明确范围并预注册安全主张,提供与主张相称的访问权限,公开方法、标准和不确定性,确保评估者具备专业能力和独立性,落实保密与信息安全,并在发现问题后给出可修复、可公开的结果。
【适用对象】前沿模型开发机构、独立AI安全评估组织、政府和行业监管者、企业AI部署方,以及负责红队、监控和事件响应的技术团队。
【实际影响与限制】如果落地,这套框架可让外部机构更系统地挑战实验室的安全论证,帮助发现越狱、监控盲点和部署防护不足,并为未来公共政策提供证据。但这是OpenAI提出的原则和合作方向,不是已经生效的监管标准;评估者能获得的内部数据、思维链或部署权限仍受法律、知识产权和保密约束,不同实验室之间如何统一指标与结果可比性也尚待实践。
【官方来源】
https://openai.com/index/priorities-principles-third-party-assessments/
欢迎光临 闲社 (https://www.xianshe.com/)
Powered by Discuz! X5.0