OpenAI 提出前沿 AI 训练安全指导原则:高级管理人员应有否决权
IT之家 9 月 29 日消息,OpenAI 今日通过官方新闻稿提出一套指导方针,要求企业在进行前沿 AI 强化学习训练之前,提交结构化的安全论证文件。
OpenAI 表示,安全论证应提交给多位高级管理人员审核,每位人员都有权否决训练任务,确保训练在内部经过研究部门负责人或副总裁、安全负责人及首席科学家等多个环节的严格把关。
此外,研究部门负责人、研究副总裁等负责训练任务的高级管理人员,需对安全论证及任何事故响应承担责任,包括将这些内容纳入绩效考核,以激励训练团队主动推进安全与对齐工作。
OpenAI 指出,若高优先级安全警报未在规定时限内得到确认,受影响的训练任务应自动暂停。这些建议已进入实施阶段,未来预计还将继续调整。同时,训练流程应能便捷地识别未对齐模型的所有下游用途(IT之家注:例如用于数据生成或评分),以便在必要时消除未对齐输出带来的影响。
今日早些时候,OpenAI 宣布,由于越来越多报告显示 AI 智能体获得敏感领域访问权限并出现意外行为,公司已暂停最新 AI 模型的训练。
参考
- Towards safety cases for frontier AI training
相关阅读:
- 《内部测试发现安全隐患,消息称 OpenAI 取消发布 AI 模型 GPT‑6.1 Astra》