找回密码
 立即注册
搜索
热搜: 活动 交友 discuz
查看: 47|回复: 0

openAI暂停前沿扩展步伐

[复制链接]

181

主题

1

回帖

685

积分

高级会员

积分
685
发表于 2026-8-19 09:08:30 来自手机 | 显示全部楼层 |阅读模式
作为美国AI圈子“炫耀前沿大模型能力”的最新风尚,OpenAI周二大张旗鼓地宣布,鉴于前沿大模型的能力已经达到关键安全阈值,公司将继续放缓模型规模扩展的步伐,优先改进人工智能系统背后的安全与监控机制。
OpenAI表示近几周出现的两项进展(开发中的前沿模型失控攻击外部第三方公司的数据库,以及即将推出Astra模型可能已经达到“关键网络安全能力”门槛),再加上内部研究的快速推进,都使得公司更加迫切地需要在训练流程的各个阶段,加强监控、对齐和隔离防护措施。OpenAI首席科学家雅库布·帕乔茨基周二在记者会上表示:“我们确实预计这些模型的能力提升速度会比过去快得多,正因如此,我们才更加重视加强安全防护措施。”OpenAI披露,为了满足安全标准,对于最新一批计划部署的模型,已经暂停强化学习(RL)训练两周,以进一步强化研究环境的安全性,并扩大监控系统的覆盖范围。目前,公司最大规模前沿模型的强化学习训练仍处于暂停状态。具体的操作方面,OpenAI现在要求涉及Astra模型或更先进AI模型的工作负载必须采用最严格的安全防护措施。所以大量相关工作在完成迁移达到新安全标准前将处于暂停状态。更关键的是监控系统的扩展,引入了激活分类器(activation classifiers)。这些分类器会对每一个被采样的词元进行监测,并将潜在的异常情况上报给自动化调查系统。系统的设计目标是在检测到令人担忧的活动后,能够在30分钟内发出警报。如果监控系统判断可能有人或模型突破了关键安全边界,则会生成最高优先级警报,并立即通知安全、安保和研究团队。
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

QQ群

Archiver|手机版|小黑屋|先知先觉指标论坛

GMT+8, 2026-9-14 21:14 , Processed in 0.070502 second(s), 19 queries .

快速回复 返回顶部 返回列表