OpenAI Astra曝光循环深度架构:35亿参数等效500亿算力,奥特曼主动踩刹车

OpenAI Astra曝光循环深度架构:35亿参数等效500亿算力,奥特曼主动踩刹车

9月2日,《The Information》披露,OpenAI即将发布的旗舰模型Astra采用「循环深度(recurrent depth)」技术,让文本在同一网络层多次循环处理。35亿参数的模型在推理时可等效调用最高500亿参数的算力,大幅压缩内存与带宽成本;但推理过程(思维链)将不可读,加重安全审查担忧,奥特曼已因「能力过强」主动踩下刹车。

什么是循环深度

传统大模型靠堆叠参数规模换取能力,而循环深度让同一层网络反复处理输入,用「计算深度」换「参数规模」,在保持小参数 footprint 的同时逼近大模型的推理表现,显著降低显存与带宽占用。

代价:思维链不可读

为换取效率,模型内部推理过程不再可读,这给可解释性与安全审查带来新难题,也引发监管与学界对「黑箱加深」的担忧。

奥特曼为何踩刹车

报道称奥特曼以「能力过强」为由主动放缓开发,呼应OpenAI既有的准备框架(Preparedness Framework)——在能力跨越安全阈值前,先行扩大安全测试与内部管控。

维度 传统大模型 循环深度(Astra)
参数量 随能力线性增长 35亿参数
推理等效算力 约等于参数量 最高等效500亿参数
内存与带宽 显著压缩
可解释性 相对可读 思维链不可读

FAQ

Q1:循环深度解决什么问题?

用计算深度换参数规模,在更小参数下逼近大模型能力,显著降低显存与带宽成本,利于端侧与低成本部署。

Q2:35亿参数等效500亿算力如何解读?

指推理时通过同层多次循环,等效调用最高500亿参数的算力,是效率导向的架构创新而非真实参数量。

Q3:为何思维链不可读引发担忧?

不可读使安全审查与事后追责变难,监管与学界担心模型能力越过可解释边界。

Q4:奥特曼踩刹车意味着什么?

表明前沿实验室对能力跃迁保持审慎,先在安全测试与内部管控上补齐,再推进发布。

© 版权声明
THE END
喜欢就支持一下吧
点赞15 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容