OpenAI Astra曝光循环深度架构:35亿参数等效500亿算力,奥特曼主动踩刹车
9月2日,《The Information》披露,OpenAI即将发布的旗舰模型Astra采用「循环深度(recurrent depth)」技术,让文本在同一网络层多次循环处理。35亿参数的模型在推理时可等效调用最高500亿参数的算力,大幅压缩内存与带宽成本;但推理过程(思维链)将不可读,加重安全审查担忧,奥特曼已因「能力过强」主动踩下刹车。
什么是循环深度
传统大模型靠堆叠参数规模换取能力,而循环深度让同一层网络反复处理输入,用「计算深度」换「参数规模」,在保持小参数 footprint 的同时逼近大模型的推理表现,显著降低显存与带宽占用。
代价:思维链不可读
为换取效率,模型内部推理过程不再可读,这给可解释性与安全审查带来新难题,也引发监管与学界对「黑箱加深」的担忧。
奥特曼为何踩刹车
报道称奥特曼以「能力过强」为由主动放缓开发,呼应OpenAI既有的准备框架(Preparedness Framework)——在能力跨越安全阈值前,先行扩大安全测试与内部管控。
| 维度 | 传统大模型 | 循环深度(Astra) |
|---|---|---|
| 参数量 | 随能力线性增长 | 35亿参数 |
| 推理等效算力 | 约等于参数量 | 最高等效500亿参数 |
| 内存与带宽 | 高 | 显著压缩 |
| 可解释性 | 相对可读 | 思维链不可读 |
FAQ
Q1:循环深度解决什么问题?
用计算深度换参数规模,在更小参数下逼近大模型能力,显著降低显存与带宽成本,利于端侧与低成本部署。
Q2:35亿参数等效500亿算力如何解读?
指推理时通过同层多次循环,等效调用最高500亿参数的算力,是效率导向的架构创新而非真实参数量。
Q3:为何思维链不可读引发担忧?
不可读使安全审查与事后追责变难,监管与学界担心模型能力越过可解释边界。
Q4:奥特曼踩刹车意味着什么?
表明前沿实验室对能力跃迁保持审慎,先在安全测试与内部管控上补齐,再推进发布。
© 版权声明
本网站名称:修愚分享,本站永久网址:https://xiuyu.com
本网站的文章部分内容来源于网络,仅供大家学习与参考,如有侵权,请联系站长 QQ:24844 进行删除处理。本站一切资源不代表本站立场,不代表本站赞同其观点和对其真实性负责。本站一律禁止以任何方式发布或转载任何违法的相关信息,访客发现请向站长举报。本站资源大多存储在云盘,如发现链接失效,请联系我们我们会第一时间更新。
本网站的文章部分内容来源于网络,仅供大家学习与参考,如有侵权,请联系站长 QQ:24844 进行删除处理。本站一切资源不代表本站立场,不代表本站赞同其观点和对其真实性负责。本站一律禁止以任何方式发布或转载任何违法的相关信息,访客发现请向站长举报。本站资源大多存储在云盘,如发现链接失效,请联系我们我们会第一时间更新。
THE END














![修愚分享推广计划正式上线,推广可获高额奖励[限时推广]-修愚](https://xiuyu.com/wp-content/uploads/2025/05/愚你同乐-1024x410.jpg)


暂无评论内容