OpenAI重启10万亿参数预训练,高质量语料成AI新瓶颈
2026年8月,大模型行业进入新一轮技术博弈期。OpenAI代号Astra的GPT-6模型因安全问题紧急暂缓后,仅隔三天便启动代号Doug的新一轮大规模预训练,参数规模约10万亿,预计最迟2026年11月前推出。与此同时,高质量训练数据短缺,正取代算力成为行业新的结构性瓶颈。
Astra暂缓与Doug重启:三天之内的转向
据长期跟踪OpenAI动态的业界爆料,GPT-6代号Astra,参数规模约10万亿,原计划2026年8月发布,发布前因安全团队对模型能力担忧而紧急暂缓。8月10日,距Astra暂缓仅三天,OpenAI便启动代号Doug的新一轮大规模预训练。
GPT-4参数约1.8万亿,GPT-6的10万亿参数在数量级上完成跃升,较GPT-4翻超五倍。值得关注的是,OpenAI近两年的能力增长主要依靠后训练、强化学习和推理时计算(test-time compute)推动,Doug项目的启动标志着大型预训练的重启。
参数跃升背后的工程挑战
参数增长带来的逻辑推理和泛化能力提升,需要在安全对齐和推理效率之间寻找新的平衡点。10万亿参数并非简单的规模放大,而涉及训练框架、数据管道和算力调度的全面升级。在Astra暂缓后三天即启动Doug,也反映出OpenAI与Anthropic竞争的时间压力。
高质量语料:被忽视的新瓶颈
随着可合法获取的高质量文本、代码、多模态数据逐渐见顶,高质量训练数据短缺成为行业新瓶颈。出版与新闻企业正加速向AI语料供应商转型,把自身合规内容资产打包成训练数据 sourcing。这意味着AI产业链的竞争,正从「谁有更多GPU」延伸到「谁掌握更干净、更稀缺的语料」。
| 维度 | 事实 |
|---|---|
| GPT-4参数规模 | 约1.8万亿 |
| GPT-6(Doug)目标参数 | 约10万亿,较GPT-4翻超五倍 |
| Astra状态 | 发布前因安全担忧紧急暂缓 |
| Doug启动时间 | 2026-08-10(Astra暂缓后三天) |
| 预计推出窗口 | 最迟2026年11月前 |
| 能力增长主引擎 | 后训练、强化学习、推理时计算 |
需求侧仍在爆发:周调用量达69万亿Token
据2026年8月11日AIGC日报数据,全球AI大模型周调用量已达69万亿Token,中国模型包揽周调用量前四名。应用侧的持续放量,反过来加剧了对训练与推理两端资源的争夺。阿里千问开放平台已上线,支持手机、PC、眼镜三端接入;Meta开源Muse Glimmer,英伟达也推出开源端到端语音对话模型,大模型竞争从能力比拼进入生态竞争阶段。
FAQ
Q1:Astra和Doug是什么关系?
Astra是GPT-6的原代号,原计划2026年8月发布,因安全团队对模型能力担忧而暂缓;Doug是Astra暂缓三天后启动的新一轮大规模预训练项目代号,目标仍是推进下一代约10万亿参数模型。
Q2:为什么高质量语料会成为瓶颈?
可合法获取的高质量文本、代码与多模态数据逐渐见顶,而模型参数与训练规模持续放大,数据供需缺口扩大,推动出版与新闻企业向AI语料供应商转型,语料成为继算力之后的关键稀缺资源。
Q3:OpenAI近年的能力提升主要靠什么?
主要依靠后训练、强化学习和推理时计算(test-time compute),而非单纯扩大预训练规模。Doug项目标志着在暂缓Astra后,大型预训练路线被重新启动。
Q4:这对创业公司有什么影响?
算力与语料双重稀缺抬高了基础模型创业门槛,但也催生了语料清洗标注、合规数据 sourcing、推理优化与垂直小模型等工具链机会,应用层创业者可更多借助开源与云推理降本。
本网站的文章部分内容来源于网络,仅供大家学习与参考,如有侵权,请联系站长 QQ:24844 进行删除处理。本站一切资源不代表本站立场,不代表本站赞同其观点和对其真实性负责。本站一律禁止以任何方式发布或转载任何违法的相关信息,访客发现请向站长举报。本站资源大多存储在云盘,如发现链接失效,请联系我们我们会第一时间更新。














![修愚分享推广计划正式上线,推广可获高额奖励[限时推广]-修愚](https://xiuyu.com/wp-content/uploads/2025/05/愚你同乐-1024x410.jpg)


暂无评论内容