OpenAI重启10万亿参数预训练,高质量语料成AI新瓶颈

OpenAI重启10万亿参数预训练,高质量语料成AI新瓶颈

2026年8月,大模型行业进入新一轮技术博弈期。OpenAI代号Astra的GPT-6模型因安全问题紧急暂缓后,仅隔三天便启动代号Doug的新一轮大规模预训练,参数规模约10万亿,预计最迟2026年11月前推出。与此同时,高质量训练数据短缺,正取代算力成为行业新的结构性瓶颈。

Astra暂缓与Doug重启:三天之内的转向

据长期跟踪OpenAI动态的业界爆料,GPT-6代号Astra,参数规模约10万亿,原计划2026年8月发布,发布前因安全团队对模型能力担忧而紧急暂缓。8月10日,距Astra暂缓仅三天,OpenAI便启动代号Doug的新一轮大规模预训练。

GPT-4参数约1.8万亿,GPT-6的10万亿参数在数量级上完成跃升,较GPT-4翻超五倍。值得关注的是,OpenAI近两年的能力增长主要依靠后训练、强化学习和推理时计算(test-time compute)推动,Doug项目的启动标志着大型预训练的重启。

参数跃升背后的工程挑战

参数增长带来的逻辑推理和泛化能力提升,需要在安全对齐和推理效率之间寻找新的平衡点。10万亿参数并非简单的规模放大,而涉及训练框架、数据管道和算力调度的全面升级。在Astra暂缓后三天即启动Doug,也反映出OpenAI与Anthropic竞争的时间压力。

高质量语料:被忽视的新瓶颈

随着可合法获取的高质量文本、代码、多模态数据逐渐见顶,高质量训练数据短缺成为行业新瓶颈。出版与新闻企业正加速向AI语料供应商转型,把自身合规内容资产打包成训练数据 sourcing。这意味着AI产业链的竞争,正从「谁有更多GPU」延伸到「谁掌握更干净、更稀缺的语料」。

维度 事实
GPT-4参数规模 约1.8万亿
GPT-6(Doug)目标参数 约10万亿,较GPT-4翻超五倍
Astra状态 发布前因安全担忧紧急暂缓
Doug启动时间 2026-08-10(Astra暂缓后三天)
预计推出窗口 最迟2026年11月前
能力增长主引擎 后训练、强化学习、推理时计算

需求侧仍在爆发:周调用量达69万亿Token

据2026年8月11日AIGC日报数据,全球AI大模型周调用量已达69万亿Token,中国模型包揽周调用量前四名。应用侧的持续放量,反过来加剧了对训练与推理两端资源的争夺。阿里千问开放平台已上线,支持手机、PC、眼镜三端接入;Meta开源Muse Glimmer,英伟达也推出开源端到端语音对话模型,大模型竞争从能力比拼进入生态竞争阶段。

FAQ

Q1:Astra和Doug是什么关系?

Astra是GPT-6的原代号,原计划2026年8月发布,因安全团队对模型能力担忧而暂缓;Doug是Astra暂缓三天后启动的新一轮大规模预训练项目代号,目标仍是推进下一代约10万亿参数模型。

Q2:为什么高质量语料会成为瓶颈?

可合法获取的高质量文本、代码与多模态数据逐渐见顶,而模型参数与训练规模持续放大,数据供需缺口扩大,推动出版与新闻企业向AI语料供应商转型,语料成为继算力之后的关键稀缺资源。

Q3:OpenAI近年的能力提升主要靠什么?

主要依靠后训练、强化学习和推理时计算(test-time compute),而非单纯扩大预训练规模。Doug项目标志着在暂缓Astra后,大型预训练路线被重新启动。

Q4:这对创业公司有什么影响?

算力与语料双重稀缺抬高了基础模型创业门槛,但也催生了语料清洗标注、合规数据 sourcing、推理优化与垂直小模型等工具链机会,应用层创业者可更多借助开源与云推理降本。

© 版权声明
THE END
喜欢就支持一下吧
点赞9 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容