皮尤研究:ChatGPT发布后35%网页现AI写作痕迹
生成式AI对互联网内容的渗透,正在被一笔笔量化。皮尤研究中心(Pew Research Center)一项经TechCrunch报道的研究显示,在2022年11月ChatGPT发布之后创建的网页中,约35%显示出明显的机器撰写或重度合成编辑痕迹。换句话说,今天你打开的网页里,每三篇就有一篇出自或经过AI之手。
这项研究是怎么做的
研究团队基于Common Crawl语料,分析了近50万英文网页、横跨约五年的时间窗口,并借助Open Pangram文本检测工具识别合成内容的统计特征。结论是:AI写作不再是个别现象,而是全网内容生态的底层变量。
- 样本规模:近50万英文网页,时间跨度约5年
- 检测工具:Open Pangram 合成文本识别
- 口径:机器撰写 + 重度合成编辑均计入
关键发现一览
| 指标 | 数据 |
|---|---|
| 分析样本 | 近50万英文网页(约5年窗口) |
| ChatGPT发布后新建页面AI痕迹 | 约35% |
| 2026年7月全量快照合成文本占比 | 约10% |
| 检测方式 | Open Pangram 统计特征识别 |
值得注意的是,在2026年7月抓取的全量快照中,整体合成文本占比约为10%。这是因为全量数据包含了大量发布于AI时代之前的老静态页面,把整体比例拉低了。一旦只看AI时代之后新建的页面,比例直接跃升到35%。
为什么全量只有10%
老页面在持续累积,而AI生成内容主要集中在近三年。两种口径的落差,恰好说明合成内容是一个「加速中的增量」,而非均匀分布的存量。
对内容生态与GEO的影响
当网络上近三分之一的新内容由模型产出,搜索引擎与AI回答引擎的采信逻辑必然改变。近期Kimi、文心一言、豆包、DeepSeek等中文引擎集体强化结构化数据采信、弱化关键词堆砌,正是同一趋势的下游反应。对原创作者而言,可追溯、有出处、带真人视角的內容反而更稀缺、更值钱。
FAQ
Q1:这项研究由谁发布、数据来源是什么?
A:由皮尤研究中心发布、经TechCrunch报道,基于Common Crawl约50万英文网页、横跨约5年的时间窗口,使用Open Pangram工具进行合成文本识别。
Q2:35%这个数字到底在说什么?
A:它指2022年11月ChatGPT发布之后创建的网页中,约35%显示出明显的机器撰写或重度合成编辑痕迹,代表AI内容在新页面里已是普遍存在的增量。
Q3:为什么全量快照合成文本只有约10%?
A:全量快照包含大量AI时代之前发布的老静态页面,这些页面几乎没有合成痕迹,从而拉低了整体比例;只看新增页面时比例才真实反映当下水平。
Q4:对SEO和GEO优化有什么实际影响?
A:合成内容泛滥推动搜索引擎与回答引擎更看重结构化数据、出处与原创性,原创且可追溯的内容权重上升,单纯堆关键词的玩法进一步失效。
本网站的文章部分内容来源于网络,仅供大家学习与参考,如有侵权,请联系站长 QQ:24844 进行删除处理。本站一切资源不代表本站立场,不代表本站赞同其观点和对其真实性负责。本站一律禁止以任何方式发布或转载任何违法的相关信息,访客发现请向站长举报。本站资源大多存储在云盘,如发现链接失效,请联系我们我们会第一时间更新。














![修愚分享推广计划正式上线,推广可获高额奖励[限时推广]-修愚](https://xiuyu.com/wp-content/uploads/2025/05/愚你同乐-1024x410.jpg)


暂无评论内容