当“AI饲料”,我都被AI嫌弃了?

字母AI·2026年09月29日 18:44
OpenAI和微软内部记录曝光,文字、照片,社交媒体上的一切都已经被喂给AI

2026年9月18日,纽约南区联邦法院解封了一批文件,里面包含了OpenAI和微软的内部记录。

材料显示,OpenAI和微软通过采集别人生产的内容,训练自己的模型。

但这并不是个例,我们在网上记录的点点滴滴,如今正逐渐变成AI的“饲料”。

AI不会给你点赞、收藏或者转发,因为它压根不理解你创作的内容,只是把你留下的一切收进去,变成它自己的一部分。

于是写作、绘画、说话、歌唱、拍照,这些原本属于人的事,忽然变成了AI发展的核心。

但是你也不必太担心,有一个不知道是好是坏的消息,未来AI不会再把我们当成饲料了,因为它马上学会自己造饲料。

事件来龙去脉

2026年9月17日,纽约南区联邦法院解封了一批文件。这批文件来自《纽约时报》起诉OpenAI和微软的版权案,内容是两家公司的内部记录。

在一份内部备忘录里,微软应用科学总监布伦特·赫克特(Brent Hecht)把用全网内容训练大模型称为“一场规模前所未有的惊人盗窃”,并说这很可能是“人类历史上最大的一次劳动盗窃”。这句话出自被告公司的员工,不是原告的指控。

这起官司已经打了将近三年。

原告是《纽约时报》,被告是OpenAI和微软。此前庭审的走向总体上支持“用版权内容训练模型属于合理使用”。这批解封材料的不同之处,在于它提供的是被告自己的内部记录,而不是法律论证。

微软的内部测算显示,Copilot上线后,《纽约时报》域名的点击率相比传统Bing搜索最多下降93%。

在内部演示文稿中,赫克特把这种下滑称为“死亡循环”,认为它“会同时伤害我们模型的表现,也会伤害整个互联网”。

他还写道,一个终端产品威胁到自己关键供应商的经济根基,这种情况极不寻常,但这是模型业务和它的“内容供应链”造成的局面。文稿中的“供应商”,指的就是生产内容的新闻媒体。

ChatGPT负责人尼克·特利(Nick Turley)在内部沟通中说,ChatGPT这类产品对出版机构构成“生存威胁”,而且“在很大程度上是替代性的”,“随着它们变得更强,会越来越具有替代性”。

OpenAI总裁布罗克曼说,这些模型“非常擅长新闻”。纳德拉在今年作证时承认,和聊天机器人对话“已经替代了直接去网站获取信息”。

然而法律要求不能“替代或损害原作品的市场”。

文件同时还给出了训练数据的规模。仅OpenAI的训练数据集中,就包含《纽约时报》《每日新闻》和调查报道中心的作品91692份拷贝。

在一个从Common Crawl派生的数据集中,仅nytimes.com一个域名就抓取了两百多万份文档。不过其他媒体表示,从《纽约时报》抓取390万份,从《芝加哥论坛》报及其相关报刊抓取730万份。

此外还有一个名为Project Mango的项目,其数据集包含至少160903部新闻出版方的独立作品。OpenAI把整个GPT-3训练数据集交给了微软,微软则通过Project Taxi和Project Mango把数据回输给OpenAI。

文件中还记录了具体操作方式。

OpenAI研究员尼克·赖德(Nick Ryder)告诉布罗克曼,自己有一个“绕过纽约时报付费墙的黑客方法”,布罗克曼回复“不错”。

两人搭建的数据集WebText、WebText2,有相当大一部分是从网上直接抓来的新闻报道。还从Common Crawl拉取了数百万篇文章。

此外,在数据进入模型前,他们会刻意删除版权声明,因为研究人员“不想让模型向用户输出‘版权声明’”。

原告代理律师史蒂文·利伯曼(Steven Lieberman)说,证据表明,OpenAI和微软知道自己在做的事是错的。

微软对这批文件回应称,相关言论只是反映了一名员工的个人观点,不是法律分析,更不代表公司立场。赫克特并非决策者,公司雇他是为了“呈现不同的、非对称的视角”。

还有谁在喂 AI?

实际上OpenAI已经是“二进宫”了。

2023年9月,美国作家协会连同17位作家,如约翰·格里森姆(John Grisham)、乔治·R·R·马丁(George R. R. Martin)、朱迪·皮考特(Jodi Picoult)、大卫·鲍尔达奇(David Baldacci)、乔纳森·弗兰岑(Jonathan Franzen)、斯科特·图罗(Scott Turow)等人。

在纽约南区对OpenAI提起集体诉讼。此后,多起作家诉讼(特伦布莱(Tremblay)、西尔弗曼(Silverman)、夏邦(Chabon)等)陆续并入,原告规模还在扩大。

《纽约时报》诉状里的证物J,标题叫《GPT-4 记忆〈纽约时报〉内容的一百个例子》,整整 127 页。喂给它一篇文章的开头,它能几乎逐字补完剩下的部分,连署名和引语都在。

2026 年,arXiv上发布了一篇名为《对齐打地鼠》的论文。

研究者把模型微调成“按情节写全文”——只给情节摘要,不给原文。结果GPT-4o、Gemini 2.5 Pro能复现出85%到90%的版权书籍原文,单段逐字复现超过460个词。研究者给这种现象起了个名字,叫“对齐打地鼠”:你堵住一个漏洞,它在别处又冒出来。

这不是偶然。尼古拉斯·卡尔利尼(Nicholas Carlini)早在 2023 年就说过:模型越大、你那段数据被重复喂的次数越多、上下文给得越足,它记得就越死。

实际上扒取网上的公开资料,把人们的记录变成AI饲料的,远不止于OpenAI和微软。

2026年9月4日,一起集体诉讼递到了伊利诺伊北区联邦法院。原告是两个家庭,连同他们的孩子。诉状指控 Meta 未经同意,抓取Facebook和Instagram用户的照片和生物特征数据,用来训练三样东西:人脸识别系统NameTag 背后的模型、给NameTag做比对用的“人脸指纹”,以及生成式图像模型Emu和Muse Image。

NameTag是给Ray-Ban和Oakley智能眼镜准备的。早在2026年6月初,就有人发现在Meta的配套App里存在NageTag相关的代码,只不过当时并不知道这个功能是干什么用的。

Meta的回应是:“这起诉讼没有依据,曲解了我们的工作……NameTag没有向消费者发布,也没有最终决定要做什么。”它还强调,自己“不是在建立一个通用的人脸数据库”。

话虽如此,但Meta已经是第三次因为人脸识别被告上法庭了。

2021 年,它因为“自动标记好友”违反伊利诺伊《生物识别信息隐私法》,赔了6.5亿美元,约142万伊利诺伊用户分钱,有人拿到了400多美元。2023年,Instagram的人脸识别又让它赔了6850万美元,约400万伊利诺伊居民符合资格。Snap也因类似问题在2016年赔了3500万美元。

这部法律的罚则是每人每项1000到5000美元。

从金额来看,以Meta的用户规模,Meta可能要赔付超过10亿美元。不过Meta仍然选择付钱,毕竟相对于赔偿而言,法庭并没有阻止Meta继续开发模型,因此赔偿仍在可接受的范围内。

Meta的采集对象,也不只是用户。

2026年4月21日,Meta在美国员工的工作电脑上安装一款追踪软件,实时记录鼠标移动、点击位置和键盘输入,并定期截屏,用来训练它的AI模型。

这款工具叫“模型能力计划”(Model Capability Initiative)。Meta首席技术官安德鲁·博斯沃思(Andrew Bosworth)在内部备忘录中说,长期目标是把 AI 智能体培养成“承担工作”的角色,人类员工则转为“指挥、审查和协助改进”。

这个项目后来改名为“Agent转型加速器”。Meta的发言人称,这些数据只用于训练模型,不用于绩效考核,并设有保护敏感内容的措施。

但据媒体报道,采集范围覆盖员工日常使用的各类应用和网站,包括谷歌、GitHub、Slack,甚至个人Gmail;美国员工无法退出,只有受欧盟《通用数据保护条例》约束的欧洲员工被排除在外。

同一周,Meta裁掉约8000名员工,不少员工因此担心,自己正在亲手训练将来取代自己的AI。到2026年6月,Meta暂停了这项计划,原因是追踪工具抓取到了敏感信息,且这些信息一度被全公司访问。

Meta的手,也不只伸向自家平台。

Meta专门有个用来扒视频内容的爬虫,名为MSAE。Meta AI自己承认,训练数据里有370万条YouTube视频转录文本的第三方数据集。

2026年1月,包括h3h3 Productions、Mr. ShortGame Golf、Golfholics在内的几位YouTube博主,合计620万订阅,在加州中区联邦法院起诉Snap,指控它用后端自动化工具,把数百万条YouTube视频的视听文件成批下载下来,塞进HD-VILA-100M和Panda-70M数据集,用来训练“Imagine Lens”这类的图像编辑能力。

诉状没有走传统版权路线,而是主攻《数字千年版权法》第1201条的反规避:YouTube的设计是让人在线观看,不是让人拿到原始文件,Snap涉嫌在规模化层面,违反了该法律法规。

原告之一伊桑·克莱因(Ethan Klein)还顺手把英伟达、Meta、字节跳动、亚马逊、OpenAI、苹果一并告了。他的说法是,这些公司“一天能抓走80年的内容”。

搜索是谷歌的核心业务,因此谷歌也在名单上。

2026年7月,阿歇特出版集团、Cengage、爱思唯尔,连同畅销书作家斯科特·图罗,在纽约把谷歌告了,指控它用数百万本版权书籍训练Gemini。诉状称,谷歌从“已知的盗版来源”抓内容,甚至绕过学术网站的付费墙,去拿爱思唯尔旗下《柳叶刀》、《细胞》的文章。

诉状称:Gemini可以在20分钟内,用0.39美元,生成一部10万字的悬疑小说。谷歌内部文件也警告过,这么做可能“给谷歌带来100亿到1000亿美元的潜在罚款”。

语音和音乐,也没能幸免。

苹果的Siri,把“意外唤醒”时的录音交给外包合同工去听。据外媒报道,里面充斥着医生和病人的对话、商业谈判、疑似犯罪交易。有评估员一天要听多达1000条。苹果最终以9500万美元和解。

2024年6月,RIAA代表环球、索尼、华纳,把AI音乐公司Suno和Udio告了,指控它们用受版权保护的录音。

最后一批饲料

不过我们也不需要担心什么,因为我们即将成为AI的最后一批饲料。如今,AI公司,已经开始自己喂自己了。

2026年6月,Anthropic发了一篇博客,标题叫《当AI建造自己》。里面提到,截至2026年5月,合并进Anthropic生产代码库的代码,超过80%是Claude写的,不是人写的。在那之前,这个比例还只是个位数。

也就是说,15个月里,这家公司把绝大部分编程工作交了出去。有工程师已经五个月没写过一行代码;他们每天合并的代码量,是几年前的8倍。

2026年9月17日,Anthropic又发布了一份报告,标题是《衡量AI发展的速度》,这篇文章主要讲的是“研发工作有多少由AI主导”。它采用Epoch AI提出的自动化等级,从完全没有AI参与的AL0,到AI完全自主的AL5来划分。

其中AL4指AI能从一句大致的目标出发,端到端完成大部分工作,人类只负责监督和最后决策。

文章提到,2026年2月,Anthropic达到AL4这一级别的研发工作还不到1%。5月是12%,7月是22%,8月已经升到26%。

如果把标准放宽到“AI在人的密切指导下完成大块工作”的AL3,则有超过90%的研发工作达标。报告还提到Anthropic内部最主要的Agent平台上,任意时刻约有3万个AI Agent在从事研究和工程工作,仅在2026年8月就产生了超过10亿次决策。

OpenAI那边,走的是另一条路。

2026年7月,OpenAI披露,发布GPT-5.6时,它用最强的Sol模型,去自主“后训练”了一个更小的模型Luna。研究员只给了一句“相当不充分的提示”,Sol就自己找训练配置、挑GPU、启动训练脚本、验证运行,还顺带生成了合成训练数据。

这项工作,过去要两个资深研究员做两周。在OpenAI内部的“递归自我改进指数”上,Sol比上一代GPT-5.5高出16.2分。

Anthropic把这件事叫递归自我改进。它的本质,是训练数据的来源,正在从“人类生产的内容”,切换成“AI 自己生成的内容”。

而你,就是这次切换完成之前的,最后一茬人类饲料。

问题是,AI 自己生成的数据,撑得起下一波模型吗?

2024年,舒马伊洛夫(Shumailov)等人在《自然》上发了一篇论文,标题为《AI模型在递归生成数据上训练时会崩溃》。

他们发现,如果反复用合成数据训练模型,模型会“坍缩”,输出的多样性不断收窄,尾部信息被系统性抹掉,最后变成一种“语法正确、但语义空洞”的状态。

论文的结论是,你不能用合成数据完全替代人类数据,必须两者叠加。只要原始的人类信号还在,模型就还健康。

所以现在行业的配方,大概是10%到30%的真实人类数据打底,剩下的靠模型自己喂自己。

那10%到30%,就是我们还剩的用处。但很可惜,连这个用处也在倒计时。

一旦合成数据的质量足够稳定,一旦这个闭环转得够顺,人类数据就再也没有采集的必要。

本文来自微信公众号“字母AI”,作者:苗正,36氪经授权发布。

+1
1

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

做好你自己,结果找到你。

55分钟前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业