在算法与真实之间:小红书的AI治理难题
今天的AI生成内容,在“准确度”和“活人感”两个维度上,往往是双重失格的。
01 一张AI生成的“完美”民宿照片
去年深秋,杭州姑娘林薇计划去大理过周末。她打开小红书,输入“大理民宿推荐”,满屏的苍山洱海、白族院落、落地窗前的日出——每一张照片都美得像电影剧照。她最终选定了一家评分4.9的“小众设计师民宿”,笔记里写道:“推开窗就是洱海,清晨被海鸥叫醒,房东亲手做的鲜花饼甜到心里。”
她坐了三个小时的飞机,又转了一个小时的盘山公路。到了才发现,那家民宿藏在一条尘土飞扬的小巷深处,所谓的“落地窗”对着一堵斑驳的水泥墙,而笔记里那片蔚蓝的洱海,不过是房东在屋顶搭了一块蓝色背景布。林薇后来才知道,那篇让她心动的笔记,配图是AI生成的。
这不是孤例。2026年9月3日,小红书通过官方账号“薯管家”发布了一份公告:今年6月至8月,平台清理处置AI制作发布的虚假笔记近12万条。其中,AI伪造医美体验、AI伪造民宿图文体验、AI虚构家庭背景及教育经验并销售教辅材料,被列为三类典型违规内容。
12万条。假设平均浏览量是100,那背后就是1200万个可能被误导的用户,也是一座内容社区正在面临的系统性危机。
02 AI种的“假草”为什么会泛滥?
小红书的核心价值是什么?是真实。一个用户分享自己用过的洗面奶,一个旅行者记录真实的徒步路线,一个新手妈妈写下育儿心得——这些基于真实体验的UGC,构成了小红书最坚固的护城河。用户来这里,不是为了看广告,而是为了看“活人”的生活。
但AI正在改变这一切。
过去,造假是有成本的。你要去实地拍照片,要构思文案,要P图,要维护账号人设。一篇虚假探店笔记,背后至少需要一个真人、一部手机、几个小时的投入。而现在,有了Midjourney、Stable Diffusion、GPT-4o这些工具,一个人一天可以生成上百篇“亲历笔记”。输入“大理洱海民宿清晨日出落地窗”,AI就能吐出一组以假乱真的照片,再让大模型写一段“真情实感”的体验文案,配上“姐妹们冲”的口吻,一条虚假笔记就诞生了。
更可怕的是,这些AI生成的内容正在形成产业链。公告中提到的三类典型违规,恰恰对应了三个最容易变现的赛道:
医美。一张AI生成的“术前术后对比图”,配上“做了这个项目,男朋友说我像换了个人”的文案,就能诱导用户私信咨询,最终导流至无资质的地下诊所。6月至8月,小红书医美领域日均下架各类违规笔记超4000条,封禁违规账号4200余个。
民宿文旅。AI拼接的图片伪造实景,虚构“小众秘境”“本地人才知道”的标签,把用户骗到名不副实的商家那里。这些笔记往往还会附带团购链接,形成从内容到交易的完整闭环。
教育。AI虚构“985学霸妈妈”“海淀家长”的人设,编造子女的学习经历和成绩,最终目的是卖教辅材料、卖课程、卖“内部资料”。你看到的不是一个真实家长的焦虑,而是一个AI精心编排的销售漏斗。
当“种草”变成“种假”,社区的内容生态就开始腐烂。更隐蔽的风险在于,用户往往不知道自己被骗了——AI生成的内容越来越逼真,普通网民根本不具备识别能力。
03 以子之矛攻子之盾:用AI治理AI
面对这场危机,小红书的选择是:用AI来治理AI。
公告中提到的治理措施,几乎每一条都离不开技术手段:强化未标识AI内容的识别能力,对同一图片或视频跨地域、跨账号重复使用的情形加强检测,从笔记、评论、账号等多环节清理历史AI虚假内容。
这听起来像是一个完美的闭环——既然AI能生成虚假内容,那AI也能识别虚假内容。但事情真的这么简单吗?
技术上,AI检测AI生成内容,目前主要依赖几种路径:
第一,水印与元数据检测。一些AI生成工具会在图片或文本中嵌入隐形水印,平台可以通过检测这些水印来识别AI内容。但问题是,开源工具生成的内容往往没有水印,而且水印技术本身也在不断被破解。
第二,生成特征识别。AI生成的图片在像素分布、噪点模式、纹理细节上,与人类拍摄的照片存在细微差异。AI生成的文本也有其特定的统计特征——比如某些词汇的过度使用、句式的规律性等。平台可以训练专门的检测模型来识别这些特征,但道高一尺魔高一丈,随着生成模型的迭代,这些特征越来越不明显,今天的检测模型,可能明天就失效了。
第三,跨平台重复检测。小红书提到的“同一图片或视频跨地域、跨账号重复使用”,就是一个很聪明的思路。如果同一张“洱海日出”的照片,同时出现在北京、上海、广州三个不同账号的笔记里,且都声称是“我上周刚拍的”,那至少其中两个是假的。这种基于图谱分析的检测,不依赖内容本身的真伪,而是依赖逻辑的合理性。
第四,行为模式分析。AI批量生成内容的账号,往往有共同的行为特征:注册时间集中、发布频率异常、互动模式机械化、粉丝增长曲线不符合自然传播规律,通过分析这些行为特征,平台可以在内容层面之前就识别出可疑账号。
这些方法各有优劣,但共同的问题是 :它们都是“事后诸葛亮”式的防御。AI生成技术每进步一次,检测技术就要追赶一次。这是一场不对称的战争——攻击者只需要找到一个漏洞,防御者却需要堵住所有漏洞。
而且,AI检测还有一个根本性的悖论:如果检测模型过于激进,就会误杀大量正常内容。一个摄影爱好者用AI辅助修图,算不算AI生成内容?一个创作者用ChatGPT润色文案,要不要被标记?如果平台把“AI辅助”和“AI伪造”混为一谈,可能会扼杀创作者的积极性,甚至引发“AI污名化”的反弹。
04 治理的是“AI”还是“AI味”?
这就引出了一个更深层的命题:我们治理AI内容,到底是在治理什么?
是小红书公告里说的“真实与信任”?还是一种更本质的东西——人类的存在?
让我们做一个思想实验。假设有一天,AI生成的内容在事实准确性上完全超过了人类。AI写的医美科普,比真人医生更严谨;AI推荐的民宿,比真人博主更靠谱;AI整理的教育经验,比真人家长更实用。到那时候,我们还有必要排斥AI内容吗?
答案可能是否定的。但问题恰恰在于,今天的AI生成内容,在“准确度”和“活人感”两个维度上,往往是双重失格的。
先看“准确度”。AI没有肉身,它不能真的去住一家民宿、做一次医美、养一个孩子。它所有的“体验”都是基于训练数据的概率推断。当AI写一篇“大理民宿体验”时,它不是在回忆,而是在“幻觉”——用统计上最可能的词汇组合,构造一个从未发生过的场景。这就是为什么AI内容特别擅长“看起来真实”,却往往在细节上露出马脚:它可能会把洱海的位置写错,可能会让海鸥出现在错误的季节,可能会编造一个根本不存在的民宿名称。
再看“活人感”。即便AI内容在事实上完全正确,它依然缺少一种不可替代的东西:人的视角、人的情感、人的在场。我们看一篇游记,不只是想知道“这家民宿好不好”,我们还想感受作者在那个清晨推开窗时的心情,想知道她在旅途中遇到的意外和惊喜,想从她的故事里找到共鸣。这种“活人感”,是AI无法模拟的。
所以,治理的标准应该是双重的:既要追求事实层面的真实准确,也要守护内容层面的人类属性。
小红书在公告中的表述,某种程度上体现了这种双重标准。一方面,平台“鼓励创作者使用AI辅助创作”——这是承认AI作为工具的价值;另一方面,平台要求“不虚构未曾到访的地点、未实际使用的产品或未亲身经历的事件”——这是在捍卫“亲历性”这一人类内容的核心特质。
但执行这个标准,远比制定它困难。
05 一个正在模糊的未来
让我们回到林薇的故事。如果小红书的AI检测系统足够强大,在她看到那篇虚假民宿笔记之前,系统就已经将其拦截。她可能会错过一家“看起来很美”的民宿,但她也不必经历三小时盘山公路的颠簸,更不会体会到抵达后只看见一面水泥墙的失落。
这是技术治理的理想图景。但现实是,平台每天要处理数亿条内容,AI检测系统不可能做到100%的准确率。在“放过一条虚假内容”和“误杀一条真实内容”之间,平台必须做出权衡。而目前的行业惯例是,宁可错杀,不可放过——这也是为什么小红书能在三个月内清理12万条AI虚假笔记,但同时也有大量创作者抱怨自己的正常内容被误判。
从更长远的维度来看,这将是一场没有终点的战争。
当AI生成内容的能力越来越强,当AI检测AI的技术越来越成熟,两者之间的对抗会不断升级。最终,平台可能不得不依赖更复杂的系统——比如用多个AI模型互相验证,或者引入“人类审核员+AI”的混合模式。但这也意味着,内容平台的运营成本将大幅上升,而中小平台可能根本无力承担这样的技术投入。
一个可能的未来是:内容平台出现分层。头部平台有能力建设先进的AI治理系统,维持相对健康的内容生态;而中小平台则沦为AI虚假内容的重灾区,用户逐渐向头部平台集中。这会不会导致内容领域的“马太效应”进一步加剧?
另一个可能的未来是:用户对AI内容的接受度逐渐提高。就像今天我们已经习惯了广告、习惯了软植入一样,明天我们也许会习惯“这是AI写的,但只要信息有用就行”。到那时候,“是否由人类贡献”可能不再是一个核心问题,“是否对我有用”才是。但这同时也意味着,“活人感”作为一种内容价值,将彻底被工具理性取代。
本文来自微信公众号“竞合人工智能”,作者:竞合,36氪经授权发布。















