AI制造的文字垃圾正在淹没互联网?真正的问题是:我们到底如何评价信息?
最近看到一个问题:
“AI制造的文字垃圾正在淹没互联网,对此你如何看待?”
这个问题当然值得讨论。
AI确实让文字生产成本大幅下降。过去一个人一天写几篇文章已经很辛苦,现在一个人借助AI和Agent,可以批量生产几十篇、几百篇,甚至自动抓取热点、生成标题、组织内容、发布。
于是,一个过去就存在的问题被放大了:
低质量信息的生产成本,正在快速下降。
但是我觉得,如果我们把问题简单概括成“AI制造了大量文字垃圾”,其实还没有抓住最重要的地方。
因为真正的问题并不是:
这些文字是不是AI写的?
而是:
这些文字到底是不是真的?逻辑成立吗?有没有证据?能不能被验证?对读者有没有实际价值?
这两套问题,看起来差不多,实际上完全不同。
AI写的,不等于垃圾
假设有两篇文章。
第一篇是AI写的。
作者给AI提供了自己亲自旅行获得的大量资料,包括照片、价格、交通路线、踩坑经历,然后让AI帮助整理结构、润色语言。
第二篇完全是人类自己写的。
作者没有调查,没有核实,只凭印象和网上听来的东西写了一篇“看起来很有道理”的文章。
你觉得应该因为第一篇用了AI,所以第一篇质量更低吗?
显然不能。
甚至可能恰恰相反。
第一篇虽然使用了AI,但事实来源是真实的,信息可以验证,逻辑也清楚。
第二篇虽然100%由人类写作,却可能充满错误。
所以:
$$ \text{是否AI生成}\neq\text{内容质量} $$
AI只是一个生产工具。
就像Excel可以制作财务报表,照相机可以拍照片,搜索引擎可以寻找资料。
我们不会因为一张照片是相机拍的,就问:
“这是不是相机制造的照片垃圾?”
真正应该评价的是照片记录的东西是不是真实。
信息也是如此。
真正应该评价的是三件事情
如果一定要给互联网信息建立最基本的评价标准,我认为首先应该问三个问题:
是否符合逻辑?
是否符合现实?
是否真实可验证?
这三个问题,比“是不是AI写的”重要得多。
一、逻辑是否成立?
一篇文章可以写得非常流畅,甚至充满漂亮的比喻和专业术语,但推理可能完全不成立。
例如:
一个城市经济增长了。
文章于是说:
因为某项政策,所以经济增长。
问题是:
经济增长和这项政策同时出现,并不意味着政策导致了经济增长。
可能还有其他因素:
市场周期、人口变化、外部投资、国际环境、技术进步……
所以:
$$ A\text{发生在}B\text{之前} $$
并不等于:
$$ A\rightarrow B $$
这其实是比AI幻觉更加普遍的问题。
人类写文章的时候一样会犯。
甚至很多“专家文章”,最大的问题都不是事实错误,而是把相关性写成因果关系。
二、是否符合现实?
这一点正是AI时代特别重要的地方。
比如文章说:
“某某球队昨天以2∶2战平。”
其实比赛结果是3∶2。
这就是非常典型的事实错误。
它不需要讨论什么“AI味”。
直接查一下比赛结果就知道。
历史文章也是一样。
如果有人说:
“某个19世纪的人有几百个孩子,因此某地大部分人口都是他的后代。”
首先应该问:
这个人真的存在吗?
他的名字是什么?
原始资料在哪里?
当时人口是多少?
“几百个孩子”的依据是什么?
“某地大部分人口都是他的后代”的依据又是什么?
如果这些东西都无法找到,那么文章写得再生动,也不能因为“故事特别精彩”就当成事实。
三、是否真实、可验证?
这是我认为AI时代最重要的一条。
因为AI最大的特点之一就是:
它可以非常流畅地表达一个并不存在的事实。
这其实比普通的错别字危险得多。
过去一个人写错了东西,至少需要自己花时间编。
现在AI可以在几秒钟内生成:
人物姓名、日期、地点、引用、故事背景、专家观点……
甚至可以给一个不存在的东西配上一套看起来非常完整的解释。
所以未来的信息评价机制不能只评价:
“文章写得像不像真的。”
而应该越来越重视:
“这个东西能不能被追溯?”
例如:
来源是什么?
原始资料在哪里?
数据从哪里来?
哪些是事实?
哪些是作者推断?
哪些只是猜测?
哪些存在争议?
这才是对抗AI幻觉真正有效的办法。
其实,人类早就生产了大量“文字垃圾”
这一点非常重要。
AI出现以前,互联网就已经存在:
标题党、洗稿、营销软文、谣言、伪科普、假专家、编造历史、断章取义、流量文章……
区别只是:
以前生产垃圾的成本比较高。
一个人一天可能只能写十篇。
AI出现以后:
$$ \text{生产成本}\downarrow $$
于是:
$$ \text{垃圾生产能力}\uparrow $$
所以AI并没有凭空创造“信息垃圾”。
它更像是一个巨大的放大器。
如果原来的互联网已经奖励垃圾,那么AI会让垃圾更多。
如果原来的互联网奖励高质量内容,那么AI同样可以帮助生产更多高质量内容。
所以真正的问题其实是“评价机制”
这才是我认为这个问题最值得深入的地方。
假设一个平台主要按照下面的东西奖励作者:
$$ R=a点击+b停留+c转发+d更新数量 $$
而:
$$ 错误成本\approx0 $$
那么作者自然会发现:
标题越刺激越好。
更新越快越好。
文章越多越好。
有没有核查反而不重要。
甚至可能出现一个非常荒谬的结果:
一个人认真调查三天,写了一篇文章;
另一个人让AI一天生成五十篇。
如果平台最后给后者更多流量和收入,那么系统究竟在奖励什么?
显然不是知识。
而是:
注意力。
AI只是把这个激励机制推到了极致
过去:
$$ 低质量内容 \rightarrow 人工生产 \rightarrow 成本较高 $$
现在:
$$ 低质量内容 \rightarrow AI生产 \rightarrow 成本极低 $$
未来甚至可能变成:
$$ 热点发现 \rightarrow 自动搜索 \rightarrow 自动生成 \rightarrow 自动发布 \rightarrow 自动分析流量 \rightarrow 自动改标题 \rightarrow 再次生产 $$
这时候已经不是“某个人偷懒使用AI”。
而是一套完整的信息工业系统。
因此真正值得担心的不是“AI会不会写文章”。
而是:
当信息生产成本无限下降以后,我们有没有建立足够强的信息评价机制?
“AI味检测”其实不是最好的解决方案
很多人希望平台给文章加一个:
“疑似AI生成”
我觉得这只能解决很小的一部分问题。
因为:
AI味≠垃圾。
人味≠高质量。
一个人完全可以写出垃圾。
一个人也可以故意造假。
AI也完全可以帮助人类整理真实资料。
所以:
$$ \text{AI检测} \neq \text{事实检测} $$
真正有意义的系统应该越来越接近:
事实核验系统。
比如一篇文章发布以后,系统能够告诉读者:
事实主张:12项
已找到可靠来源:9项
无法确认:2项
存在争议:1项
作者推论:若干
原始数据:可追溯
这比告诉我:
“这篇文章可能是AI写的。”
有意义得多。
甚至应该把“事实”和“观点”分开
这是未来互联网非常重要的一件事。
比如:
“我觉得这个城市特别适合旅游。”
这是个人评价。
不需要证明全世界都这么认为。
但如果他说:
“这个城市是全国游客数量最多的旅游城市。”
这就是事实性主张。
需要数据。
再比如:
“我认为这个政策有效。”
这是观点。
而:
“实施政策之后失业率从8%下降到5%。”
这是事实主张。
两者不能混在一起。
一个成熟的信息系统,应该让读者越来越容易看到:
什么是事实。
什么是观点。
什么是推测。
什么是证据。
什么是尚未确定的事情。
这其实是一个“评价尺子”的问题
我们经常喜欢评价:
谁写的?
是不是专家?
是不是AI?
有没有认证?
但这些其实都只是间接指标。
真正应该问的是:
现实尺
它和现实是否一致?
逻辑尺
它的推理是否成立?
证据尺
它有没有可靠的证据?
验证尺
别人能不能复核?
贡献尺
它到底增加了什么新的信息?
如果一篇文章通过了这些检验,那么它是不是AI写的,其实没有那么重要。
更有意思的是:AI可能反而帮助我们建立更好的信息评价机制
AI不仅可以生产内容。
也可以检查内容。
例如:
一篇文章出来以后,可以让另一个AI去做:
查找所有事实性陈述。
然后:
给每一个事实寻找原始来源。
再:
检查时间、人物、数字是否一致。
再:
寻找反例。
再:
检查作者有没有把相关关系写成因果关系。
最后:
把无法确认的地方标出来。
于是就出现了一种新的信息生产模式:
AI生成 → AI核查 → 人类复核 → 读者反馈 → 持续修正
这里AI既可能是污染源,也可能成为过滤器。
关键仍然是:
我们怎么设计评价机制。
所以我不太赞成把问题叫做“AI文字垃圾”
我更愿意把它叫做:
“低质量信息正在工业化。”
这两句话看起来很接近,但方向完全不同。
前者容易让我们得出:
禁止AI写作。
后者会迫使我们继续追问:
为什么低质量内容能够获得流量?
为什么错误几乎没有成本?
为什么真实信息的生产者得不到足够回报?
为什么读者很难验证来源?
为什么平台更容易评价点击,而不是评价事实?
这些问题才真正触及互联网的信息结构。
最后,我认为AI时代最重要的不是“谁写的”
过去我们习惯问:
这是谁写的?
因为作者身份可以作为质量的代理变量。
但AI时代,这个办法越来越不够用了。
因为以后可能出现:
人写AI辅助。
AI写人审核。
AI写AI审。
人写人审。
甚至根本不知道是谁写的。
那么我们最终还是要回到内容本身。
一篇文章最基本的评价,不应该是:
“这是人写的,所以可信。”
也不应该是:
“这是AI写的,所以垃圾。”
而应该是:
它说的是真的吗?
它的逻辑成立吗?
它和现实一致吗?
它的证据在哪里?
我能不能验证?
它到底给我增加了什么认识?
如果这些问题都能回答,那么作者是人、是AI,还是人和AI共同完成的,其实只是生产方式。
反过来,如果这些问题都回答不了,那么即使文章署名一个著名专家,即使写得文采飞扬,即使没有任何AI参与,它依然可能是一篇低质量信息。
所以,AI真正带给互联网的挑战,也许不是:
“AI会制造多少垃圾?”
而是:
“当制造信息变得几乎免费以后,人类有没有能力建立一种真正评价信息价值的机制?”
这可能才是AI时代比“AI味”更加重要的问题。
因为真正应该被评价的,从来不是信息是谁生产的,而是信息本身是否真实、合理、可验证、有价值。