AI制造的文字垃圾正在淹没互联网?真正的问题是:我们到底如何评价信息?

📄 文章 🌐 公开
📋 列表 ✏️ 编辑 🎨 画布版 📋 复制MD 🌐 复制HTML ☆ 收藏

AI制造的文字垃圾正在淹没互联网?真正的问题是:我们到底如何评价信息?

最近看到一个问题:

“AI制造的文字垃圾正在淹没互联网,对此你如何看待?”

这个问题当然值得讨论。

AI确实让文字生产成本大幅下降。过去一个人一天写几篇文章已经很辛苦,现在一个人借助AI和Agent,可以批量生产几十篇、几百篇,甚至自动抓取热点、生成标题、组织内容、发布。

于是,一个过去就存在的问题被放大了:

低质量信息的生产成本,正在快速下降。

但是我觉得,如果我们把问题简单概括成“AI制造了大量文字垃圾”,其实还没有抓住最重要的地方。

因为真正的问题并不是:

这些文字是不是AI写的?

而是:

这些文字到底是不是真的?逻辑成立吗?有没有证据?能不能被验证?对读者有没有实际价值?

这两套问题,看起来差不多,实际上完全不同。


AI写的,不等于垃圾

假设有两篇文章。

第一篇是AI写的。

作者给AI提供了自己亲自旅行获得的大量资料,包括照片、价格、交通路线、踩坑经历,然后让AI帮助整理结构、润色语言。

第二篇完全是人类自己写的。

作者没有调查,没有核实,只凭印象和网上听来的东西写了一篇“看起来很有道理”的文章。

你觉得应该因为第一篇用了AI,所以第一篇质量更低吗?

显然不能。

甚至可能恰恰相反。

第一篇虽然使用了AI,但事实来源是真实的,信息可以验证,逻辑也清楚。

第二篇虽然100%由人类写作,却可能充满错误。

所以:

$$ \text{是否AI生成}\neq\text{内容质量} $$

AI只是一个生产工具。

就像Excel可以制作财务报表,照相机可以拍照片,搜索引擎可以寻找资料。

我们不会因为一张照片是相机拍的,就问:

“这是不是相机制造的照片垃圾?”

真正应该评价的是照片记录的东西是不是真实。

信息也是如此。


真正应该评价的是三件事情

如果一定要给互联网信息建立最基本的评价标准,我认为首先应该问三个问题:

是否符合逻辑?

是否符合现实?

是否真实可验证?

这三个问题,比“是不是AI写的”重要得多。


一、逻辑是否成立?

一篇文章可以写得非常流畅,甚至充满漂亮的比喻和专业术语,但推理可能完全不成立。

例如:

一个城市经济增长了。

文章于是说:

因为某项政策,所以经济增长。

问题是:

经济增长和这项政策同时出现,并不意味着政策导致了经济增长。

可能还有其他因素:

市场周期、人口变化、外部投资、国际环境、技术进步……

所以:

$$ A\text{发生在}B\text{之前} $$

并不等于:

$$ A\rightarrow B $$

这其实是比AI幻觉更加普遍的问题。

人类写文章的时候一样会犯。

甚至很多“专家文章”,最大的问题都不是事实错误,而是把相关性写成因果关系


二、是否符合现实?

这一点正是AI时代特别重要的地方。

比如文章说:

“某某球队昨天以2∶2战平。”

其实比赛结果是3∶2。

这就是非常典型的事实错误。

它不需要讨论什么“AI味”。

直接查一下比赛结果就知道。

历史文章也是一样。

如果有人说:

“某个19世纪的人有几百个孩子,因此某地大部分人口都是他的后代。”

首先应该问:

这个人真的存在吗?

他的名字是什么?

原始资料在哪里?

当时人口是多少?

“几百个孩子”的依据是什么?

“某地大部分人口都是他的后代”的依据又是什么?

如果这些东西都无法找到,那么文章写得再生动,也不能因为“故事特别精彩”就当成事实。


三、是否真实、可验证?

这是我认为AI时代最重要的一条。

因为AI最大的特点之一就是:

它可以非常流畅地表达一个并不存在的事实。

这其实比普通的错别字危险得多。

过去一个人写错了东西,至少需要自己花时间编。

现在AI可以在几秒钟内生成:

人物姓名、日期、地点、引用、故事背景、专家观点……

甚至可以给一个不存在的东西配上一套看起来非常完整的解释。

所以未来的信息评价机制不能只评价:

“文章写得像不像真的。”

而应该越来越重视:

“这个东西能不能被追溯?”

例如:

来源是什么?

原始资料在哪里?

数据从哪里来?

哪些是事实?

哪些是作者推断?

哪些只是猜测?

哪些存在争议?

这才是对抗AI幻觉真正有效的办法。


其实,人类早就生产了大量“文字垃圾”

这一点非常重要。

AI出现以前,互联网就已经存在:

标题党、洗稿、营销软文、谣言、伪科普、假专家、编造历史、断章取义、流量文章……

区别只是:

以前生产垃圾的成本比较高。

一个人一天可能只能写十篇。

AI出现以后:

$$ \text{生产成本}\downarrow $$

于是:

$$ \text{垃圾生产能力}\uparrow $$

所以AI并没有凭空创造“信息垃圾”。

它更像是一个巨大的放大器

如果原来的互联网已经奖励垃圾,那么AI会让垃圾更多。

如果原来的互联网奖励高质量内容,那么AI同样可以帮助生产更多高质量内容。


所以真正的问题其实是“评价机制”

这才是我认为这个问题最值得深入的地方。

假设一个平台主要按照下面的东西奖励作者:

$$ R=a点击+b停留+c转发+d更新数量 $$

而:

$$ 错误成本\approx0 $$

那么作者自然会发现:

标题越刺激越好。

更新越快越好。

文章越多越好。

有没有核查反而不重要。

甚至可能出现一个非常荒谬的结果:

一个人认真调查三天,写了一篇文章;

另一个人让AI一天生成五十篇。

如果平台最后给后者更多流量和收入,那么系统究竟在奖励什么?

显然不是知识。

而是:

注意力。


AI只是把这个激励机制推到了极致

过去:

$$ 低质量内容 \rightarrow 人工生产 \rightarrow 成本较高 $$

现在:

$$ 低质量内容 \rightarrow AI生产 \rightarrow 成本极低 $$

未来甚至可能变成:

$$ 热点发现 \rightarrow 自动搜索 \rightarrow 自动生成 \rightarrow 自动发布 \rightarrow 自动分析流量 \rightarrow 自动改标题 \rightarrow 再次生产 $$

这时候已经不是“某个人偷懒使用AI”。

而是一套完整的信息工业系统

因此真正值得担心的不是“AI会不会写文章”。

而是:

当信息生产成本无限下降以后,我们有没有建立足够强的信息评价机制?


“AI味检测”其实不是最好的解决方案

很多人希望平台给文章加一个:

“疑似AI生成”

我觉得这只能解决很小的一部分问题。

因为:

AI味≠垃圾。

人味≠高质量。

一个人完全可以写出垃圾。

一个人也可以故意造假。

AI也完全可以帮助人类整理真实资料。

所以:

$$ \text{AI检测} \neq \text{事实检测} $$

真正有意义的系统应该越来越接近:

事实核验系统。

比如一篇文章发布以后,系统能够告诉读者:

事实主张:12项

已找到可靠来源:9项

无法确认:2项

存在争议:1项

作者推论:若干

原始数据:可追溯

这比告诉我:

“这篇文章可能是AI写的。”

有意义得多。


甚至应该把“事实”和“观点”分开

这是未来互联网非常重要的一件事。

比如:

“我觉得这个城市特别适合旅游。”

这是个人评价。

不需要证明全世界都这么认为。

但如果他说:

“这个城市是全国游客数量最多的旅游城市。”

这就是事实性主张。

需要数据。

再比如:

“我认为这个政策有效。”

这是观点。

而:

“实施政策之后失业率从8%下降到5%。”

这是事实主张。

两者不能混在一起。

一个成熟的信息系统,应该让读者越来越容易看到:

什么是事实。

什么是观点。

什么是推测。

什么是证据。

什么是尚未确定的事情。


这其实是一个“评价尺子”的问题

我们经常喜欢评价:

谁写的?

是不是专家?

是不是AI?

有没有认证?

但这些其实都只是间接指标。

真正应该问的是:

现实尺

它和现实是否一致?

逻辑尺

它的推理是否成立?

证据尺

它有没有可靠的证据?

验证尺

别人能不能复核?

贡献尺

它到底增加了什么新的信息?

如果一篇文章通过了这些检验,那么它是不是AI写的,其实没有那么重要。


更有意思的是:AI可能反而帮助我们建立更好的信息评价机制

AI不仅可以生产内容。

也可以检查内容。

例如:

一篇文章出来以后,可以让另一个AI去做:

查找所有事实性陈述。

然后:

给每一个事实寻找原始来源。

再:

检查时间、人物、数字是否一致。

再:

寻找反例。

再:

检查作者有没有把相关关系写成因果关系。

最后:

把无法确认的地方标出来。

于是就出现了一种新的信息生产模式:

AI生成 → AI核查 → 人类复核 → 读者反馈 → 持续修正

这里AI既可能是污染源,也可能成为过滤器。

关键仍然是:

我们怎么设计评价机制。


所以我不太赞成把问题叫做“AI文字垃圾”

我更愿意把它叫做:

“低质量信息正在工业化。”

这两句话看起来很接近,但方向完全不同。

前者容易让我们得出:

禁止AI写作。

后者会迫使我们继续追问:

为什么低质量内容能够获得流量?

为什么错误几乎没有成本?

为什么真实信息的生产者得不到足够回报?

为什么读者很难验证来源?

为什么平台更容易评价点击,而不是评价事实?

这些问题才真正触及互联网的信息结构。


最后,我认为AI时代最重要的不是“谁写的”

过去我们习惯问:

这是谁写的?

因为作者身份可以作为质量的代理变量。

但AI时代,这个办法越来越不够用了。

因为以后可能出现:

人写AI辅助。

AI写人审核。

AI写AI审。

人写人审。

甚至根本不知道是谁写的。

那么我们最终还是要回到内容本身。

一篇文章最基本的评价,不应该是:

“这是人写的,所以可信。”

也不应该是:

“这是AI写的,所以垃圾。”

而应该是:

它说的是真的吗?

它的逻辑成立吗?

它和现实一致吗?

它的证据在哪里?

我能不能验证?

它到底给我增加了什么认识?

如果这些问题都能回答,那么作者是人、是AI,还是人和AI共同完成的,其实只是生产方式。

反过来,如果这些问题都回答不了,那么即使文章署名一个著名专家,即使写得文采飞扬,即使没有任何AI参与,它依然可能是一篇低质量信息。

所以,AI真正带给互联网的挑战,也许不是:

“AI会制造多少垃圾?”

而是:

“当制造信息变得几乎免费以后,人类有没有能力建立一种真正评价信息价值的机制?”

这可能才是AI时代比“AI味”更加重要的问题。

因为真正应该被评价的,从来不是信息是谁生产的,而是信息本身是否真实、合理、可验证、有价值。

💬 留言 ⋮⋮

加载中…
💡 不登录也可留言(IP 限制:每文/每天各 1/10 条)

加载中…

纸张白
护眼绿
羊皮卷
夜间黑
100%