Featured image of post 当大模型开始「记住」谎言:拆解 AI 信息投毒的完整管线

当大模型开始「记住」谎言:拆解 AI 信息投毒的完整管线

8 月 15 日「AI 投毒」话题冲上微博百度双热榜。这篇不站队的文章拆解它的技术机制:高权威污染源如何运作、为什么大模型比搜索引擎更脆弱、以及个人和平台能做什么防御。

8 月 15 日,央视新媒体「玉渊谭天」的一则调查把「AI 投毒」话题顶上了微博和百度热搜双榜。热搜词条本身情绪很足,但点进报道细看,真正值得聊的是它背后的技术问题:虚假内容是怎么一步步变成大模型的「知识」的。这篇就把这条链路拆开看。材料主要来自玉渊谭天调查的公开报道、新浪财经此前的相关报道,以及今年央视 3·15 晚会曝光的 GEO(Generative Engine Optimization,生成式引擎优化)黑产案例。另外先说明:文中的金额、页数都引自媒体转述,未经独立核实;这篇只谈技术机制,不做政治评判。

先把事实钉住

据中华网转载的玉渊谭天调查,日本数字厅建设了一个名为「源内」的政府 AI 系统,为此收集了约 1800 万页政府数据,包括内阁决定、国会会议记录、白皮书,以及 1947 年至今近 80 年的官报数据。日本国会在 2025 财年补充预算中为该系统拨款约 44 亿日元,2025 年在数字厅内部试点,2026 年计划向约 18 万名政府职员开放。系统的底座接入了 Anthropic 的 Claude 系列模型。报道还提到,一名日本大臣承认其国会答辩稿由该系统生成。

调查方在报道中提出的核心担忧,用技术语言转述就是:这类系统生成的政府报告、白皮书、政策文件,可能构成「高权威污染源」。它们出现在公开渠道后,会被其他大模型的爬虫当作高可信度语料收录。这里面的门道在于,攻击者从头到尾不需要骗过任何模型,只需要生产「模型天然信任的格式」。

这也不是孤例。上个月新浪财经曾报道另一条路线:有组织通过众包平台付费招募人员,批量生成篡改历史的虚假内容并投放到互联网。两条路线的打法几乎是两个极端,一条花政府预算、走精品路线,一条靠众包水军、以量取胜,但它们赌的是同一件事:AI 会把这些内容背下来。

为什么大模型比搜索引擎更脆弱

内容农场和 SEO(Search Engine Optimization,搜索引擎优化)作弊十多年前就有,为什么到了大模型时代,同样的把戏威胁大了一截?

最直观的差异在可见性。搜索引擎返回一页十个链接,用户天然会横向比对,来源信息始终摆在明面上;AI 给出的是一个整合后的单一答案,来源经常被折叠在角落甚至完全省略。同样的污染内容,在搜索时代占一个排名位置,在 AI 时代占的是「最终答案」本身。

更麻烦的是可逆性。搜索排名是事后的、可调的,发现内容农场,算法降权就行。预训练数据一旦被污染,它就固化进了模型权重,没有「撤销」操作。要清除一条错误关联,得先定位它在海量语料里的位置,再做重训或持续对齐,成本和不确定性都高得多。

还有一点常被忽略:污染会自我复制。一个被污染的答案被用户复制、引用、发布到别的网站,又会成为下一轮训练的语料。搜索时代可没有这种放大器。

RAG(Retrieval-Augmented Generation,检索增强生成)让模型能引用较新的外部资料,看似缓解了固化问题。但 RAG 的检索层同样要决定「信谁」,而一个高权威域名下的虚假内容,在检索排序里往往排得更靠前。这也正是「源内」这类系统真正麻烦的地方:它攻击的不是模型,是语料的信任评级体系。

拆开这条投毒管线

把两次报道放在一起看,这条管线大致分三层,各干各的活。

最上游是内容生产。低配玩法是众包水军加生成式 AI,单条成本压到极低,靠数量换命中;「源内」这类系统则是高配版,产出物自带政府文档的格式与权威感。对下游的爬虫和检索器来说,后者几乎是免检商品。

生产出来的内容还需要一个「被看见」的投放面,公开网页、百科条目、问答社区、可供下载的白皮书都算。这一层的 KPI 只有一个,挤进主流爬虫的抓取范围。

然后就是收割。预训练爬虫抓取、RAG 索引收录、用户查询时被检索命中,虚假叙事至此从「一条网页」升级成了「模型的知识」。更糟的是用户还会把答案复制出去再发布,内容回流互联网,管线闭合成环。

把这条管线对照今年 3·15 晚会曝光的 GEO 黑产,会看得更清楚。那次的动机是商业的:品牌方付费,让推广内容在 AI 的答案里「成为标准答案」,手法包括批量铺设带关键词的页面、污染问答对。动机不同,机制完全一样:都在对模型将要读到的世界做手脚,而不必碰模型本身。

AI 信息投毒三层管线:内容生产、投放面、模型收割与用户复制回流

防御能做什么

对个人来说,几个习惯比任何工具都管用。对 AI 给出的数字和事实要求来源,没有来源的当线索而非结论;重要决策做交叉验证,让不同模型或不同信源互相校对。还有一个反直觉的:对「恰好印证自己立场」的答案多一分警惕,因为在投毒攻击的投放策略里,迎合目标受众的既有偏见是性价比最高的路径。

平台层面,行业正在推进 C2PA(Coalition for Content Provenance and Authenticity,内容来源与真实性联盟)标准:给 AI 生成内容嵌入隐形水印和签名元数据。Anthropic 8 月起已经为合规给 Claude 的输出加了这类标记。水印防的是「AI 内容冒充真实」,对「政府文档被伪造」这类上游污染帮助有限,但它是信任链重建的必要组件。训练数据侧的来源分级、高权威域名的交叉核验,会是更根本的解法,目前进展慢得多。

Anthropic 标志(题图来自 TechCrunch 报道)

企业层面,如果团队在用 RAG 构建内部知识库,值得做一次「语料准入」审视:哪些源自动采信、哪些需要验证、发现的污染条目如何标记和回滚。这些机制在传统数据治理里有成熟方案,搬过来就行,缺的往往只是意识到需要。

串起来看

最后把几个容易混淆的概念理一遍。投毒(data poisoning)攻击的是信任链的上游:让虚假内容在模型「学习」和「检索」的阶段就被当成可信语料。水印和 C2PA 溯源防守的是下游:让人工智能生成的冒充内容在「出厂」时可被识别。GEO 则是同一套上游机制的商业化应用,它本身是中性技术,被黑产用来推销假货和被用来篡改叙事,用的是同一根杠杆。

信任链的上下游:上游防投毒(假的进去),下游靠水印溯源(假的出来)

换句话说,上游防的是「假的进去」,下游防的是「假的出来」,两头缺一不可。眼下下游的标准推进得快,上游几乎裸奔,这也是「高权威污染源」这个判断真正值得所有模型厂商和用户认真对待的原因。对普通读者,落成一句话就够:把 AI 的答案当成一条来源不明的高级搜索结果来核对,而不是当作终点。

参考来源

以上来源用于观察事件口径与机制素材,其中金额、页数等数字均引自单一媒体链条的转述,不等同于独立核实的事实。

RSS Feed 使用 Hugo 构建
主题 StackJimmy 设计