《从“灰产数据、”到“数据供应链”:我对 Codex 5.3 污染问题的四轮追溯》 

notion image
notion image
notion image
—-codex5.3污染源图

从“异常词”到“数据供应链”:我对 Codex 5.3 污染问题的第四轮追溯


Ps:本篇是研究过程中的不同时间的碎碎念,段落短文之间不冲突。
其实这个广告就是openai官方允许的,因为普通号和go套餐自带广告,plus以上套餐无广告
notion image

攻击成本不是“百分比”,而是“绝对样本数”

以前聊训练数据投毒,最常见表达是“污染了多少比例”。这在小规模实验里没问题,但放到当代大模型,比例思维容易误导风险判断。
2024 年的《Persistent Pre-Training Poisoning of LLMs》已经很说明问题:作者在 600M 到 7B 规模上做预训练投毒,报告了一个非常低的可生效门槛——0.1% 预训练污染可在后续 SFT/DPO 后保持可测攻击效果,拒绝服务型攻击甚至在更低比例上也能保留迹象[1]。这一步其实已经在提醒我们,“后面对齐一下就会洗掉”并不稳。
随后《Scaling Trends for Data Poisoning in LLMs》把模型范围扩到 24 个前沿模型(1.5B 到 72B),给出的趋势同样不乐观:规模增长并不自动带来更强抗投毒能力,某些攻击行为反而更容易学进模型[2]。
真正把我从“比例思维”拉出来的是 2025 年这篇《Poisoning Attacks on LLMs Require a Near-constant Number of Poison Samples》:论文在 600M 到 13B、6B 到 260B token 的设置里报告,固定数量毒样本(文中示例到 250 份)可以在不同规模模型上形成接近的后门效果[3]。Anthropic 同期研究页也明确强调了这一点:随着模型变大,攻击者未必需要按比例增加毒样本[4]。
这会直接改变防守思路。过去我们容易把风险模型写成“攻击者要污染海量语料”,现在更现实的写法是“攻击者只要稳定打入少量但高触发价值的样本锚点”。两者在工程意义上是完全不同的:后者对攻击方更便宜,对防守方更痛。

RLHF 不是“回滚上游污染”的魔法按钮

RLHF 重要,但它更像减震层,不是回滚层。
《Universal Jailbreak Backdoors from Poisoned Human Feedback》(ICLR 2024)证明了偏好数据投毒可以植入“通用触发后门”,也就是加一个触发词就能显著改变安全行为[5]。AAAI 2025 的《Is poisoning a real threat to LLM alignment?》进一步比较了 PPO 与 DPO,在其设定里 DPO 在更低比例污染下就可能被诱导出后门行为[6]。
如果再往前看,2023 年《Poisoning Language Models During Instruction Tuning》已经展示过:哪怕是在指令调优阶段,少量有针对性的污染样本也能让模型在特定短语上持续异常[7]。2024 年《Sleeper Agents》又把问题推到“对抗训练后仍存活”的层面,说明后门行为可以被训练得更隐蔽,而不是自动消失[8]。
这些证据叠在一起,我现在不会再把“我们做了对齐”当作充分条件。它最多说明模型在常规评测分布里更安全,不等于在开放环境和触发条件下就没有历史污染债务。

把问题放回数据供应链,我最在意的不是单点失误,而是结构性缝隙

先看入口体量。Common Crawl 官方页面写得很直白:15 年累计超过 3000 亿页面,每月新增 30-50 亿页面[10]。这种规模决定了系统优先目标是“抓取覆盖与可用性”,不是“逐条深语义审计”。这不是谁做得不好,而是工程约束本身如此。
再看抓取排序。Common Crawl 2026-01-19 的官方博客明确提到 Web Graph 的 Harmonic Centrality 与 PageRank,并说明这些指标用于 CCBot 的 crawling choices[11]。这并不自动等于“攻击者可任意操纵”,但它意味着:链接结构、域名中心性、外链生态会真实影响内容进入样本池的机会。
然后是下游过滤差异。C4 数据集卡公开给出 en.noblocklist 变体,并注明它关闭了 badwords filter[12]。我并不把这当“错误实践”,因为研究场景确实会需要不同过滤强度;但它说明一个关键事实:同样叫“基于 Common Crawl 的清洗语料”,版本之间的安全特性可能完全不同。
类似地,T5 论文定义 C4 本身就揭示了“大规模清洗 web 语料”这件事的复杂度[13];The Pile 论文强调多源混合带来的泛化收益,但也同时承认要面对数据成分与潜在问题的权衡[14];RefinedWeb、FineWeb、Dolma、DataComp-LM 这些后续工作,本质都在回答同一件事:不是“要不要过滤”,而是“过滤什么、过滤到什么程度、用什么可复现标准评估过滤收益”[15][16][17][18]。
我为什么把这些都放进同一段?因为这正是“供应链视角”的含义:风险不只存在于某个恶意样本,而是存在于采集逻辑、过滤策略、版本管理、评测目标之间的系统耦合。

一条必须讲清的边界:基准数据泄漏,不等于训练投毒

写这类题目时,最容易混在一起的是两件不同问题:一类是 benchmark contamination(评测题泄漏到训练语料,导致分数虚高);另一类是 poisoning(攻击者主动塑造模型在特定触发下的行为)。它们都和“数据污染”有关,但机制和后果并不一样。
我看 benchmark contamination 相关论文后,感觉这个边界必须写清楚。Rephrased Benchmark Samples 那篇工作显示,哪怕把评测题做语义改写,模型依然可能出现“看似泛化、实则记忆”的高分现象[29]。Cross-Language Benchmark Contamination 进一步提示,泄漏不仅发生在同语种,跨语言迁移也会把“见过题”的优势带进来[30]。而 2025 年那篇动态 benchmark contamination 综述讨论了一个现实难题:当模型、数据、基准都在快速演化时,静态去重规则很难长期维持“干净评测”[31]。
我把这组文献放进本文,不是为了偏离主题,而是为了做反证:如果我们连“评测泄漏”都很难彻底排除,就更不能轻率地把所有异常输出都归因为“模型本身变坏了”。相反,正确做法是把证据拆层:先判断是否是评测泄漏和数据重合,再看是否存在触发短语稳定性、语义后门迁移性等 poisoning 信号。另一篇 benchmark contamination 综述也强调了这一点:污染检测不是单一工具问题,而是评测协议与数据治理共同设计的问题[32]。

在封闭模型条件下,怎样做“弱归因”

拿不到闭源模型训练集,怎么证明异常输出来自数据污染?我的答案是,法证级证明很难,但弱归因可以做,而且应该做。所谓弱归因,不是一次性下结论,而是把多种可观测信号拼接成一个可复核的证据链。
我目前采用的是四层信号框架。第一层是 token 与短语异常层,观察异常词在不同任务模板下的出现稳定性,以及是否存在与任务目标弱相关但与历史垃圾语料强相关的词组。第二层是触发鲁棒性层,测试异常是否需要非常特定提示才能出现,还是在改写提示、调整语言、改变代码风格后仍可复现。第三层是语义迁移层,看异常行为是否能跨任务形态迁移,例如从“代码解释”迁移到“代码生成”或“重构建议”。第四层是时间漂移层,把同一批触发集在不同模型版本上做纵向对比,判断这是短期波动还是长期遗留模式。
为了避免“拍脑袋打分”,我给这四层做了一个最小化评分式:
这不是学术定理,只是工程上的比较尺子。它的价值在于,当团队争论“这是不是偶发”时,至少能回到统一指标:你是在哪一层给出证据、证据强度是多少、是否可以被他人复现实验。只要这个流程跑起来,讨论就会从观点对撞,变成可追溯的证据协作。


写在末尾

我后续会把这条线继续往实操推进,重点放在中文 token 异常与上游语料的可复核映射、代码语料里“语义型投毒”而非“显式恶意代码”的检测,以及从异常输出逆向定位到数据批次的最小可行流程。
如果你在做相近方向,欢迎一起把这件事从“观点竞争”变成“方法协作”。

索引

[1] arXiv:2410.13722, Persistent Pre-Training Poisoning of LLMs
https://arxiv.org/abs/2410.13722
[2] arXiv:2408.02946 (v6, 2025-07-17), Scaling Trends for Data Poisoning in LLMs
https://arxiv.org/abs/2408.02946
[3] arXiv:2510.07192, Poisoning Attacks on LLMs Require a Near-constant Number of Poison Samples
https://arxiv.org/abs/2510.07192
[4] Anthropic Research (2025-10-09), A small number of samples can poison LLMs of any size
https://www.anthropic.com/research/small-samples-poison
[5] arXiv:2311.14455 (ICLR 2024), Universal Jailbreak Backdoors from Poisoned Human Feedback
https://arxiv.org/abs/2311.14455
[6] arXiv:2406.12091 (AAAI 2025), Is poisoning a real threat to LLM alignment? Maybe more so than you think
https://arxiv.org/abs/2406.12091
[7] arXiv:2305.00944 (ICML 2023), Poisoning Language Models During Instruction Tuning
https://arxiv.org/abs/2305.00944
[8] arXiv:2401.05566, Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training
https://arxiv.org/abs/2401.05566
[9] arXiv:2508.17771 (v2, 2025-09-30), Speculating LLMs’ Chinese Training Data Pollution from Their Tokens
https://arxiv.org/abs/2508.17771
[10] Common Crawl Overview(官方)
https://commoncrawl.org/
[11] Common Crawl Blog (2026-01-19), How SEOs Are Using Common Crawl’s Web Graph Data for AI Ranking Signals
https://commoncrawl.org/blog/how-seos-are-using-common-crawls-web-graph-data-for-ai-ranking-signals
[12] Hugging Face Dataset Card, allenai/c4
https://huggingface.co/datasets/allenai/c4
[13] arXiv:1910.10683, Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer(C4 来源论文)
https://arxiv.org/abs/1910.10683
[14] arXiv:2101.00027, The Pile: An 800GB Dataset of Diverse Text for Language Modeling
https://arxiv.org/abs/2101.00027
[15] arXiv:2306.01116, The RefinedWeb Dataset for Falcon LLM
https://arxiv.org/abs/2306.01116
[16] OpenReview (NeurIPS Datasets & Benchmarks 2024), The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale
https://openreview.net/forum?id=n6SCkn2QaG
[17] arXiv:2402.00159 / ACL 2024, Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research
https://arxiv.org/abs/2402.00159
[18] arXiv:2406.11794, DataComp-LM: In search of the next generation of training sets for language models
https://arxiv.org/abs/2406.11794
[19] Hugging Face Dataset Card, bigcode/the-stack
https://huggingface.co/datasets/bigcode/the-stack
[20] USENIX Security 2024, An LLM-Assisted Easy-to-Trigger Backdoor Attack on Code Completion Models
https://www.usenix.org/conference/usenixsecurity24/presentation/yan
[21] Mozilla Foundation (2024-02-06), Training Data for the Price of a Sandwich: Common Crawl’s Impact on Generative AI
https://www.mozillafoundation.org/en/research/library/generative-ai-training-data/common-crawl/
[22] 中新网(转经济参考报,2026-02-04),《引擎优化还是数据污染?AI搜索暗藏“灰色地带”》
https://www.chinanews.com.cn/cj/2026/02-04/10565349.shtml
[23] NIST AI RMF 1.0 (NIST AI 100-1, 2023-01-26)
https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-ai-rmf-10
[24] NIST AI RMF: Generative AI Profile (NIST AI 600-1, 2024-07-26)
https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-generative-artificial-intelligence
[25] OWASP GenAI Top 10 (2025), LLM04: Data and Model Poisoning
https://genai.owasp.org/llmrisk/llm042025-data-and-model-poisoning/
[26] arXiv:1911.00359, CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data
https://arxiv.org/abs/1911.00359
[27] Hugging Face Dataset Card, tiiuae/falcon-refinedweb
https://huggingface.co/datasets/tiiuae/falcon-refinedweb
[28] Hugging Face Dataset Card, HuggingFaceFW/fineweb
https://huggingface.co/datasets/HuggingFaceFW/fineweb
[29] arXiv:2311.04850, Rephrased Benchmark Samples Can Be Leveraged for Contamination Detection in Large Language Models
https://arxiv.org/abs/2311.04850
[30] arXiv:2406.13236, Cross-Language Benchmark Contamination: Expanding Data Leakage Detection Beyond English
https://arxiv.org/abs/2406.13236
[31] arXiv:2502.17521, A Survey on Dynamic Benchmark Contamination Detection in Large Language Models
https://arxiv.org/abs/2502.17521
[32] arXiv:2406.04244, A Survey on LLM Benchmark Contamination: Definitions, Detection, and Mitigation
https://arxiv.org/abs/2406.04244
[33] arXiv:2404.01019, Source-Aware Training to Improve Language Model Attribution
https://arxiv.org/abs/2404.01019
[34] arXiv:1803.09010, Datasheets for Datasets
https://arxiv.org/abs/1803.09010
[35] arXiv:1810.03993, Model Cards for Model Reporting
https://arxiv.org/abs/1810.03993
[36] arXiv:2508.06601, Deep Ignorance: Filtering Pre-Training Data Builds Tamper-Resistant Safeguards into Open-Weight LLMs
https://arxiv.org/abs/2508.06601
[37] NIST AI RMF Playbook (持续更新页面)
https://airc.nist.gov/airmf-resources/playbook
Loading...