据 theaiinsider.tech 报道,AI 供应链领域正面临严峻的安全威胁,其中“数据投毒”(Data Poisoning)成为企业部署机器学习模型时最隐蔽且难以根除的风险之一。攻击者通过操纵训练数据,在模型部署后控制其行为,而目前大多数企业的标准模型评估流程无法发现此类针对特定输入的恶意修改。
开源模型库潜伏恶意载荷
据原文报道,开源模型库的安全漏洞直接转化为企业的供应链风险。2024 年 2 月,网络安全公司 JFrog 的安全研究团队对全球最大的开源 AI 模型库 Hugging Face 进行了全面扫描。在数以百万计的免费开源模型中,研究人员发现了约 100 个恶意模型潜伏其中。
这些恶意模型在开发者加载时,会立即执行任意代码,对企业的本地计算环境构成直接威胁。尽管 Hugging Face 平台本身已配备了基础的安全扫描机制,但绝大多数企业在从开源库引入模型时,缺乏额外的验证流程。他们直接下载模型,发现功能正常便直接投入使用,从而将风险引入企业内部。
数据投毒的三种隐蔽技术
数据投毒针对的是模型在训练阶段的学习过程。当模型在数百万文本样本中构建概念关联时,攻击者会在训练数据中嵌入精心设计的恶意样本,使这些有害行为成为模型内部参数的一部分,并在部署后长期存在。
目前,针对 AI 模型的数据投毒主要分为三种技术路径,每一种都在试图绕过企业的常规检测:
- 后门攻击(Backdoor Attacks):攻击者在训练数据中嵌入特定的触发器(如特定短语或 Token)。模型在常规输入下表现正常,但一旦检测到触发器,便会执行恶意行为,如绕过安全过滤或生成有害内容。
- 标签翻转(Label Flipping):攻击者直接篡改训练数据的标签。例如,在欺诈检测模型中,将欺诈交易标记为合法交易。这种模型在常规测试中依然显示高准确率,但如果企业的实际业务数据包含被篡改的特征,模型将直接放行欺诈行为。
- 清洁标签攻击(Clean-Label Attacks):这是最难检测的一种。攻击者的目标是控制模型的行为,但保持数据标签正确。在人工审查时,这些恶意数据看起来完全正常,但会在模型内部潜移默化地改变其决策方向。
极低门槛即可植入恶意后门
针对开源模型库的恶意载荷只是表象,更深层的风险在于模型训练阶段的数据采集。大型 AI 模型无法依靠人工筛选数据,而是从互联网、代码库和论坛中自动抓取海量数据。这为攻击者提供了无需突破企业防火墙即可实施投毒的机会。
IBM X-Force 的高级分析师 Patrick Fussell 曾对媒体指出,只要模型抓取周期(例如每两周抓取一次维基百科)存在时间窗口,攻击者便可在该窗口期内投放恶意数据,确保其被模型摄入。
原文数据显示,实施这种投毒所需的恶意数据量远低于企业的预期。来自 Anthropic、英国 AI 安全研究所(UK AI Security Institute)以及艾伦·图灵研究所(Alan Turing Institute)的联合研究证实,在特定的实验条件下,只需注入 250 个精心构造的恶意文档,即可在模型中植入后门。这些后门会在特定的触发词下激活,同时保持模型在常规任务中的性能不受影响。
标准基准测试无法拦截针对性攻击
企业的标准模型评估通常侧重于准确性、连贯性和基准数据集上的任务表现。然而,针对特定输入的恶意模型(如后门模型)在这些常规基准测试中得分依然正常,从而完美避开了企业的合规检测。
2023 年,Mithril Security 在其“PoisonGPT”项目中展示了这一风险。研究团队修改了一个开源的 GPT-J-6B 模型,使其在回答特定历史问题时输出虚假事实,而在其他所有常规对话中,模型依然表现得专业且准确。这种针对特定输入的恶意行为,使得企业的常规全面评估无法发现模型已被篡改。
RAG 系统与微调引入的新防线
企业的 AI 供应链风险还延伸至微调(Fine-tuning)和检索增强生成(RAG)阶段。企业在引入开源模型后,通常会使用内部数据(如客户对话、支持日志)对模型进行微调,以适配特定业务领域。
这一过程存在双重暴露风险:一是基础模型若已携带后门,微调无法清除这些隐藏行为;二是企业的内部微调数据集若缺乏访问控制,同样会成为攻击者的投毒目标。此外,RAG 系统通过检索外部文档来增强模型回答,这也引入了推理阶段的风险,外部知识库若被污染,将直接导致模型输出错误信息。
针对上述风险,原文建议企业采取多项控制措施,包括验证模型来源、全面保护训练数据集、针对特定触发行为进行专项测试,以及建立类似“AI 物料清单”(AI Bills of Materials)的记录体系,以全面追踪模型供应链的每一个环节。
本文编译自海外媒体报道,由 SCI.AI 编辑团队整理发布。