CamoDocs: A Poisoning Attack Against Retrieval-Augmented Language Models Using Camouflaged Documents 精读
首尔国立大学与卡内基梅隆大学提出针对RAG的伪装式知识库投毒攻击CamoDocs。现有投毒攻击(PoisonedRAG、PIA、CorruptRAG)依赖查询包含——把目标查询写进投毒文档以提升检索命中——但这留下词法与嵌入空间伪影,简单的查询检测即可把ASR压到12%以下。CamoDocs反其道而行:合成良性+对抗双草稿、均匀切块,在良性块上做梯度引导的弥散token替换,把投毒文档嵌入推离质心以瓦解聚类防御的几何前提,再用轻量语言模型困惑度做连贯性过滤控制可读性损失。在7种防御×3开源模型×3数据集上,CamoDocs是唯一全面有效的攻击(HotpotQA+Llama平均ASR 60.81% vs PoisonedRAG 43.87%),闭源模型GPT-5.4-mini上仍达61.80%;同时暴露TrustRAG类重擦除防御在检索依赖基准NeoQA上删除91.48%检索文档、干净准确率从29.13%崩到5.79%的实用性代价。本精读拆解其攻防双方的机制因果链。