REPLICANT: Learning Policies for Evading and Hardening Malware Detectors 精读
伦敦国王学院、Alan Turing研究所、UCL、鲁汶大学等多机构联合提出REPLICANT,把Android恶意软件的问题空间逃逸从『逐样本优化』重构为『策略学习』:在严格label-only黑盒威胁模型下,用分层PPO学习改什么(能力选择)与何时查(查询时机),产出的策略可跨样本、跨检测器架构、跨特征空间迁移——全部1764个代理/目标组合平均ASR 78.8%,比最强基线相对提升20.9%-39.2%;策略迁移(78.8%)远超样本迁移(43.3%,相对+82%)。反哺防御侧,AT-REPLICANT靠随机策略训练全程收集多样对抗样本,使白盒REPLICANT与APG残余ASR压到17%以下,而AT-APG对REPLICANT_WB仍暴露62.4%漏洞;针对时间漂移提出的RAL把主动学习与对抗训练交织,同时保住性能(49.0)与鲁棒性(0.6%)。总计379,680次攻击评估为该领域迄今最大规模。