SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs 精读
当大语言模型需要同时掌握数学、代码、科学、逻辑多种推理能力时,SFT(监督微调)和 RL(强化学习)会表现出截然相反的行为:SFT 在多阶段训练中因梯度方向冲突而性能崩溃,RL 却因为「优势归一化 + on-policy 采样」产生的近似正交更新而稳定共存。本文通过参数级几何分析和高维浓度不等式,首次从理论上揭示了「SFT 干扰是范数受限的、RL 干扰是方差受限的」这一本质差异,并提出 Parallel-RL 范式——各任务独立 RL 后合并参数,在 DeepSeek-R1-Distill-Qwen-1.5B 上实现 ΔBase +10.7%、Retention 103.2%。本精读将从零讲清 SFT/RL/GRPO 的机制差异,建立「方法差异→参数更新几何→理论边界→指标提升」的完整因果链。