What is the Difference Between Me and You? Benchmarking the Quality Gap Between Human-Written and AI-Generated Code 精读
那不勒斯费德里科二世大学的 78.7 万函数对大规模研究:3 家 AI 助手(GPT 系/DeepSeek-Coder/Qwen2.5-Coder)按人写函数的 docstring 生成配对实现,静态分析映射到 ODC 缺陷分类+CWE 漏洞分类实现三语言(Python/Java/C)同框架人机对照。核心发现:AI 代码’结构压缩+风格模板化’(体量约人写一半、风格层独立聚类);缺陷类型分化而非数量分化;C 语言上 AI 高严重性内存安全缺陷反而更少。发布 CQBench(27,346 高问题任务)——Opus 4.8 在其上仍 2/3 有缺陷、1/3 有安全发现。