BALMS: Benchmarking Agentic LLMs for Longitudinal Mental Health Sensing 精读
可穿戴设备能连续收集数月的睡眠、心率、步数信号,LLM智能体能否据此预测心理健康分数并给出有据可依的理由?BALMS是第一个系统评估这一问题的基准:3种agentic范式(提示式Health-LLM、工具式PHIA ReAct、记忆式RAG/RAPTOR)×2个任务族(封闭式wellbeing分数回归+开放式rationale的LLM-as-Judge评分)×5个开源/闭源backbone×3个真实纵向数据集。核心发现泼了冷水:zero-shot agent很少超过简单的mean predictor基线;工具式agent在原始传感流上代码脆弱,GLOBEM上85.9%的预测坍缩为同一标签。五类失败模式(静默代码失败、状态丢失、幻觉收尾、魔法数字、schema盲聚合)的分析极为扎实,指向「数值时间序列grounding」是当前agent的核心短板。