Source-linked AI summary

BALMS: Benchmarking Agentic LLMs for Longitudinal Mental Health Sensing

Yu Yvonne Wu, Arvind Pillai, Yuliang Chen, Yuwei Zhang, Sudarshan Regmi, Tess Z. Griffin, Michael V. Heinz, Lisa A. Marsch, Nicholas C. Jacobson, Andrew Campbell

arXiv:2608.27219v1cs.CL

TL;DR

可穿戴感知能够提供纵向心理健康信号,但现有 LLM agent 尚未针对基于证据的解释进行长期 wellbeing 预测的系统评估。BALMS 对这些能力进行了基准测试,发现可靠性能取决于 backbone 强度、选择性证据访问和语义明确的特征。

  • 问题

    现有 LLM 健康 agent 主要支持短期检索,长期 wellbeing 预测和基于证据的解释生成仍缺乏充分评估。

  • 方法

    BALMS 基于三个真实世界数据集、两个任务族,以及多种 agent 设计和 LLM backbone,对 agentic 纵向心理健康感知进行基准测试。

  • 结果

    Zero-shot agent 的预测性能并不稳定地具有竞争力;chain-of-thought 能够帮助面向推理的 backbone,而选择性、语义明确的证据访问能够提升性能。

  • 结论与局限

    纵向心理健康 agent 需要选择性记忆、数值 grounding 和 schema-aware reasoning,才能可靠地利用延展的感知历史。

  • 结论与局限

    该评估涵盖具有代表性的 single-agent 范式和回顾性数据集,而解释质量依赖 LLM-as-Judge,而非专家或人类受试者评估。

Abstract

from arXiv · show

Mental health assessment relies on episodic self-report scales, which convert subjective states such as stress into numerical scores but provide only sparse snapshots of wellbeing. Wearable devices offer longitudinal behavioral and physiological signals for continuous, low-burden monitoring. Recent LLM-driven personal-health agents enable natural language queries over wearable signals, but mainly handle short-term, retrieval-based lookups (e.g., highest step count over a week). They do not evaluate whether agents can reason over long-term signals to predict wellbeing scores paired with evidence-grounded rationales. To address this gap, we introduce BALMS, the first systematic benchmark of LLM-based agentic systems for longitudinal mental health sensing. BALMS spans 3 real-world longitudinal datasets, 2 task families (closed-form wellbeing-score prediction and rationale generation auto-graded by an LLM-as-Judge), 3 agentic paradigms evaluated across 5 open- and closed-source LLM backbones. We find that zero-shot agents rarely outperform a simple mean baseline, except with stronger backbones or compact, semantically meaningful features. Chain-of-thought prompting improves reasoning-oriented backbones, but does not guarantee temporal grounding or numerical correctness. Together with more analysis on efficiency and temporal scaling, BALMS highlights the need for longitudinal mental health agents that selectively retrieve history, ground temporal evidence, and reason over interpretable behavioral features.

1 引言

BALMS通过评测agentic LLM基于证据支撑的理由进行长期wellbeing预测,弥合稀疏自我报告评估与连续可穿戴感知之间的鸿沟。该基准跨数据集和backbone评估任务定义与agent设计,展示了更强模型、紧凑且有意义的特征、chain-of-thought和选择性记忆带来的收益。

  • 动机: 可穿戴设备可在数周至数年内连续收集多变量行为与生理信号,相比偶发性的自我报告,为了解日常wellbeing提供了更低负担的窗口。传统临床就诊和问卷只能提供稀疏快照,并增加患者与医疗服务提供者的负担(GBD 2019 Mental Disorders Collaborators, 2022; Substance Abuse and Mental Health Services Administration, 2025)。
  • 动机: 现有可穿戴感知agent主要执行短时间窗口的事实查询和算术运算,对长期历史与心理wellbeing的推断仍缺乏探索。例如,找出一周内的最高步数,或计算一个月内的平均静息心率(Choube et al., 2025; Heydari et al., 2025; Merrill et al., 2026; Wu et al., 2026)。
  • 贡献: BALMS将纵向心理健康感知形式化为:基于长期被动感知历史,预测可验证的wellbeing分数及有证据支撑的理由。该基准使用三个真实世界的智能手机与可穿戴设备数据集,并在五个开源与闭源LLM backbone上评估基于prompt、tool和memory的agent。
  • Agent设计的实证洞见: Zero-shot agentic预测仍然具有挑战性,但更强的backbone或紧凑且语义明确的传感器特征除外。这一发现促使研究者评估agent设计选择,而不是将可穿戴感知视为短时间窗口数值查询的直接扩展。
  • Agent设计的实证洞见: Chain-of-thought提示可显著提升经过推理调优的backbone上的性能,而选择性记忆和有意义的特征比原始流数据或更长的上下文窗口更有帮助。Agent增强通过检索、外部记忆和工具使用,缓解上下文、计算与可审计性瓶颈(Yao et al., 2022; Wang et al., 2023; Lewis et al., 2021)。

2 面向纵向心理健康感知的 LLM Agents 基准测试

BALMS 在三个真实世界数据集、两类任务和三种 agentic 范式上评测用于纵向心理健康感知的 LLM agents,考察其基于数月至数年被动感知数据预测 wellbeing 分数并生成证据支撑的推理。

  • 基准范围: BALMS 在三个纵向数据集和五个 LLM backbones 上评测三种 agentic 范式,并以 MAE 对 T1 评分、使用 LLM-as-a-Judge 评分标准对 T2 评分。该基准使用共享的纵向被动感知输入,支持封闭式预测和开放式推理任务。
  • 数据集: 该基准包含来自八个国家、持续 28 天的 DiversityOne 数据集中的 782 名学生,以及持续五个月、每天以 1–5 Likert scale 记录 stress 分数的 PMData 数据集中的 16 名参与者。DiversityOne 将 smartphone signals 与每日 mood reports 相结合,而 PMData 将 Fitbit signals 与每日 PMSys wellness reports 相结合。
  • 数据集: GLOBEM 覆盖 497 名大学生,包含连续四年的 10 周窗口,将 smartphone 和 Fitbit 感知与每周 PHQ-4 报告配对;BALMS 预测其中的 anxiety subscale。在所述各 cohort 中,该数据集提供了时间跨度最长的纵向设置。
  • 任务类型: BALMS 使用封闭式 wellbeing-score prediction(T1)和开放式 rationale generation(T2),超越了固定窗口事实查询,例如每周步数最大值或每月静息心率平均值。此前的 wearable agents 主要在固定窗口内进行数值感知(Merrill et al., 2026; Choube et al., 2025; Heydari et al., 2025)。
  • Agentic 范式: 三种范式以不同方式呈现历史信息:prompt-based methods 将数值数据序列化,tool-based agents 在记录上计算统计量,而 memory-based agents 从外部存储中检索相关条目。Prompt-based prediction 可通过设计好的 prompts 和 chain-of-thought reasoning 生成解释(Kim et al., 2024; Gruver et al., 2023);tool-based systems 使用可执行操作,而 memory systems 可将日内证据与每日抽象表示结合。

3 实验设置

评估涵盖五个 LLM backbone,并使用 MAE 衡量闭式预测,同时由 LLM 评判 rationale 的时间 grounding 与证据一致性。实验在四个 agentic system 中采用统一的目标日划分和输入窗口,比较使用与不使用 chain-of-thought 的结果。

  • Backbone: 评估涵盖五个 backbone:Qwen2.5-7B/14B-Instruct (Yang et al., 2025)、Mistral-7B-Instruct-v0.3 (Jiang et al., 2023)、DeepSeek-R1-Distill-Qwen-14B (DeepSeek-AI, 2025) 和 Claude-Haiku-4.5 其中包括三个开源 instruct model、一个开源 reasoning-distilled model,以及一个闭源 model。
  • 指标: 闭式预测采用 integer self-report 与 gold label 之间的 mean absolute error 进行评分,并在每个数据集原生 Likert scale 的留出目标日上取平均。
  • Rationale 评估: Llama-3.3-70B-Instruct judge 评估 rationale 是否具有时间意义、是否以 sensing evidence 为依据,以及是否与预测分数一致。judge 接收 sensing window、gold score、agent prediction 和 rationale,评估内容不止于流畅性。
  • Rationale 评估: 评分标准使用 invocation rate、conditional accuracy 和 coverage,评估六种 longitudinal reasoning operation——alignment、slicing、difference judgment、lag、structure 和 interaction。每种 operation 均标记为正确、错误或未调用,从而避免因不必要的遗漏而受到惩罚。
  • 实验协议: 所有 system 均使用完全一致的目标日划分和输入窗口;实验比较四个 agentic system 与五个 backbone,并报告使用和不使用 CoT 时的 MAE。开源 model 使用 vLLM 在本地运行,Claude-Haiku-4.5 使用 Anthropic API,ReAct 最多执行 10 次迭代。

4 结果与讨论

BALMS发现,除非使用更强的backbone或紧凑且有意义的特征,否则zero-shot agents很少超过均值baseline;性能还取决于范式、时间 grounding和schema兼容性。Chain-of-thought和更长的历史记录可选择性地带来帮助,但不能确保数值正确性或高效推理。

  • Rationale质量与时间grounding: Claude-Haiku-4.5是唯一弥合rationale质量和时间grounding差距的backbone,而开源instruct模型能够生成流畅但grounding较弱的rationale。Instruct agents很少调用alignment(C1)或structure(C5),表明其推理停留在表层,缺乏可靠的时间操作。
  • Backbone与范式比较: 使用Health-LLM的Claude-Haiku-4.5在DiversityOne上达到0.42 MAE,相较之下均值baseline为0.58;而PHIA在PMData上达到0.54 MAE,对比之下为0.48,表明性能取决于backbone和范式。更大规模、闭源或针对推理调优的backbone更常接近或超过均值预测器,而Mistral-7B等较小模型则通常无法做到。
  • 设计启示: 扩展对HealthLLM和RAG的益处比对PHIA更稳定;PHIA的成功取决于生成的代码能否在兼容的schema上运行,尤其是PMData中的Fitbit风格聚合数据。这些发现支持将高能力backbone与结构化或原始感知表示结合,而不是仅依赖zero-shot prompting。
  • 推理与grounding: Chain-of-thought在许多DeepSeek和Claude配置下最多可将MAE降低41.4%,但更大的backbone仍不能保证时间grounding或数值正确性。针对推理调优的模型似乎更擅长在评分前组织时间证据。
  • 时间扩展: 随着历史记录变长,RAG的表现有所提升:PMData的MAE降低约29%,GLOBEM的MAE降低约9%;相比之下,HealthLLM在文本化窗口变长时性能下降,而PHIA保持稳定但对schema敏感。增加记录可能会稀释目标日证据,并增加HealthLLM进行数值推理的难度。

5 相关工作

近期基准测试在医疗和移动环境中评估基于 LLM 的 agent,涵盖交互式电子健康记录任务,以及通过图形界面控制智能手机应用。

  • 医疗与移动 agent 基准测试: 医疗和移动环境中用于评估基于 LLM 的 agent 的基准测试日益增多。引用的示例包括 Schmidgall et al. (2025)Arora et al. (2025)Tian et al. (2026)
  • 医疗与移动 agent 基准测试: MedAgentBench 在基于 FHIR 的交互式电子健康记录环境中评估医疗 agent。该基准测试由 Jiang et al. (2025) 提出。
  • 医疗与移动 agent 基准测试: 移动 agent 基准测试评估 agent 是否能够通过图形界面控制智能手机应用。Deng et al. (2024) 研究了这一能力。

6 结论

BALMS 在多样化数据集、任务族和 agentic 范式上评测基于 LLM 的纵向心理健康感知系统。结果表明,zero-shot 预测具有竞争力,但可靠性能取决于对纵向证据的 grounding;chain-of-thought 能够帮助面向推理的 backbone。

  • BALMS 在三个被动感知数据集、两个任务族和三种 agentic 范式上评估基于 LLM 的 agentic 系统。
  • Zero-shot agent 无需针对任务的训练即可实现具有竞争力的 wellbeing 分数预测,但其可靠性取决于如何获取并 grounding 纵向证据。
  • Chain-of-thought prompting 有助于面向推理的 backbone 完成纵向心理健康感知。

局限性

BALMS评估了具有代表性的单智能体范式和回顾性预测,而非穷尽覆盖各种智能体设计或前瞻性部署。其可扩展的LLM-as-Judge理由评分标准不能替代专家或人类受试者评估,因此未来工作需关注真实世界安全性、校准和个性化。

  • BALMS涵盖基于prompt、工具和记忆的单智能体系统,但未涉及多智能体协作、规划器-执行器架构,以及动态组合的工具、记忆和反思机制。
  • 评估重点是基于现有数据集的回顾性预测,而非在真实世界心理健康支持场景中的前瞻性部署。
  • LLM-as-Judge评分标准可扩展地评估时间证据 grounding、数值正确性和解释质量,但不能替代临床或人类受试者评估。未来工作应纳入临床医生和用户评估,并研究安全性、校准和个性化。

伦理声明

BALMS旨在支持而非取代持续心理健康监测中的专业医疗服务。作者提醒,未经校准的自主画像可能造成严重伤害,包括虚假安心感或不必要的临床焦虑。

  • 潜在误用: BALMS系统旨在作为临床决策支持工具,而非专业医疗服务的自主替代者。
  • 潜在误用: 未经校准的自主心理健康画像可能导致严重后果,包括虚假安心感或不必要的临床焦虑。

A 数据处理细节 … F5. 原始流上的 schema-blind 聚合。

PHIA 的表面性能源于预测塌缩和执行失败,而非可靠的纵向推理。在各数据集上,静默执行错误、状态丢失、幻觉式 rationale、硬编码阈值和 schema-blind 聚合削弱了数值证据,在 DiversityOne 上尤为严重。

  • A 数据处理细节: 评估在按日聚合的多变量感知信号上进行:DiversityOne 使用 7-day 回溯窗口,PMData 和 GLOBEM 使用 14-day 窗口。处理后的评估集包含 1,355 个 DiversityOne、1,448 个 PMData 和 1,640 个 GLOBEM 目标日/用户样本。
  • B.1 预测塌缩为单一标签: PHIA 在各数据集上塌缩为单一标签:PMData 上的 MAE 为 0.57 vs. 均值预测器的 0.48,GLOBEM 上为 1.52 vs. 0.80,而 DiversityOne 上几乎没有可解析答案。PMData 的众数标签接近平均压力水平,而 GLOBEM 的众数标签则远离其低偏态焦虑分布。
  • B.2 失败分类: 静默代码执行不会产生输出,但 PHIA 仍继续运行,仿佛计算已经成功;在 GLOBEM 和 PMData 上,跟踪窗口中的空观测平均分别为 2.0 和 0.7。这些失败导致数值性陈述缺乏已执行结果的支持。
  • B.2 失败分类: 动作块之间的状态丢失会导致 avg_steps、filtered_df 和 anxiety_score 等变量在重新定义前就被引用,常常触发重试,并再次造成静默执行失败。该 agent 通常会返回更长的代码块,从而再次触发缺少输出的失败。
  • F3. 以幻觉式 rationale 强制结束。: 当步骤预算耗尽时,PHIA 会生成流畅但缺乏依据的 rationale;10 个被跟踪的 PMData 窗口中有 8 个包含从未计算过的差值、阈值或趋势。如果没有产生可解析答案,harness 会通过请求最终标签来强制结束。
  • F3. 以幻觉式 rationale 强制结束。: GLOBEM 上 steps > 20000 和 sleep_minutes > 1680 等硬编码阈值取代了基于分布的推理,并将用户导向相同的预计算分支。该阈值启发式被认定为模式塌缩的直接原因,因为用户通常都落在每个截点的同一侧。
  • F5. 原始流上的 schema-blind 聚合。: 在 DiversityOne 上,如果不进行每日重新索引,就对每天约 18 个半小时 slot 应用均值或求和,会混淆 slot 级聚合与日级聚合,并在原始移动端流上产生无法解释的值。同一模板适用于 PMData 预聚合的 Fitbit 日行,但在原始流上会失败。
  • B PHIA 失败分析: F1 和 F2 移除了可验证的数值证据,之后 PHIA 要么退回 F4 的先验驱动启发式,要么耗尽预算并触发 F3;F5 使 DiversityOne 最为糟糕,因为即使执行成功,也可能产生语义错误的聚合结果。这些失败模式会相互作用,而不是彼此独立地运行。

B.3 示例轨迹 · B.4 启示

示例轨迹暴露出执行契约失效问题,可能导致可解析但缺乏依据的预测,或硬编码的模式坍缩。这些失效现象跨越不同 backbone 反复出现,说明问题在于 sandbox 交互,而非语言推理能力,并由此促使我们采用基于记忆的 agent。

  • B.3 示例轨迹: 在 PMData 中,反复截断的代码尝试没有产生任何输出,但 agent 在强制完成后返回了一个可解析的预测。该轨迹使用 Qwen2.5-14B-Instruct,参与者为 p01,目标日期为 2019-11-25。
  • B.3 示例轨迹: PMData 的 rationale 引用了从未计算过的 delta,使该预测成为由先验驱动的猜测,并辅以后验解释。它之所以在总体 MAE 中被计为成功,仅仅是因为返回了一个可解析的整数(F1+F3)。
  • B.3 示例轨迹: 在 GLOBEM 中,执行状态丢失导致出现未定义变量错误,之后 agent 重建数据并预测为 3。该轨迹使用参与者 INS-W_208,目标日期为 2018-05-16;起初引用的变量仅在更早的代码块中定义。
  • B.3 示例轨迹: GLOBEM 的预测由 F4 的 magic-number threshold 决定,在留出集上产生了 86% 的模式坍缩。恢复出的聚合量仅用于在两个硬编码分支之间进行选择,而不是根据数据确定预测。
  • B.4 启示: 相同的失效模式出现在 Qwen2.5-14B、Mistral-7B 和 DeepSeek-R1-Distill-Qwen-14B 中。这与更强 backbone 无法改善 PHIA 的 MAE 这一观察一致。
  • B.4 启示: 主要瓶颈在于 model–sandbox contract——打印规范、状态持久化和阈值推导——而非语言推理能力。这些观察促使我们采用 Section 4.3 中评测的基于记忆的范式。

C 延迟分析

延迟分析报告了回看窗口增大时的平均每个样本延迟,并比较了各 agentic 系统、backbone 和数据集在有无 chain-of-thought 提示下的表现。

  • 延迟与回看窗口: Figure 7 报告了 Qwen2.5-14B-Instruct 在 PMData 和 GLOBEM 上随回看窗口增大而变化的平均每个样本延迟。
  • 按 backbone 划分的延迟面板: Figures 8–10 报告了 Qwen2.5-7B-Instruct、Mistral-7B-Instruct-v0.3 和 DeepSeek-R1-Distill-Qwen-14B 的平均每个样本延迟。
  • 按 backbone 划分的延迟面板: 按 backbone 划分的面板对比了三个数据集上无 chain-of-thought 与有 chain-of-thought 的提示设置,而 Qwen2.5-14B-Instruct 出现在论文主文 Figure 6 中。

D 提示模板

提示模板定义压力预测的输入、输出和推理格式,而 LLM-as-Judge 则使用结构化评分量表评估时间推理和理由质量。案例研究表明,该评分量表能够区分有证据支撑的推理与同样不准确的预测。

  • D 提示模板: PHIA 模板使用迭代式 ReAct trace,检查先前的传感器数据、计算相关特征,并持续执行,直到输出最终答案。示例首先检查数据形状和日期范围,循环最多持续 M 次迭代。
  • D 提示模板: LLM-as-Judge 使用条件准确率和调用率评估六个时间推理维度,并使用 Likert 平均分评估六个通用质量维度。时间维度使用正确、错误或未调用标签;通用质量维度使用 1–5 评分。
  • D 提示模板: Judge 的输入包括渲染后的 agent window、真实标签和预测标签、chain-of-thought 理由以及评分量表;同时要求理由必须引用理由文本或具体数值。Faithfulness 评估推理是否支持预测,而不是预测是否匹配真实标签;证据支撑性则检查所引用的特征、数值和日期。
  • D.1 推理案例研究:同一窗口、两个 backbone: 在 GLOBEM 案例研究中,Qwen2.5-7B-Instruct 和 Claude-Haiku-4.5 都高估了真实焦虑分数 0,但二者在不同评分维度上的理由缺陷并不相同。Qwen 预测为 3,Claude 预测为 2;二者相近的错误分别从证据支撑性和时间结构角度进行评估。
  • D.1 推理案例研究:同一窗口、两个 backbone: Claude 正确归因了其数值判断,而 Qwen 在四项中有两项归因错误;Claude 的保留式结论遵循其观察结果,而 Qwen 做出了缺乏依据的更高层次推断。因此,该评分量表能够识别仅凭总体 MAE 无法揭示的定性推理差异。
Loading 2608.27219v1…