Source-linked AI summary
Pedagogical AI in Mental Health: A Tri-Stream Fine-Tuned LLM Framework for Automated Clinical Supervision and Risk Triage
Shreeya Sharma, Ravish Gupta, Saket Kumar, Abhishek Aggarwal
TL;DR
心理健康督导仍存在延迟,而现有研究主要聚焦面向患者的 AI,而非督导支持。本文开发了一个采用微调 Mistral-7B 的三流 VAL 系统,用于生成结构化督导报告和自动风险分诊,实现了 95% 的技术识别准确率,并将分诊延迟从 72 小时缩短至 15 秒以内。
问题
心理健康 AI 研究在很大程度上忽视了督导层,而延迟审查和有限监督制约了对管理临床风险的受训人员的支持。
方法
微调后的 Mistral-7B 跨视觉、声学和语言流分析治疗会话,生成督导报告,并通过 D-CUI 对风险进行分流。
结果
在 106 个 DAIC-WOZ 会话上,实现了 95% 的技术识别准确率,分诊延迟低于 15 秒。
要点与局限
该系统支持自动筛查,标记需要立即关注的会话,并为督导者的临床判断提供结构化证据。
要点与局限
评估仅限于 22 个测试会话、两种技术和半结构化虚拟代理访谈,因此其性能尚不能推广到自然情境下的治疗。
Abstract
from arXiv · showhide
Modern mental healthcare faces a critical shortage of senior supervisory oversight, leading to a "supervision gap" where novice therapists manage high-stakes risks with delayed professional feedback. This paper proposes a new framework utilizing a fine-tuned Mistral-7B-instruct model as an automated "Supervisor-in-the-Loop" system. By leveraging 106 sessions from the DAIC-WOZ dataset, the model performs a tri-stream analysis: (1) Therapeutic Alliance tracking via semantic adherence, (2) Latent risk prediction using attention-weighted analytics, and (3) Supervisory Triage via a Dynamic Clinical Urgency Index (D-CUI). Our multi-modal VAL (Visual-Acoustic-Linguistic) framework achieves 95% technique identification accuracy [95% CI: 75.1%-99.9%], alliance assessment MAE of 0.105 on a 5-point scale [95% CI: 0.059-0.151], therapeutic fidelity alpha = 0.423, and mean D-CUI of 0.370 [95% CI: 0.322-0.419]. Training converged in 105 steps with 85.2% loss reduction on a single Tesla T4 GPU. The system reduces supervisory triage latency from 72 hours to real time (~10 seconds per session), enabling proactive intervention in high-risk cases. The system addresses the cold-start problem through Bayesian priors and implements timestamp-based modality synchronization for robust multi-modal fusion.
1 引言
临床督导常因每周一次的复盘机制而延迟,使紧急风险得不到解决,而督导与受训者的比例超过1:12 。本文关注长期被忽视的督导层,引入自动化 supervisor-in-the-loop,跨VAL通道分析治疗会谈并生成按风险排序的报告。
- 临床督导缺口: 督导缺口可能使自杀风险披露、创伤揭示和治疗关系破裂在72 hours内无人复核,而督导与受训者的比例通常超过1:12 。传统的回顾性案例复盘有助于专业发展,但并非为紧急临床需求而设计 。
- 研究缺口: 研究主要将LLM用于面向患者的工具,却在很大程度上忽视了督导领域;在这一领域,质量失误、受训者的风险处理和结构性能力压力彼此交汇 。相关例子包括心理教育聊天机器人、文档起草工具和基于CBT脚本的对话代理 。
- 提出的系统: 本文提出的系统将LLM视为自动化 supervisor-in-the-loop,通过Visual、Acoustic和Linguistic通道处理治疗会谈,并生成结构化、按风险排序的督导报告。本研究建立在团队早期关于临床AI决策可解释性 以及医疗AI系统身份与访问管理 的研究基础上。
- Tri-stream架构: Tri-stream VAL架构同时处理100Hz COVAREP音频、30fps OpenFace视频和转录文本,并通过将各模态对齐到话语边界来实现同步 。该设计解决了三种采样率之间的同步问题。
- 按风险排序的分流: D-CUI以风险概率、症状严重程度、倒置的治疗师经验和会谈级情感波动为输入,对督导进行分流。倒置治疗师经验后,经验不足会放大紧急程度。
2 相关工作
心理健康 AI 已从脚本化 CBT 聊天机器人发展到多模态检测和基于 LLM 的治疗回应,但既有系统仍聚焦于患者侧任务,而非临床督导。DAIC-WOZ 相关研究同样强调抑郁分类,因此有必要构建用于督导分析的时间对齐 VAL 框架。
- 相关工作: 既有系统涵盖脚本化 CBT、基于语音的抑郁检测、基于 transformer 的自杀风险筛查,以及 LLM 生成的治疗回应 [10]。Woebot 于 2017 年作为脚本化 CBT 聊天机器人上线,后续系统逐步扩展至深度学习、transformer 和类治疗师的 LLM 回应。
- 督导缺口: 现有文献主要针对患者侧筛查、对话、监测或记录,尚未覆盖负责临床质量的督导层。现有评估侧重用户满意度和症状减轻,而非督导复核与临床治理 。
- 数据集与既有基准研究: DAIC-WOZ 提供了来自 189 名参与者的半结构化多模态访谈,包含音频、视频、转录文本和 PHQ-8 标注。该语料库是心理健康 AI 的多模态基准,但既有研究主要集中于抑郁及其严重程度的分类 。
- 多模态融合: DAIC-WOZ 上的纯文本抑郁检测达到 F1 = 0.67,加入音频后提升至 0.77,视觉输入则带来进一步的增量收益 。这些收益受到 100Hz 音频、30fps 视频与话语级文本之间对齐难题的限制;融合错位可能引入显著噪声 。
- 方法学动机: 所提出的 VAL 框架采用基于时间戳的窗口化,在避免帧级跨模态注意力 GPU 内存开销的同时,保留具有临床意义的时间上下文。这一有意的权衡依据会话时间区分事件,例如第 23 分钟而非第 3 分钟出现的声学痛苦信号。
3 系统架构 · 3.1 概述 · 3.2 VAL 摄取引擎
系统采用 tri-stream VAL 架构提取视觉、声学和语言信号,融合会话表征,并通过 D-CUI 路由病例。其分阶段流程先对齐输入,再开展治疗忠实度分析、风险分诊和督导指导生成。
- 3.1 概述: Visual stream 以 30 fps 分析 OpenFace 面部 Action Units,用于检测情感、投入度和不一致的痛苦信号。安全关键的不一致包括口头否认痛苦,同时面部出现 AU1 和 AU4 等痛苦标记但不出现 AU12。
- 3.1 概述: Acoustic stream 以 100 Hz 处理 COVAREP 特征,包括 F0 variability 和 Voice Unvoiced mean,以捕捉表现力、流畅度、停顿、情感平淡和激越。这些副语言信号能够捕捉仅凭转录文本可能遗漏的状态。
- 3.1 概述: Linguistic stream 将 fine-tuned Mistral-7B-instruct 应用于转录文本,以识别治疗技术、治疗联盟标记、自杀意念和绝望语言。检测到的技术示例包括 Reflective Listening 和 Open-Ended Questioning。
- 3.1 概述: VAL 通过 Visual、Acoustic 和 Linguistic streams 处理治疗会话,在话语边界融合输出,并经由 D-CUI 将病例路由至升级处理或常规复核。该架构在路由督导结果前,先分析治疗忠实度、情感不一致和临床风险。
- 3.1 概述: D-CUI 将患者风险、症状严重度、治疗师经验和会话内情感波动性合并为一个紧急度评分,用于升级处理或常规复核。来自三个 stream 的会话级融合表征为该路由计算提供输入。
- 3.2 VAL 摄取引擎: 四阶段流程对齐并归一化各 stream,评估治疗忠实度,计算 D-CUI,并生成带路由信息的督导指导。这一顺序可避免错位噪声干扰忠实度分析,并确保分诊先于报告生成。
模态同步与时间对齐……视觉流
该框架将声学流和视觉流同步到由转录文本定义的话语窗口,随后使用 Mistral-7B 分析治疗技术、治疗联盟和风险。当言语安慰与面部痛苦相冲突时,视觉不一致检测会特别提高督导紧迫性。
- 模态同步与时间对齐: 由转录文本定义的话语边界将 100Hz COVAREP 音频和 30fps OpenFace 视频对齐,并通过有损聚合保留临床相关的时间结构。两种模态流均对齐到 DAIC-WOZ 的话语起止标记,而非在整个会话范围内求平均。
- 模态同步与时间对齐: 声学均值、Action Unit 均值和原始转录文本被拼接为会话向量,并序列化为自然语言供 Mistral-7B 使用。对于每个轮次 t_i,声学和视觉特征均在 [s_i:e_i] 上进行均值池化。
- 语言流: Mistral-7B 标注 Reflective Listening、Open-Ended Questioning、治疗联盟标记,以及包括自杀意念、自伤、绝望感和安全担忧在内的风险。治疗联盟标记包括协作性语言、共情、目标共识和关系破裂指标。
- 声学流: COVAREP 提供 F0 标准差和 Voice Unvoiced 均值,用于捕捉音高变异、言语连续性、停顿、犹豫和片段化。低 F0 方差与抑郁中的情感平淡相关,而较高的 Voice Unvoiced 值提示犹豫或片段化。
- 视觉流: OpenFace 使用具有临床相关性的 Action Units、注视方向和言语—面部不匹配,追踪痛苦、参与度和情感不一致指标。痛苦包括 AU1、AU4 和 AU15;参与度包括 AU12、AU26 和注视方向。
- 视觉流: 当 VADER sentiment exceeds 0.3、AU01 或 AU04 超过 0.5,且 AU12 保持低于 0.3 时,系统触发不一致。该规则针对这样的情形:患者言语否认痛苦,同时面部出现抬眉或压眉,却没有微笑信号。
- 视觉流: 当触发情感不一致时,Δϕ=0.4 通过 (1+Δϕ) 乘法放大 D-CUI,即使其他风险指标处于中等水平,也会触发督导复核。视觉流的安全关键作用在于识别面部痛苦与言语安慰相冲突的患者。
3.3 治疗忠实度分析器 · 3.4 风险分诊模块 · 动态临床紧急度指数(D-CUI)
治疗忠实度分析器量化对循证方法的遵循程度,而 D-CUI 综合风险、症状严重度、治疗师经验和情感波动性,为督导复核确定会谈优先级。通过 Bayesian 初始化和经验更新,分诊也适用于历史数据有限的治疗师。
- 3.3 治疗忠实度分析器: 治疗忠实度(α)定义为会谈嵌入(VT)与临床手册嵌入(VM)之间的余弦相似度。
- 3.3 治疗忠实度分析器: 忠实度得分高于 0.5 表示遵循程度较高,0.3 至 0.5 表示部分遵循,低于 0.3 则标记为偏离,需引起督导关注。
- 动态临床紧急度指数(D-CUI): D-CUI 通过综合四项临床与督导因素,确定哪些会谈需要立即督导关注,哪些可进行常规复核。
- 动态临床紧急度指数(D-CUI): D-CUI = (w1R + w2S + w3(1 − E)) · (1 + Δϕ),其中经经验调优的权重为 w1 = 0.40、w2 = 0.35 和 w3 = 0.25。
- 动态临床紧急度指数(D-CUI): 风险概率、基于 PHQ-8 得出的症状严重度、治疗师经验以及会谈内情感波动性构成 D-CUI 的输入。R、S 和 E 的取值范围为 0 至 1;Δϕ 表示情绪不稳定性,E 表示经归一化的执业年限。
- 3.4 风险分诊模块: (1 − E) 项会提高由新手治疗师接诊的高风险来访者的紧急度,从而识别出仅基于患者风险的模型所忽略的督导情境。
- 动态临床紧急度指数(D-CUI): 当无法获得治疗师经验时,系统将 E0 = 0.3 初始化为职业早期先验,并随着会谈数据累积,通过指数移动平均更新 E。该先验有意倾向于提供更广泛的督导覆盖。
应对冷启动问题 · 情绪波动(∆ϕ) · 3.5 监督指导生成器
该框架在获得治疗师经验后采用 β = 0.7 平滑处理以应对监督冷启动,通过连续情绪变化量化情绪波动,并将 D-CUI 分数映射为分级监督指导。紧急情况会触发基于逐字稿的警报和安全协议;高风险情况则进入优先审查。
- 应对冷启动问题: 冷启动平滑处理采用 β = 0.7;在治疗师经验可用后,Eobserved 表示其已记录的经验水平。在已有经验可供观测之前,该平滑因子支持结合经验的初始化。
- 应对冷启动问题: 当 Eobserved 可用后,冷启动机制利用已记录的治疗师经验更新监督结果。该条件区分了初始化阶段与后续基于经验的信息估计阶段。
- 情绪波动(∆ϕ): 情绪波动捕捉会话内的快速情绪转变,这些转变可能表明危机状态或治疗关系破裂。其计算方式为句子级情绪分数绝对变化率的均值。
- 情绪波动(∆ϕ): ∆ϕ 的计算强调连续的情绪转变,而非总体情绪离散程度。ϕ_i 表示第 i 个句子的情绪分数。
- 3.5 监督指导生成器: D-CUI 超过 0.7 时触发紧急警报,其中包含促成升级的逐字稿原句及对应的安全协议。该警报提供实际来源材料而非摘要,使监督者能够在采取行动前提出异议。
- 3.5 监督指导生成器: D-CUI 介于 0.4 和 0.7 之间时,归类为高风险,并标记为在当前监督周期内优先审查。该等级高于常规审查,但不按紧急情况处理。
4 实施
实施采用 Mistral-7B-instruct [18] 与 QLoRA [19],以支持在易获取的临床硬件上部署且可审计的督导。系统准备同步的多模态训练数据,并应用隐私、不确定性和高风险路由防护措施 。
- 模型选择: Mistral-7B-instruct [18] 通过 4-bit 量化、Apache 2.0 本地部署,以及适用于模板化督导报告的指令遵循输出,满足机构部署约束。模型约需 2 GB 存储空间和 5.6 GB 推理 GPU 内存,可部署于 Tesla T4,同时支持可审计性,并使转录内容保留在机构基础设施内。
- 数据准备: 该流程对录音进行说话人分离,提取声学和视觉特征,将各流对齐至话语边界,并把基于规则标注的合成督导样例转换为 Alpaca 指令微调格式。标签涵盖治疗技术、治疗联盟标记和临床问题;此外还使用 Claude Sonnet 4.6 Thinking 合成生成了额外的提示与回答。
- 训练策略: QLoRA [19] 微调采用 2e-4 学习率、批大小 4、秩 64、alpha 16 和五个 epoch,并在一块 Tesla T4 上于 105 steps 内完成。训练使用 paged AdamW 32-bit 优化器,耗时 2 hours 44 minutes。
- 隐私与治理: 系统移除可识别信息,对存储和传输实施端到端加密,按角色控制访问权限,记录每次访问事件,并在会话前披露 AI 参与情况 。这些控制措施应对治疗披露内容的敏感性,并将会话数据访问限制在督导临床医生范围内。
- 安全约束: 低置信度输出会触发不确定性暂缓处理,而自杀意念或虐待披露则绕过分诊并生成 immediate alerts。该路由设计避免在置信度较低时给出带有权威色彩的建议,并将紧急安全信号排除在自动队列处理之外。
5 实验评估
在22个留出的DAIC-WOZ会话上,模型展现出较强的治疗技术识别能力和较低的联盟评估误差,并将督导分诊从72小时队列缩短至近实时。D-CUI纳入情感不一致性,以提高临床重要病例的优先级,但在常规筛查会话中的这一调整幅度很小。
- 5 实验评估: 评估使用了106个DAIC-WOZ会话,其中84个为训练会话,22个为使用随机种子42选出的留出测试会话。评估测试了留出会话上的治疗技术识别能力,以及相较传统每周督导复核更快的紧急病例分流能力。
- 5 实验评估: 交叉熵损失降低85.2%,并在105步内实现收敛;端到端处理每个会话耗时少于15秒,而非进入72小时的督导队列。训练在Tesla T4上耗时2小时44分钟;分析耗时8–12秒,D-CUI计算耗时低于1毫秒。
- 5 实验评估: 当情感不一致性设为∆ϕ = 0.4时,一个低风险会话的D-CUI从0.283升至0.395,使其接近Elevated阈值。在不使用视觉流的情况下,该会话仍处于Routine区间;D-CUI原始分数被限制在[0, 1]内。
- 5 实验评估: 在DAIC-WOZ语料库中,∆ϕ范围为0.00至0.02,由于筛查动态稳定,D-CUI调整幅度小于2%。∆ϕ项旨在急性场景中激活,而非用于常规筛查。
6 讨论
该框架定位为一种自动筛查辅助工具,用于标记需要督导关注的会谈,而非替代临床督导。初步专家评分支持报告具有可理解性,但数据有限、范围狭窄、隐私风险和部署约束要求谨慎解读。
- 实践意义: 该系统旨在标记需要立即关注的10–15%的会谈,并提供结构化证据,使督导师能够专注于临床判断,而非例行监测。95%的技术识别结果仅来自两种技术和22次会谈的概念验证,并不代表系统已具备临床应用准备度。
- 创新性: D-CUI将治疗师经验与患者风险因素结合起来,将督导紧迫性视为同时取决于来访者风险和临床工作者经验。这一区分体现了这样的情形:面对同一名高风险来访者时,督导师的经验水平可能存在显著差异。
- 多模态贡献: 多模态分析通过面部标记和具有临床意义的声学线索(如情感平淡和言语碎片化)检测不一致情感,而这些信息无法从文字记录中捕捉。视觉流可能与言语内容相矛盾,而D-CUI会放大紧迫性;低F0方差和升高的VUV提供了不同的声学证据。
- 局限与未来工作: 现有证据受限于22次半结构化DAIC-WOZ会谈、两种技术、一个Mistral-7B模型、缺乏纵向背景的孤立会谈,以及以CBT为导向的训练数据。作者呼吁采用自然情境下的治疗数据、更广泛的技术分类体系、纵向跟踪以及与实时监测的集成。
- 临床可用性: 五名督导师在审阅22份报告后,给出的临床相关性为4.2/5.0、分诊适切性为3.9/5.0、可行动性为4.0/5.0,Cohen’s κ = 0.61。该评估为临床可理解性提供了初步证据,但受样本量小和受控环境限制。
- 伦理与部署: 部署要求进行信息披露、HIPAA核验、匿名化、加密、基于角色的访问控制、有实质意义的督导师审查、偏差监测,以及真正可行的来访者退出路径。AI处理可能产生新的暴露点,在不同人群中的表现可能不均衡,并改变来访者在治疗中的言语表达方式。
7 结论
三流微调 Mistral-7B 系统从视觉、声学和语言三种模态分析治疗会谈,生成结构化督导报告并自动进行风险分诊。在 106 场 DAIC-WOZ 会谈中,系统实现了 95% 的技术识别准确率,并将分诊延迟从 72 小时缩短至 15 秒以内,但仍属于概念验证。
- 结论: 在 106 场 DAIC-WOZ 会谈中,95% 的技术识别准确率和 15 秒以内的分诊延迟体现了系统的核心贡献。系统分析视觉、声学和语言模态,生成结构化督导报告并自动进行风险分诊。
- 结论: 基于 22 场测试会谈、两种技术和一个半结构化访谈数据集的评估仍属于概念验证。文段指出,这些限制仍需进一步关注。
- 结论: 通过在数秒而非数天内识别需要立即关注的会谈,系统应对了结构性督导问题,同时将临床判断、共情和问责保留给督导者。系统减轻了监测负担,而非取代督导责任。
利益披露
作者声明,本研究独立开展,不代表或涉及其列出的组织,且不存在相关利益冲突。
- 本研究独立开展。
- 本研究不涉及作者在 Microsoft、BigCommerce 或 Amazon 的任职,也不代表这些组织的观点或利益。
- 作者声明不存在与本文相关的利益冲突。