Source-linked AI summary

Pedagogical AI in Mental Health: A Tri-Stream Fine-Tuned LLM Framework for Automated Clinical Supervision and Risk Triage

Shreeya Sharma, Ravish Gupta, Saket Kumar, Abhishek Aggarwal

arXiv:2608.18438v1cs.CLcs.AIcs.LG

TL;DR

La supervisión en salud mental sigue siendo tardía, mientras que la investigación se ha centrado principalmente en la IA dirigida a pacientes, no en el apoyo a la supervisión. Este trabajo desarrolla un sistema VAL tri-stream basado en Mistral-7B fine-tuned para generar informes estructurados de supervisión y realizar la clasificación automatizada del riesgo, con una accuracy del 95% en la identificación de técnicas y una reducción de la latencia de triaje de 72 horas a menos de 15 segundos.

  • Problema

    La investigación sobre IA en salud mental ha descuidado en gran medida la capa de supervisión, donde la revisión tardía y la supervisión limitada restringen el apoyo a los terapeutas en formación que gestionan riesgo clínico.

  • Método

    Un Mistral-7B fine-tuned analiza las sesiones de terapia mediante streams visuales, acústicos y lingüísticos para generar informes de supervisión y canalizar el riesgo a través del D-CUI.

  • Resultados

    Se alcanzó una accuracy del 95% en la identificación de técnicas y una latencia de triaje inferior a 15 segundos en 106 sesiones DAIC-WOZ.

  • Conclusiones y limitaciones

    El sistema permite un cribado automatizado que señala las sesiones que requieren atención inmediata y proporciona evidencia estructurada para el juicio clínico de los supervisores.

  • Conclusiones y limitaciones

    La evaluación se limita a 22 sesiones de prueba, dos técnicas y entrevistas semiestructuradas con agentes virtuales, por lo que el rendimiento aún no puede generalizarse a la terapia naturalista.

Abstract

from arXiv · show

Modern mental healthcare faces a critical shortage of senior supervisory oversight, leading to a "supervision gap" where novice therapists manage high-stakes risks with delayed professional feedback. This paper proposes a new framework utilizing a fine-tuned Mistral-7B-instruct model as an automated "Supervisor-in-the-Loop" system. By leveraging 106 sessions from the DAIC-WOZ dataset, the model performs a tri-stream analysis: (1) Therapeutic Alliance tracking via semantic adherence, (2) Latent risk prediction using attention-weighted analytics, and (3) Supervisory Triage via a Dynamic Clinical Urgency Index (D-CUI). Our multi-modal VAL (Visual-Acoustic-Linguistic) framework achieves 95% technique identification accuracy [95% CI: 75.1%-99.9%], alliance assessment MAE of 0.105 on a 5-point scale [95% CI: 0.059-0.151], therapeutic fidelity alpha = 0.423, and mean D-CUI of 0.370 [95% CI: 0.322-0.419]. Training converged in 105 steps with 85.2% loss reduction on a single Tesla T4 GPU. The system reduces supervisory triage latency from 72 hours to real time (~10 seconds per session), enabling proactive intervention in high-risk cases. The system addresses the cold-start problem through Bayesian priors and implements timestamp-based modality synchronization for robust multi-modal fusion.

1 Introducción

La supervisión clínica suele retrasarse debido a estructuras de revisión semanal, lo que deja riesgos urgentes sin resolver mientras las proporciones entre supervisores y personas en formación superan 1:12. Este trabajo aborda la capa de supervisión, en gran medida desatendida, mediante un supervisor-in-the-loop automatizado que analiza sesiones terapéuticas a través de canales VAL y genera informes priorizados por riesgo.

  • Brecha en la supervisión clínica: La brecha de supervisión puede dejar sin revisar durante 72 horas las revelaciones de suicidalidad, los relatos de trauma y las rupturas terapéuticas, mientras las proporciones entre supervisores y personas en formación suelen superar 1:12.La revisión retrospectiva tradicional de casos favorece el desarrollo profesional, pero no fue diseñada para necesidades clínicas urgentes.
  • Brecha de investigación: La investigación se ha centrado en aplicar LLMs a herramientas dirigidas a pacientes, mientras desatiende en gran medida la supervisión, donde convergen fallos de calidad, gestión del riesgo por parte de las personas en formación y presiones estructurales de capacidad.Entre los ejemplos se incluyen chatbots de psicoeducación, redactores de documentación y agentes conversacionales con guiones de CBT.
  • Sistema propuesto: El sistema propuesto trata el LLM como un supervisor-in-the-loop automatizado que procesa sesiones terapéuticas mediante canales Visual, Acoustic y Linguistic, y genera informes de supervisión estructurados y priorizados por riesgo.El trabajo se basa en investigaciones previas del grupo sobre explicabilidad de decisiones de IA clínica y gestión de identidad y acceso para sistemas de IA sanitaria.
  • Arquitectura de tres flujos: La arquitectura VAL de tres flujos procesa simultáneamente audio COVAREP a 100Hz, vídeo OpenFace a 30fps y transcripciones, alineando las modalidades al ajustarlas a los límites de las intervenciones.El diseño aborda la sincronización entre las tres frecuencias de muestreo.
  • Triaje priorizado por riesgo: El D-CUI dirige la supervisión utilizando como entradas la probabilidad de riesgo, la gravedad de los síntomas, la experiencia invertida del terapeuta y la volatilidad del sentimiento a nivel de sesión.Invertir la experiencia del terapeuta hace que la inexperiencia amplifique la urgencia.

2 Trabajo relacionado

La IA en salud mental ha evolucionado desde chatbots de TCC programada hacia la detección multimodal y las respuestas terapéuticas basadas en LLM, pero los sistemas previos siguen centrados en tareas del lado del paciente y no en la supervisión clínica. Los trabajos con DAIC-WOZ también hacen hincapié en la clasificación de la depresión, lo que motiva un marco VAL alineado temporalmente para el análisis de supervisión.

  • Trabajo relacionado: Los sistemas previos abarcan la TCC programada, la detección de la depresión basada en el habla, el cribado del riesgo suicida mediante transformers y las respuestas terapéuticas generadas por LLM [10].Woebot se lanzó en 2017 como chatbot de TCC programada, mientras que los sistemas posteriores avanzaron hacia el deep learning, los transformers y las respuestas de LLM similares a las de un terapeuta.
  • Brecha de supervisión: La literatura se dirige principalmente al cribado, la conversación, el seguimiento o la documentación del lado del paciente, y deja sin abordar la capa de supervisión que regula la calidad clínica.Las evaluaciones existentes hacen hincapié en la satisfacción del usuario y la reducción de síntomas, más que en la revisión supervisora y la gobernanza clínica.
  • Dataset y benchmarking previo: DAIC-WOZ proporciona entrevistas multimodales semiestructuradas de 189 participantes, con audio, vídeo, transcripciones y anotaciones PHQ-8.El corpus constituye un benchmark multimodal para la IA en salud mental, pero los trabajos previos se han concentrado principalmente en clasificar la depresión y su gravedad.
  • Fusión multimodal: La detección de la depresión basada únicamente en texto en DAIC-WOZ alcanza F1 = 0.67; el audio eleva este valor a 0.77, y la entrada visual aporta un beneficio incremental adicional.Estas mejoras están limitadas por los desafíos de alineación entre el audio a 100Hz, el vídeo a 30fps y el texto a nivel de enunciado, donde la desalineación en la fusión puede introducir un ruido sustancial.
  • Motivación metodológica: El marco VAL propuesto utiliza ventanas basadas en marcas temporales para preservar el contexto temporal clínicamente relevante y evitar las exigencias de memoria de la GPU de la atención cruzada multimodal a nivel de fotograma.Este intercambio deliberado distingue los eventos según el momento de la sesión, como el malestar acústico en el minuto 23 frente al minuto 3.

3 Arquitectura del sistema · 3.1 Descripción general · 3.2 Motor de ingesta VAL

El sistema utiliza una arquitectura VAL de tres flujos para extraer señales visuales, acústicas y lingüísticas, fusionar representaciones de las sesiones y encaminar los casos mediante el D-CUI. Su pipeline por etapas alinea las entradas antes del análisis de fidelidad, el triaje de riesgo y la generación de orientación para la supervisión.

  • 3.1 Descripción general: El flujo visual analiza las Action Units faciales de OpenFace a 30 fps para detectar señales de afecto, implicación y malestar incongruente.La incongruencia crítica para la seguridad incluye la negación verbal del malestar junto con marcadores faciales de malestar, como AU1 y AU4 sin AU12.
  • 3.1 Descripción general: El flujo acústico procesa características de COVAREP a 100 Hz, incluida la variabilidad de F0 y la media de Voice Unvoiced, para captar expresividad, fluidez, pausas, afecto plano y agitación.Estas señales paralingüísticas captan estados que el texto de la transcripción por sí solo puede pasar por alto.
  • 3.1 Descripción general: El flujo lingüístico aplica Mistral-7B-instruct fine-tuned a las transcripciones para identificar técnicas terapéuticas, marcadores de alianza, ideación suicida y lenguaje de desesperanza.Entre las técnicas detectadas se incluyen Reflective Listening y Open-Ended Questioning.
  • 3.1 Descripción general: VAL procesa las sesiones terapéuticas mediante flujos visuales, acústicos y lingüísticos, fusiona las salidas en los límites de los enunciados y encamina los casos mediante el D-CUI hacia la escalada o la revisión rutinaria.La arquitectura analiza la fidelidad, la incongruencia del afecto y el riesgo clínico antes de encaminar los resultados de supervisión.
  • 3.1 Descripción general: El D-CUI combina el riesgo del paciente, la gravedad de los síntomas, la experiencia del terapeuta y la volatilidad del sentimiento dentro de la sesión en una única puntuación de urgencia para la escalada o la revisión rutinaria.Las representaciones fusionadas a nivel de sesión de los tres flujos alimentan este cálculo de encaminamiento.
  • 3.2 Motor de ingesta VAL: El pipeline de cuatro etapas alinea y normaliza los flujos, puntúa la fidelidad terapéutica, calcula el D-CUI y genera orientación para la supervisión junto con el encaminamiento.La secuenciación evita que el ruido de los flujos desalineados distorsione el análisis de fidelidad y garantiza que el triaje preceda a la generación del informe.

Sincronización de modalidades y alineación temporal … Flujo visual

El marco sincroniza los flujos acústico y visual con ventanas de enunciados definidas por la transcripción y luego utiliza Mistral-7B para analizar técnicas terapéuticas, alianza y riesgo. La detección de incongruencia visual amplifica específicamente la urgencia de supervisión cuando la tranquilización verbal entra en conflicto con el malestar facial.

  • Sincronización de modalidades y alineación temporal: Los límites de los enunciados definidos por la transcripción alinean el audio COVAREP a 100Hz y el video OpenFace a 30fps, preservando la estructura temporal clínicamente relevante mediante agregación con pérdida.Ambos flujos se ajustan a los marcadores de inicio y final de los enunciados de DAIC-WOZ, en lugar de promediarse a lo largo de sesiones completas.
  • Sincronización de modalidades y alineación temporal: Las medias acústicas, las medias de las Action Units y el texto bruto de la transcripción se concatenan en vectores de sesión y se serializan como lenguaje natural para Mistral-7B.Para cada turno t_i, las características acústicas y visuales se agregan mediante media sobre [s_i:e_i].
  • Flujo lingüístico: Mistral-7B etiqueta la escucha reflexiva, el cuestionamiento abierto, los marcadores de alianza y riesgos como ideación suicida, autolesión, desesperanza y preocupaciones de seguridad.Los marcadores de alianza incluyen lenguaje colaborativo, empatía, consenso sobre los objetivos e indicadores de ruptura.
  • Flujo acústico: COVAREP aporta la desviación estándar de F0 y la media de Voice Unvoiced para captar la variabilidad del tono, la continuidad del habla, el silencio, la vacilación y la fragmentación.Una baja varianza de F0 se correlaciona con afecto plano en la depresión, mientras que valores elevados de Voice Unvoiced indican vacilación o fragmentación.
  • Flujo visual: OpenFace rastrea indicadores de malestar, compromiso e incongruencia afectiva mediante Action Units clínicamente relevantes, dirección de la mirada y discrepancias entre lo verbal y lo facial.El malestar incluye AU1, AU4 y AU15; el compromiso incluye AU12, AU26 y la dirección de la mirada.
  • Flujo visual: La incongruencia se activa cuando el sentimiento de VADER supera 0.3, AU01 o AU04 supera 0.5 y AU12 permanece por debajo de 0.3.Esta regla busca detectar la negación verbal del malestar junto con elevación o descenso de las cejas sin una señal de sonrisa.
  • Flujo visual: Cuando se activa la incongruencia afectiva, Δϕ=0.4 amplifica multiplicativamente D-CUI mediante (1+Δϕ), activando la revisión de supervisión pese a otros indicadores de riesgo moderados.El papel crítico para la seguridad del flujo visual consiste en identificar a pacientes cuyo malestar facial entra en conflicto con la tranquilización verbal.

3.3 Analizador de fidelidad terapéutica · 3.4 Módulo de triaje de riesgo · Índice dinámico de urgencia clínica (D-CUI)

El analizador de fidelidad terapéutica cuantifica la adherencia a métodos basados en la evidencia, mientras que el D-CUI prioriza las sesiones para revisión supervisora mediante el riesgo, la gravedad de los síntomas, la experiencia del terapeuta y la volatilidad del sentimiento. La inicialización bayesiana y la actualización basada en la experiencia extienden el triaje a terapeutas con datos históricos limitados.

  • 3.3 Analizador de fidelidad terapéutica: La Fidelidad terapéutica (α) se define como la similitud coseno entre los embeddings de la sesión (VT) y los embeddings del manual clínico (VM).
  • 3.3 Analizador de fidelidad terapéutica: Las puntuaciones de fidelidad superiores a 0.5 indican una adherencia estrecha, las puntuaciones de 0.3 a 0.5 indican una adherencia parcial y las puntuaciones inferiores a 0.3 señalan una desviación que requiere atención supervisora.
  • Índice dinámico de urgencia clínica (D-CUI): El D-CUI determina qué sesiones requieren atención supervisora inmediata frente a una revisión rutinaria mediante la combinación de cuatro factores clínicos y de supervisión.
  • Índice dinámico de urgencia clínica (D-CUI): D-CUI = (w1R + w2S + w3(1 − E)) · (1 + Δϕ), con pesos ajustados empíricamente w1 = 0.40, w2 = 0.35 y w3 = 0.25.
  • Índice dinámico de urgencia clínica (D-CUI): La probabilidad de riesgo, la gravedad de los síntomas derivada del PHQ-8, la experiencia del terapeuta y la volatilidad del sentimiento durante la sesión definen las entradas del D-CUI.R, S y E varían de 0 a 1; Δϕ captura la inestabilidad emocional, y E representa los años normalizados de práctica.
  • 3.4 Módulo de triaje de riesgo: El término (1 − E) aumenta la urgencia para clientes de alto riesgo tratados por terapeutas principiantes, distinguiendo situaciones de supervisión que los modelos de riesgo centrados únicamente en el paciente pasan por alto.
  • Índice dinámico de urgencia clínica (D-CUI): Cuando no se dispone de la experiencia del terapeuta, el sistema inicializa E0 = 0.3 como prior de inicio de carrera y actualiza E mediante una media móvil exponencial a medida que se acumulan datos de las sesiones.El prior favorece intencionadamente una cobertura supervisora más amplia.

Abordaje del problema de arranque en frío · Volatilidad del sentimiento (∆ϕ) · 3.5 Generador de orientación para la supervisión

El marco aborda la supervisión en condiciones de arranque en frío mediante un suavizado de β = 0.7 cuando se dispone de la experiencia del terapeuta, cuantifica la volatilidad del sentimiento mediante el cambio emocional secuencial y asigna las puntuaciones D-CUI a niveles escalonados de orientación para la supervisión. Los casos inmediatos activan alertas fundamentadas en la transcripción y protocolos de seguridad, mientras que los casos elevados reciben una revisión prioritaria.

  • Abordaje del problema de arranque en frío: El suavizado de arranque en frío utiliza β = 0.7, donde Eobserved representa el nivel de experiencia documentada del terapeuta una vez disponible.El factor de suavizado permite una inicialización sensible a la experiencia antes de que esta experiencia observada esté disponible.
  • Abordaje del problema de arranque en frío: El mecanismo de arranque en frío actualiza la supervisión utilizando la experiencia documentada del terapeuta cuando Eobserved está disponible.Esta condición distingue la fase de inicialización de la estimación posterior basada en la experiencia.
  • Volatilidad del sentimiento (∆ϕ): La volatilidad del sentimiento capta cambios emocionales rápidos dentro de una sesión que pueden indicar estados de crisis o rupturas terapéuticas.Se calcula como la tasa media absoluta de cambio en las puntuaciones de sentimiento a nivel de oración.
  • Volatilidad del sentimiento (∆ϕ): El cálculo de ∆ϕ enfatiza las transiciones emocionales secuenciales en lugar de la dispersión global del sentimiento.ϕ_i denota la puntuación de sentimiento de la oración i.
  • 3.5 Generador de orientación para la supervisión: D-CUI supera 0.7 para activar una alerta inmediata que contiene las líneas de la transcripción que impulsaron la escalada y un protocolo de seguridad asociado.La alerta proporciona material fuente real en lugar de un resumen, lo que permite el desacuerdo de supervisión antes de actuar.
  • 3.5 Generador de orientación para la supervisión: Un D-CUI entre 0.4 y 0.7 se clasifica como elevado y se señala para una revisión prioritaria dentro del ciclo de supervisión vigente.Este nivel está por encima de la revisión rutinaria, pero no se trata como una emergencia.

4 Implementación

La implementación utiliza Mistral-7B-instruct [18] con QLoRA [19] para respaldar una supervisión desplegable y auditable en hardware clínico accesible. Prepara datos de entrenamiento multimodales sincronizados y aplica salvaguardas de privacidad, incertidumbre y derivación de casos de alto riesgo.

  • Selección del modelo: Mistral-7B-instruct [18] se ajusta a las restricciones de despliegue institucional mediante cuantización de 4 bits, operación local bajo Apache 2.0 y salidas que siguen instrucciones, adecuadas para informes de supervisión con plantillas.Requiere aproximadamente 2 GB de almacenamiento y 5.6 GB de memoria GPU para inferencia, por lo que puede ejecutarse en una Tesla T4, al tiempo que permite la auditabilidad y mantiene las transcripciones dentro de la infraestructura institucional.
  • Preparación de datos: El pipeline realiza diarización de las grabaciones, extrae características acústicas y visuales, alinea los streams con los límites de las emisiones y convierte ejemplos sintéticos de supervisión etiquetados mediante reglas al formato de instruction-tuning de Alpaca.Las etiquetas abarcan técnicas terapéuticas, marcadores de alianza y preocupaciones clínicas; además, se generaron sintéticamente prompts y respuestas mediante Claude Sonnet 4.6 Thinking.
  • Estrategia de entrenamiento: El fine-tuning de QLoRA [19] utiliza una tasa de aprendizaje de 2e-4, un tamaño de batch de 4, rank 64, alpha 16 y cinco epochs, y se completa en 105 steps con una Tesla T4.El entrenamiento tomó 2 horas 44 minutos con el optimizador AdamW paginado de 32 bits.
  • Privacidad y gobernanza: El sistema elimina la información identificable, cifra el almacenamiento y la transmisión de extremo a extremo, restringe el acceso según roles, registra cada evento de acceso y comunica la participación de la IA antes de las sesiones.Estos controles responden a la sensibilidad de las revelaciones realizadas en terapia y limitan el acceso a los datos de las sesiones a los clínicos supervisores.
  • Restricciones de seguridad: Las salidas con baja confianza activan la postergación por incertidumbre, mientras que las revelaciones de ideación suicida o abuso omiten el triage y generan alertas inmediatas.El diseño de derivación evita recomendaciones con apariencia de autoridad cuando la confianza es baja y excluye las señales urgentes de seguridad de la gestión automatizada de colas.

5 Evaluación experimental

En 22 sesiones DAIC-WOZ reservadas para prueba, el modelo mostró un sólido reconocimiento de técnicas terapéuticas y un bajo error en la evaluación de la alianza, al tiempo que derivó el triaje de supervisión de una cola de 72 horas a un tiempo casi real. D-CUI incorporó la incongruencia afectiva para elevar los casos clínicamente importantes, aunque este ajuste fue mínimo en las sesiones de cribado rutinario.

  • 5 Evaluación experimental: La evaluación utilizó 106 sesiones DAIC-WOZ, con 84 sesiones de entrenamiento y 22 sesiones de prueba reservadas, seleccionadas mediante la semilla aleatoria 42.La evaluación puso a prueba la identificación de técnicas terapéuticas en sesiones reservadas y una derivación más rápida de los casos urgentes que la revisión tradicional de la supervisión semanal.
  • 5 Evaluación experimental: Una reducción del 85.2% de la pérdida cross-entropy acompañó la convergencia en 105 pasos, y el procesamiento de extremo a extremo se completó en menos de 15 segundos por sesión, en lugar de una cola de supervisión de 72 horas.El entrenamiento tomó 2 horas 44 minutos en una Tesla T4; el análisis requirió 8–12 segundos y el cálculo de D-CUI menos de 1 milisegundo.
  • 5 Evaluación experimental: D-CUI aumentó de 0.283 a 0.395 para una sesión de bajo riesgo cuando la incongruencia afectiva se estableció en ∆ϕ = 0.4, situándola cerca del umbral Elevado.Sin el flujo visual, la sesión permaneció dentro de la banda Rutinaria; la puntuación bruta de D-CUI está limitada a [0, 1].
  • 5 Evaluación experimental: En el corpus DAIC-WOZ, ∆ϕ osciló entre 0.00 y 0.02, produciendo un ajuste de D-CUI inferior al 2% porque la dinámica del cribado era estable.El término ∆ϕ está diseñado para activarse en escenarios agudos y no en el cribado rutinario.

6 Discusión

El marco se plantea como una ayuda automatizada para el cribado que señala las sesiones que requieren atención de supervisión, no como sustituto de la supervisión clínica. Las valoraciones preliminares de expertos respaldan la inteligibilidad de los informes, mientras que los datos limitados, el alcance reducido, los riesgos de privacidad y las restricciones de despliegue exigen una interpretación cautelosa.

  • Implicación práctica: El sistema está diseñado para señalar el 10–15% de las sesiones que requieren atención inmediata y proporcionar evidencia estructurada, liberando a los supervisores para el juicio clínico en lugar de la supervisión rutinaria.El resultado de 95% en identificación de técnicas es una prueba de concepto basada en dos técnicas y 22 sesiones, no evidencia de preparación para el uso clínico.
  • Novedad: El D-CUI incorpora la experiencia del terapeuta junto con los factores de riesgo del paciente, tratando la urgencia de supervisión como dependiente tanto del riesgo del cliente como de la experiencia del clínico.Esto distingue las situaciones que involucran al mismo cliente de alto riesgo, pero a supervisores con niveles de experiencia sustancialmente diferentes.
  • Contribución multimodal: El análisis multimodal detecta afecto incongruente mediante marcadores faciales y señales acústicas clínicamente significativas, como el afecto plano y la fragmentación del habla, que las transcripciones no pueden captar.El flujo visual puede contradecir el contenido verbal, mientras que el D-CUI amplifica la urgencia; la baja variación de F0 y el VUV elevado aportan evidencia acústica diferenciada.
  • Limitaciones y trabajo futuro: La evidencia está delimitada por 22 sesiones DAIC-WOZ semiestructuradas, dos técnicas, un modelo Mistral-7B, sesiones aisladas sin contexto longitudinal y datos de entrenamiento orientados a la CBT.Los autores solicitan datos naturalistas de terapia, taxonomías más amplias de técnicas, seguimiento longitudinal e integración con la monitorización en tiempo real.
  • Usabilidad clínica: Cinco supervisores que revisaron 22 informes reportaron 4.2/5.0 de relevancia clínica, 3.9/5.0 de adecuación del triaje y 4.0/5.0 de utilidad para la acción, con Cohen’s κ = 0.61.La evaluación proporciona evidencia preliminar de inteligibilidad clínica, pero estuvo limitada por su muestra pequeña y su entorno controlado.
  • Ética y despliegue: El despliegue requiere divulgación, verificación de HIPAA, anonimización, cifrado, acceso restringido por roles, revisión significativa por parte de supervisores, monitorización de sesgos y una vía genuina de exclusión voluntaria para el cliente.El procesamiento mediante AI puede crear nuevos puntos de exposición, funcionar de manera desigual entre poblaciones y alterar la forma en que los clientes hablan durante la terapia.

7 Conclusión

El sistema Mistral-7B ajustado mediante fine-tuning y de análisis tri-stream analiza sesiones terapéuticas en las modalidades visual, acústica y lingüística, y genera informes estructurados de supervisión y triaje automatizado del riesgo. En 106 sesiones de DAIC-WOZ, alcanza una precisión del 95% en la identificación de técnicas y reduce la latencia del triaje de 72 horas a menos de 15 segundos, aunque sigue siendo una prueba de concepto.

  • Conclusión: Una precisión del 95% en la identificación de técnicas y una latencia del triaje inferior a 15 segundos demuestran la contribución central del sistema en 106 sesiones de DAIC-WOZ.El sistema analiza las modalidades visual, acústica y lingüística para generar informes estructurados de supervisión con triaje automatizado del riesgo.
  • Conclusión: La evaluación sigue siendo una prueba de concepto basada en 22 sesiones de prueba, dos técnicas y un único conjunto de datos de entrevistas semiestructuradas.El pasaje señala que estas limitaciones requieren mayor atención.
  • Conclusión: Al identificar en segundos, en lugar de días, las sesiones que requieren atención inmediata, el sistema aborda un problema estructural de supervisión, mientras deja el juicio clínico, la empatía y la responsabilidad en manos de los supervisores.El sistema elimina la carga de monitorización, en lugar de sustituir la responsabilidad de supervisión.

Declaración de intereses

Los autores señalan que el trabajo se realizó de forma independiente, no representa ni guarda relación con las organizaciones mencionadas, y no presenta conflictos de intereses pertinentes.

  • El trabajo se realizó de forma independiente.
  • No guarda relación con los cargos de los autores en Microsoft, BigCommerce o Amazon, ni representa las opiniones o intereses de esas organizaciones.
  • Los autores declaran no tener conflictos de intereses pertinentes para el artículo.
Loading 2608.18438v1…