SymptomAI: una IA conversacional para evaluar síntomas cotidianos mediante entrevistas clínicas

SymptomAI: una IA conversacional para evaluar síntomas cotidianos mediante entrevistas clínicas

Brain Code |

Google Research ha presentado SymptomAI, un agente conversacional experimental diseñado para estudiar cómo la inteligencia artificial puede realizar entrevistas sobre síntomas y elaborar diagnósticos diferenciales.

La investigación analiza su funcionamiento en condiciones más próximas a una conversación cotidiana, en la que las personas pueden explicar sus síntomas con información incompleta, diferentes niveles de conocimiento médico y formas diversas de expresarse.

El estudio incluyó a 13.917 participantes y comparó las evaluaciones generadas por SymptomAI con las realizadas por profesionales clínicos. Los resultados también se contrastaron con datos biométricos obtenidos mediante dispositivos Fitbit.

SymptomAI es una iniciativa de investigación. Los diagnósticos, etiquetas y asociaciones con enfermedades generados durante el estudio no constituyen diagnósticos clínicos confirmados ni evaluaciones médicas oficiales.

El problema de evaluar modelos con casos clínicos preparados

Una parte importante de los diagnósticos clínicos puede derivarse de entrevistas basadas en el lenguaje. Habitualmente, estas conversaciones se producen entre profesionales sanitarios y pacientes, tanto en consultas presenciales como remotas.

Aunque estas interacciones constituyen el principal método para evaluar síntomas, su acceso puede verse limitado por barreras económicas, geográficas y sistémicas.

Los modelos de lenguaje han mostrado capacidades para elaborar diagnósticos diferenciales cuando se evalúan mediante casos médicos seleccionados. Sin embargo, muchas de estas pruebas utilizan descripciones muy detalladas y, en ocasiones, sintéticas.

Este tipo de evaluación no siempre refleja cómo comunican sus síntomas las personas en situaciones reales. En una conversación cotidiana pueden aparecer:

  • distintos niveles de conocimiento médico;
  • información incompleta;
  • descripciones poco estructuradas;
  • variaciones propias de una conversación natural.

Esta diferencia plantea dudas sobre cómo funcionarían los modelos de lenguaje fuera de los casos clínicos preparados específicamente para su evaluación.

Qué es SymptomAI

SymptomAI es un conjunto de prototipos experimentales de agentes conversacionales basados en Gemini Flash 2.0.

Su objetivo es investigar cómo una inteligencia artificial puede gestionar de principio a fin una conversación sobre síntomas. Durante la interacción, el agente puede solicitar información adicional y, al finalizar, generar:

  • una lista de posibles diagnósticos;
  • recomendaciones sobre los siguientes pasos;
  • una evaluación estructurada de los síntomas comunicados.

Esta lista de posibilidades recibe el nombre de diagnóstico diferencial o DDx. No representa un diagnóstico definitivo, sino un conjunto de explicaciones plausibles para los síntomas descritos.

El trabajo de Google Research no se plantea como una herramienta clínica validada, sino como una investigación comparativa destinada a medir el rendimiento de agentes conversacionales en la evaluación de síntomas.

Un estudio con 13.917 participantes

La investigación se desarrolló mediante un estudio aleatorizado a escala nacional con 13.917 participantes que dieron su consentimiento.

Cada persona fue asignada aleatoriamente a uno de cinco agentes de SymptomAI. Estos agentes utilizaban estrategias diferentes para realizar la entrevista y disponían de distintos grados de libertad para formular preguntas.

El proceso siguió estas fases:

  1. El participante describía sus síntomas a SymptomAI.
  2. El agente realizaba preguntas de seguimiento.
  3. La conversación terminaba con un diagnóstico diferencial y recomendaciones sobre los siguientes pasos.
  4. El participante podía acudir posteriormente a un profesional sanitario.
  5. Dos semanas después, se le solicitaba que informara sobre cualquier diagnóstico recibido durante esa consulta.
  6. Un grupo de profesionales clínicos evaluaba las conversaciones y comparaba los diagnósticos diferenciales.

Para establecer una referencia, tres profesionales con certificación médica revisaron las transcripciones y elaboraron sus propias evaluaciones.

Posteriormente, cada profesional clasificó de manera ciega los diagnósticos diferenciales generados por SymptomAI y los elaborados por los otros clínicos.

Los clínicos prefirieron los diagnósticos diferenciales de SymptomAI en más de la mitad de los casos

Los profesionales que participaron en la evaluación prefirieron los diagnósticos diferenciales de SymptomAI frente a los elaborados por otros clínicos en más del 50 % de los casos.

En la clasificación de calidad general, las respuestas de SymptomAI tuvieron una mayor probabilidad de ser consideradas el mejor diagnóstico diferencial.

Según Google Research, este resultado indica que las evaluaciones generadas por SymptomAI coincidieron con el criterio médico de los evaluadores con una frecuencia similar o superior a las realizadas por otros profesionales clínicos.

La publicación informa de que SymptomAI fue situado en primera posición en el 53,3 % de las comparaciones.

Mayor precisión dentro de los cinco primeros diagnósticos

El estudio también evaluó la denominada precisión top-5.

Esta métrica analiza si el diagnóstico comunicado posteriormente por el profesional sanitario del participante aparecía entre las cinco posibilidades incluidas en el diagnóstico diferencial.

Para realizar esta comparación, los evaluadores clínicos determinaron si el diagnóstico informado por el participante estaba presente tanto en las listas generadas por SymptomAI como en las elaboradas por otros clínicos.

Los resultados mostraron que los diagnósticos diferenciales de SymptomAI incluían con mayor frecuencia ese diagnóstico comunicado posteriormente por el participante.

Los profesionales evaluadores consideraron que las listas generadas por el sistema eran precisas con más frecuencia que las proporcionadas por los otros clínicos del estudio.

Hacer preguntas de seguimiento mejora la evaluación

La investigación comparó cinco formas distintas de dirigir la conversación sobre síntomas.

Dos agentes, denominados Dynamic Live y Dynamic Final, podían formular preguntas adicionales sin restricciones.

Otros dos, Fixed Canonical y Flexible Canonical, utilizaban preguntas procedentes de un conjunto estándar empleado en la formación médica para recopilar el historial del paciente.

El quinto sistema era un modelo base sin instrucciones específicas. En este caso, la conversación dependía principalmente de la información que el propio usuario decidiera aportar, de forma similar a una consulta convencional realizada a un chatbot.

Todas las estrategias en las que SymptomAI realizaba activamente preguntas de seguimiento superaron de manera significativa al modelo base.

El resultado refleja la importancia de obtener información adicional durante la conversación. El modelo no alcanzaba el mismo rendimiento cuando se limitaba a responder a la descripción inicial del usuario.

La capacidad de dirigir la entrevista y solicitar detalles relevantes mejoró la precisión de los diagnósticos diferenciales.

Mejores resultados en los casos de menor confianza clínica

La diferencia entre SymptomAI y las evaluaciones clínicas utilizadas como referencia fue mayor en aquellos casos en los que los propios profesionales manifestaron menor confianza en sus diagnósticos diferenciales.

Cuando la confianza del clínico era reducida, SymptomAI mantenía una mayor precisión top-5 que los diagnósticos generados por los profesionales incluidos en la comparación.

La publicación presenta este resultado como una de las áreas en las que el rendimiento del agente destacó especialmente frente a las referencias clínicas del estudio.

Comparación de los diagnósticos con datos de dispositivos Fitbit

Después de evaluar la precisión de los diagnósticos diferenciales, los investigadores compararon las evaluaciones de SymptomAI con señales biométricas recogidas mediante dispositivos Fitbit.

Los participantes que dieron su consentimiento aportaron datos biométricos diarios correspondientes a un periodo de hasta 30 días anterior a su conversación con el sistema.

La investigación se centró especialmente en los casos en los que el primer diagnóstico propuesto por SymptomAI correspondía a una infección respiratoria.

Para realizar el análisis, los investigadores agruparon a los participantes según el primer diagnóstico candidato generado por el agente. El grupo de infecciones respiratorias excluyó otras enfermedades respiratorias no infecciosas.

Los datos mostraron cambios en las señales fisiológicas durante los días anteriores a la comunicación de los síntomas. Estas variaciones alcanzaban su punto máximo alrededor de la fecha en la que se producía la conversación con SymptomAI.

Según la publicación, esta coincidencia constituye una evidencia fisiológica observacional alineada con los síntomas comunicados por los participantes.

Qué señales fisiológicas analizó el estudio

Al combinar las conversaciones de SymptomAI con los datos de Fitbit, los investigadores identificaron variaciones en diferentes métricas fisiológicas.

Entre ellas se encontraban:

  • la función cardiovascular;
  • la respiración;
  • la temperatura de la piel;
  • la calidad del sueño.

Los cambios aparecían durante los días previos a la conversación sobre síntomas y coincidían temporalmente con el momento en el que los participantes informaban de su estado.

Este análisis plantea la posibilidad de utilizar señales biométricas para contrastar síntomas comunicados por los propios pacientes o para aportar información complementaria a un diagnóstico diferencial.

Google Research también señala que la evaluación mediante IA permite estudiar grandes volúmenes de informes de síntomas junto con datos fisiológicos recogidos en tiempo real.

La proximidad temporal entre los síntomas y la conversación

Uno de los aspectos destacados por la investigación es la posibilidad de realizar la conversación mientras los síntomas todavía están presentes o son recientes.

Las citas clínicas tradicionales pueden verse afectadas por retrasos en la programación. En cambio, los participantes podían intervenir en el estudio de SymptomAI en un momento próximo a la aparición de sus síntomas.

Según Google Research, esta proximidad temporal podría mejorar la precisión con la que las personas recuerdan y comunican cuándo comenzaron sus síntomas.

Esta información resulta relevante para analizar datos sanitarios a escala poblacional, aunque la publicación presenta esta posible utilidad como una línea de investigación y no como una capacidad clínica confirmada.

Las limitaciones de SymptomAI

Google Research define SymptomAI como un proyecto exploratorio. Aunque los resultados muestran el potencial de la IA conversacional para evaluar síntomas, la publicación identifica varias limitaciones.

Un diagnóstico diferencial es una evaluación provisional

El diagnóstico diferencial es una tarea ambigua. Los diagnósticos pueden cambiar con el tiempo a medida que una enfermedad evoluciona o aparecen nuevos indicios.

La evaluación de síntomas representa una fotografía de la situación en un momento concreto. Por tanto, depende de cómo se manifiestan los síntomas cuando se produce la conversación.

El momento en que se comunicaron los síntomas no estaba controlado

Por la escala del estudio, los investigadores no pudieron controlar la frecuencia ni el momento exacto en el que los participantes informaban de sus síntomas.

Algunas personas pudieron realizar la conversación antes de que aparecieran señales suficientemente representativas. Otras pudieron describir síntomas evidentes a partir de una experiencia prolongada con una enfermedad crónica.

Los investigadores señalan que futuros estudios podrían centrarse en enfermedades específicas y en momentos concretos de su evolución.

Los clínicos no pudieron formular sus propias preguntas

En la evaluación, los profesionales revisaron transcripciones estáticas. No pudieron dirigir las entrevistas ni solicitar información adicional.

La publicación reconoce que los clínicos podrían haber obtenido datos diferentes si hubieran controlado personalmente la conversación.

La conversación no recoge todas las señales clínicas

Un sistema conversacional puede recopilar información detallada mediante el lenguaje, pero puede omitir señales que sí están presentes en una interacción clínica.

Entre ellas se encuentran:

  • el lenguaje corporal;
  • la evaluación visual;
  • los historiales médicos;
  • la relación previa entre el profesional y el paciente.

Estas diferencias limitan la comparación directa entre una entrevista conversacional automatizada y una consulta clínica completa.

Un sistema de investigación, no un diagnóstico médico

Todos los diagnósticos, etiquetas y asociaciones con enfermedades producidos por SymptomAI durante el estudio se utilizaron únicamente para el análisis de la investigación.

No representan:

  • diagnósticos clínicos confirmados;
  • evaluaciones médicas oficiales;
  • sustitutos de una consulta con profesionales sanitarios.

La investigación estudia el rendimiento de un agente conversacional en entrevistas y evaluaciones de síntomas, pero no presenta SymptomAI como una herramienta clínica disponible para el público.

Su principal aportación es mostrar cómo una IA conversacional puede realizar entrevistas completas sobre síntomas, generar diagnósticos diferenciales y facilitar estudios que relacionen la información comunicada por las personas con señales fisiológicas a escala poblacional.

Fuente

Joseph Breda y Jake Sunshine, “SymptomAI: Towards a conversational AI agent for everyday symptom assessment”, Google Research, 22 de julio de 2026.

Leave a comment