Denken Über

Un blog donde escribir ayuda a pensar.

Suscribirme

La IA diagnostica mejor en el triage, y los médicos son mas necesarios que nunca.

Un paciente llega a guardia con dificultad para respirar y antecedentes de coágulos. Los médicos ven anticoagulantes que no están funcionando, ajustan el tratamiento, monitorean. El modelo de IA, leyendo el mismo registro clínico electrónico, nota algo que los humanos pasaron por alto: el paciente tiene, como diría Dr House, lupus y eso cambia todo.. porque no es la inflamación pulmonar no es lo que parecía.

Este caso es uno de los 76 que el equipo de Harvard y Beth Israel Deaconess evaluó en el estudio publicado la semana pasada en Science, el más riguroso que conozco hasta ahora comparando LLMs contra médicos en condiciones reales de guardia y los tienen algunas historias que vale la pena destacar.

¿Porque en triage?

En el momento de triage inicial estás en el punto de mayor presión, con menos información y más urgencia para diagnosticar el camino a seguir; en definitiva es el momento que, en general, es caótico.

En este punto, el modelo o1 de OpenAI identificó el diagnóstico correcto o muy cercano en el 67% de los casos, mientras que los médicos expertos que actuaron como baseline lograron 55% y 50% respectivamente.

Y esa brecha del 12-17% en el momento más caótico de la atención médica es la parte del estudio que me parece genuinamente importante señala exactamente dónde y cómo debería la herramienta ser sumada y convertida en un gran copiloto.

El problema con la pregunta que estamos haciendo

Cada vez que sale un estudio así, el bait de los medios se enfoca en “La IA va a reemplazar a XX” siendo XX los médicos asociados al estudio de esa semana, los médicos dicen “los números no me cierran” y todo termina en la nada… cuando la pregunta clave es:

¿en qué momento específico del flujo clínico un modelo bien implementado reduce errores que cuestan vidas?

Y el estudio, si lo leés con cuidado, es bastante preciso al respecto porque la ventaja del o1 fue más pronunciada en TRIAGE porque es exactamente ahí donde el médico tiene menos información, más presión temporal y mayor variabilidad en la calidad de las decisiones.

Esto es el epítome de no entender el trabajo de un especialista en medicina
Esto es el epítome de no entender el trabajo de un especialista en medicina

Pero con más datos disponibles (en el momento de ADMISION hospitalaria) la diferencia se achicó: 81.6% o1 versus 78.9% y 69.7% para los médicos; o sea estadisticamente insignificante.

¿Que significa esto? que el valor del modelo como copiloto es más alto donde el sistema humano está más estresado, no donde está mejor preparado.

El copiloto ideal

Fijense que interesante, hay una parte del estudio que me intriga y que pocos le prestaron atencion: en los “cannot-miss diagnoses” (los casos donde el error puede matar) el modelo tampoco mostró mejora estadísticamente significativa sobre los médicos.

Para mi es muy relevante porque, en exactamente las situaciones donde más querés que el sistema sea confiable, la ventaja desaparece… y eso, para mi, aumenta el peso del argumento del copiloto.

El modelo puede ser excelente para ampliar el diferencial diagnóstico, para notar el caso de lupus que el médico cansado pasó por alto, para sistematizar el razonamiento en casos complejos cuando la atención del médico puede estar “en otra” pero no es un sistema de seguridad infalible en los peores escenarios.

Hay otro número que vale la pena poner en perspectiva. Un estudio en Nature Medicine publicado antes de este evaluó ChatGPT (mismo fabricante, modelo diferente) en situaciones de urgencia y encontró que subestimó la gravedad del cuadro en el 52% de los casos. Pacientes en riesgo de shock diabético o falla respiratoria derivados a monitoreo de 48 horas.

Dos modelos del mismo laboratorio. Resultados diametralmente opuestos. Lo que cambia es el modelo, el contexto, la implementación.

Esto es lo que los autores del estudio de Science resumieron bien: el o1 con acceso supervisado a registros clínicos estructurados representa un “techo” de lo que la IA puede hacer bien en medicina. El ChatGPT consumer-facing que usás en tu teléfono para consultarle síntomas representa el piso. La distancia entre ambos es enorme.

¿Como funcionó el estudio?

Lo que me parece más interesante del estudio no es el headline sino el diseño.

Los investigadores no le preguntaron al modelo “¿qué tiene este paciente?” lo pusieron en el rol de segunda opinión en 3 puntos predefinidos del flujo clínico: Triage, evaluación inicial, admisión.

Un modelo actuando como el colega que te lee el mismo registro y te dice “mirá, yo también consideraría esto” en lo llaman triadic care: el médico, el paciente y el sistema de IA. Una interacción deliberada en momentos específicos.

El problema es que casi ningún sistema de salud está pensado así; todos piensan en la IA en formato de “optimización de gestión” pero hay una oportunidad monstruosa en la integración de modelos de razonamiento clínico en flujos de triage reales, con supervisión médica y frameworks de responsabilidad claros.

Con este estudio lo que se muestra es que faltan los “clinical trials” porque aunque los resultados del o1 en el estudio son sólidos, falta lo institucional, regulatorio y en parte cultural… especialmente en USA donde casi toda la industria médica tiene a la industria del juicio esperando para decirles que son “los responsables de este desastre”.

Adam Rodman, uno de los autores y médico de Beth Israel, dijo: “Medicine is high stakes, and we have ways to mitigate these risks. They’re called clinical trials.” y eso me parece una posición más honesta que las “AI doctor companies” que están tratando de sacar al médico del loop o minimizar la supervisión clínica.

Y, pensalo un segundo, el principal autor de un estudio que muestra resultados impresionantes es el que sale a decir “esto no justifica eso” es la señal que más me importa.

Lo que sigue

La velocidad en el diagnóstico inicial importa; en guardia, cada minuto que tardás en considerar el diagnóstico correcto puede cambiar el resultado y si un modelo, bien implementado y supervisado, puede aumentar la tasa de diagnósticos correctos en triage del 50% al 67% hay una diferencia clínica real.

La pregunta que me dejo es más incómoda: dado que los datos ya sugieren esta utilidad, ¿qué tan largo tiene que ser el camino institucional antes de que los sistemas de salud empiecen a tomar esto en serio? ¿Y quién define ese tiempo, los labs de AI o el sistema médico?

Recibí los nuevos artículos por email.

Comentarios

2 responses to “La IA diagnostica mejor en el triage, y los médicos son mas necesarios que nunca.”

  1. Adrian Ramiro

    Lo que me preocuparía, y pienso que es donde más se debe regular, sería que surja el “vibe triaging”, y un enfermero, o hasta quien te recibe en la guardia, te tire un diagnóstico.

    1. mariano

      Te imaginas? Es buena esa preocupación

Descubrí más de Denken Über

Suscribite ahora para seguir leyendo y obtener acceso al archivo completo.

Seguir leyendo