Van a auditar un sistema de inteligencia artificial que se instaló en cientos de hospitales, que se usó sobre millones de pacientes, y que nadie fuera del fabricante había verificado. Al final de la sesión tienen que decidir qué hacer con él.
1. Toda afirmación se sostiene con un dato o con una razón.
2. «Depende» solo vale si dices de qué depende.
3. Al cierre hay que votar. Abstenerse no es una opción disponible.
Hoy: desarmamos el modelo de otro.
La próxima: cada uno trae su propia pregunta de predicción y la somete al mismo interrogatorio.
Cuatro afirmaciones que van a escuchar en cualquier pasillo, en cualquier feria de proveedores. Voten primero, discutimos después. No hay respuesta que valga sin argumento.
Anoten su voto. Al final de la clase volvemos a votar sobre las mismas cuatro.
| Qué hace | Calcula un puntaje de riesgo de sepsis para cada paciente hospitalizado, cada 15 minutos, y dispara una alerta cuando el puntaje pasa un umbral. |
| Con qué | Cerca de 80 variables que ya están en la historia clínica: signos vitales, laboratorios, comorbilidades, demografía. Cero digitación adicional. |
| Dónde vive | Integrado de fábrica en el sistema de historia clínica electrónica del hospital. Se activa con un interruptor. |
| Desempeño | El fabricante reporta un AUC entre 0,76 y 0,83 en su documentación interna. |
| Adopción | Funcionando en cientos de hospitales de Estados Unidos. |
Escriban en papel, cada uno por su cuenta: ¿cuáles son las tres preguntas que ustedes le harían al proveedor antes de firmar? Guárdenlas. Las revisamos al final.
27.697 pacientes, 38.455 hospitalizaciones, diciembre de 2018 a octubre de 2019. Sepsis en el 7% de las hospitalizaciones. Umbral de alerta: 6, dentro del rango sugerido por el fabricante.
Y lo más incómodo: de los 2.552 pacientes con sepsis, el modelo detectó 183 (el 7%) que no habían recibido antibiótico a tiempo. Sobre el resto, el clínico ya se había dado cuenta.
Wong A, Otles E, Donnelly JP, et al. External Validation of a Widely Implemented Proprietary Sepsis Prediction Model in Hospitalized Patients. JAMA Intern Med. 2021;181(8):1065-1070. doi:10.1001/jamainternmed.2021.2626
¿Qué habría que medir en nuestra población antes de confiar en este número?
¿Qué le pasa a un turno que recibe alertas en uno de cada cinco pacientes?
Si el modelo falla y el paciente muere, ¿quién responde y con qué argumento?
Usted firmó el contrato. ¿Apagarlo es reconocer un error de gestión?
A. Apagarlo hoy · B. Dejarlo encendido y capacitar al personal · C. Suspenderlo hasta recalibrarlo y validarlo aquí · D. Reemplazarlo por un puntaje clínico transparente
El fabricante rehízo el modelo. La versión 2 se validó de forma prospectiva en 227.091 encuentros de cuatro sistemas de salud: AUC entre 0,82 y 0,92. Mejoró de verdad. Y aun así, el estudio reporta alta variabilidad entre instituciones, valor predictivo positivo bajo y una carga de alertas considerable, y recomienda que cada institución valide localmente antes de encender nada.
El problema nunca fue solamente que el modelo fuera malo. Fue que nadie lo había medido aquí, y que la decisión de encenderlo se tomó sin esa medición.
Las mismas cuatro afirmaciones de la primera lámina. ¿Cambió alguien de posición? ¿Por qué?
Traigan una pregunta de predicción propia, de su práctica o de su tesis, escrita en una sola frase. La vamos a someter exactamente al mismo interrogatorio de hoy.
Wong A, et al. Multicenter Prospective Validation of an Updated Proprietary Sepsis Prediction Model. JAMA Netw Open. 2026. doi:10.1001/jamanetworkopen.2026.0181