ChatGPT sobreestima el éxito de la cirugía del agujero macular de espesor total

ChatGPT-5 predijo resultados de cirugía de agujero macular con alta precisión, pero sobreestimó el éxito, evidenciando un sesgo hacia resultados favorables.

Un nuevo estudio sugiere que ChatGPT-5 puede estimar los resultados de la cirugía del agujero macular de espesor total con una precisión sorprendente, incluso superior a la de los especialistas en retina.¹ Sin embargo, los autores advierten que el chatbot sobreestimó sistemáticamente el éxito del procedimiento, especialmente en los casos en los que el agujero no se cerró o la visión no mejoró. Esto sugiere que su aparente capacidad predictiva podría reflejar un sesgo hacia resultados favorables más que un verdadero juicio clínico.

El objetivo del estudio, publicado en Retina, fue evaluar si el modelo de lenguaje de gran tamaño (LLM) ChatGPT-5 podía predecir los resultados anatómicos y funcionales a largo plazo tras la cirugía de reparación del agujero macular de espesor total (FTMH). Los investigadores compararon el rendimiento predictivo del modelo con el juicio clínico de especialistas en retina y con los resultados reales obtenidos a los 12 meses.

Se recopilaron y revisaron las historias clínicas de 50 pacientes sometidos a vitrectomía vía pars plana por FTMH en un único centro médico de Israel. Todos los pacientes tenían 15 años o más (edad media: 66,2 años) y contaban con datos preoperatorios completos, imágenes de tomografía de coherencia óptica (OCT) y seguimiento durante 12 meses. La agudeza visual basal era de 20/100 y el diámetro mínimo promedio del agujero fue de 441 µm.

Para cada caso, el equipo eliminó todos los identificadores personales y proporcionó a ChatGPT-5 un resumen clínico estandarizado que incluía edad, sexo, estado refractivo, estado del cristalino, antecedentes oculares, duración de los síntomas, mejor agudeza visual corregida (BCVA) preoperatoria, diámetro del agujero, detalles de la cirugía y un único corte B de OCT foveal. Se solicitó al modelo que predijera si la visión mejoraría, permanecería estable o empeoraría a los 12 meses; que estimara la BCVA final; y que determinara si el agujero macular lograría el cierre anatómico. Dos especialistas sénior en retina revisaron el mismo material anonimizado y realizaron predicciones independientes.

A los 12 meses, el cierre anatómico se logró en 44 de los 50 ojos (88 %), mientras que la BCVA media mejoró significativamente de 20/100 a 20/63. Desde el punto de vista funcional, 35 ojos (70 %) mejoraron al menos dos líneas ETDRS, ocho (16 %) permanecieron estables y siete (14 %) empeoraron.

ChatGPT-5 predijo el cierre anatómico en 49 de los 50 casos y una mejoría visual en 43 de los 50, alcanzando una precisión del 90 % para los resultados anatómicos (frente al 72-86 % obtenido por los especialistas en retina) y del 66 % para la predicción global de la BCVA (frente al 42-44 % de los especialistas). El chatbot identificó correctamente los 44 casos con cierre anatómico, pero no identificó cinco de los seis casos en los que no se produjo el cierre (17 % de precisión), lo que evidencia una marcada tendencia a asumir resultados favorables.

En cuanto a los resultados funcionales, ChatGPT-5 mostró su mejor desempeño cuando la visión mejoró, con una precisión del 60 % en estos casos. Sin embargo, su rendimiento disminuyó considerablemente cuando la visión permaneció estable (12,5 % de precisión) o empeoró (0 %). El error medio en la predicción de la BCVA fue de 11,4 letras ETDRS, con una mediana de ocho letras.

“A primera vista, ChatGPT-5 parecía tan eficaz como los especialistas en retina o incluso superior para predecir los resultados posoperatorios de la cirugía de FTMH”, escriben los autores. “Sin embargo, esta aparente ventaja se debió principalmente a una sobreestimación sistemática de los resultados positivos, lo que indica un sesgo hacia la predicción del cierre del FTMH y de la mejoría visual”. 

A pesar de estas limitaciones, los autores señalan que los hallazgos respaldan el potencial diagnóstico de ChatGPT-5 en los casos de FTMH. El chatbot fue capaz de reconocer hallazgos característicos en la OCT, incluidos los espacios quísticos intrarretinianos, los bordes elevados del agujero y la hipertransmisión coroidea, aunque la detección de la adhesión vitreomacular fue menos consistente.

Además, destacan: “A pesar de no haber recibido entrenamiento específico en imágenes oftalmológicas, ChatGPT-5 interpretó eficazmente la morfología de la OCT a partir de un único corte B foveal y de un resumen clínico estructurado, lo que sugiere una capacidad cada vez mayor para el razonamiento multimodal cuando se integran datos textuales y visuales”. 

En conclusión, los autores afirman: “Aunque este modelo puede proporcionar predicciones cuantitativas de la agudeza visual e interpretar imágenes de OCT, sus resultados deben interpretarse con cautela para evitar generar una confianza injustificada”. Asimismo, sostienen que, por el momento, los pronósticos generados mediante inteligencia artificial deben utilizarse únicamente como información complementaria y que los clínicos deben seguir basando sus recomendaciones en la evidencia científica y en su criterio especializado al informar a los pacientes sobre la recuperación esperada tras la cirugía de reparación del agujero macular.

Referencia:

  1. Wattad A, Saadi R, Bez M, Loewenstein A, Goldstein M. Predicting postoperative outcomes in full-thickness macular hole repair surgery – ChatGPT vs. clinical decision. Retina. 2026;46:1015-23.

https://www.reviewofophthalmology.com/article/dysphotopsia-classification-system-developed?utm_source=chatgpt.com

Scroll to Top