Saltar al contenido

Cuando la IA se equivoca con las preguntas de salud

Chatbots de IA y consultas de salud: lo que revela el nuevo estudio de BMJ Open

Cada vez más personas recurren a herramientas como ChatGPT o Gemini para resolver dudas sobre salud, nutrición deportiva y rendimiento. Entre ellas hay deportistas, entrenadores y profesionales. El problema es que una respuesta fluida no es necesariamente una respuesta correcta. Un nuevo artículo publicado en BMJ Open, liderado por el Dr. Nick Tiller y con participación de investigadores de referencia, auditó la fiabilidad de cinco chatbots populares frente a preguntas especialmente expuestas a la desinformación. Los resultados deberían interesar a cualquier nutricionista deportivo.

Qué analizó el estudio

El trabajo, titulado “Generative artificial intelligence-driven chatbots and medical misinformation: an accuracy, referencing and readability audit”, evaluó cinco chatbots de acceso público: Gemini, DeepSeek, Meta AI, ChatGPT y Grok.

Diseño de la auditoría

  • Fecha de las pruebas: febrero de 2025.
  • Volumen: 50 preguntas por chatbot (250 respuestas en total).
  • Categorías: cáncer, vacunas, células madre, nutrición y rendimiento deportivo.
  • Tipos de pregunta: cerradas y abiertas, formuladas a propósito para empujar a los modelos hacia mitos habituales o consejos contraindicados.
  • Evaluación: respuestas puntuadas por expertos en cada materia, auditoría de la exactitud y la integridad de las citas, y medición de la legibilidad con escalas estándar.

Este diseño es relevante porque en la práctica real las personas no formulan preguntas limpias y neutras. Preguntan desde la confusión, el miedo, los titulares, las redes sociales y sus creencias previas. Probar los modelos bajo presión es la forma de estimar su riesgo real.

Principales hallazgos

Casi la mitad de las respuestas fueron problemáticas

El 49,6 % de las respuestas se clasificó como problemático: un 30 % como algo problemático y un 19,6 % como muy problemático. Es decir, aproximadamente una de cada cinco respuestas tenía un problema grave.

Aspecto Resultado
Respuestas algo problemáticas 30 %
Respuestas muy problemáticas 19,6 %
Categorías con mejor desempeño Vacunas y cáncer
Categorías con peor desempeño Células madre, rendimiento deportivo y nutrición
Negativas a responder 2 de 250 (ambas de Meta AI)
Completitud mediana de las referencias 40 %
Nivel de legibilidad “Difícil” (equivalente a nivel universitario)

Nutrición y rendimiento, entre las áreas más débiles

Los chatbots se comportaron mejor en vacunas y cáncer, y peor en células madre, rendimiento deportivo y nutrición. Dos de los tres ámbitos más débiles son justo aquellos en los que deportistas y profesionales pueden recurrir más a la IA. Además, son campos saturados de afirmaciones comerciales, mensajes simplistas y pseudociencia.

Las preguntas abiertas generan más errores

Las preguntas cerradas produjeron menos respuestas muy problemáticas que las abiertas. Cuanta más libertad tiene el modelo para generar texto, más espacio hay para la especulación, el falso equilibrio y los consejos sin respaldo científico. Es un dato útil para quien redacta prompts en su práctica profesional.

Casi nunca se abstienen de responder

De 250 preguntas, solo hubo dos negativas a responder, ambas de Meta AI. Los sistemas suelen ofrecer una respuesta aunque la cautela, la derivación a un profesional o la negativa fueran la opción más segura.

El problema de las referencias científicas

La auditoría de citas fue una de las partes más reveladoras. Al pedirles referencias científicas, los chatbots devolvieron con frecuencia citas incompletas, inexactas o directamente inventadas.

  • Ningún chatbot generó una lista de referencias completa y exacta para ninguna de las preguntas.
  • La completitud mediana fue de solo el 40 %.
  • Incluso los modelos con mejor desempeño estuvieron lejos de ser fiables.

Las referencias generan confianza. Si el lector ve autores, revistas y títulos, asume que la respuesta se apoya en evidencia. Pero si esas citas son erróneas o ficticias, la respuesta solo parece científica: es credibilidad sin verificación. Que un chatbot aporte referencias no lo vuelve fiable, y en ocasiones las propias citas requieren tanto escrutinio como la respuesta.

Legibilidad: respuestas pulidas, pero demasiado complejas

En promedio, todos los modelos produjeron respuestas calificadas como “difíciles”, comparables a un nivel de lectura universitario. Para información de salud dirigida al público general, esto está lejos de ser ideal. La combinación resulta incómoda: textos fluidos, seguros de sí mismos y de apariencia científica, pero a menudo demasiado complejos para el lector medio y poco fiables para justificar tanta confianza.

Implicaciones para el deporte y la nutrición deportiva

La IA ya forma parte del deporte actual: influye en el reclutamiento, la planificación del entrenamiento, las decisiones tácticas y los sistemas de apoyo. En nutrición deportiva, los profesionales y los atletas interactúan con ella a diario mediante puntuaciones de disponibilidad (readiness), retroalimentación automatizada, resúmenes de recuperación e interpretación de datos.

El estudio refuerza una idea clave: los profesionales que más se benefician no son quienes rechazan la IA ni quienes confían ciegamente en ella, sino quienes entienden dónde es fiable y dónde no. Si un modelo se entrena con información de calidad dispar y la presenta con autoridad, el resultado puede parecer mucho más sólido de lo que realmente es.

El verdadero debate: criterio profesional, no sustitución

La cuestión de fondo no es si la IA reemplazará a los profesionales, sino quién ejerce el criterio. La IA puede ayudar a organizar, resumir y acelerar tareas, pero la valoración de la evidencia, el contexto, la ética y la toma de decisiones siguen dependiendo de profesionales con conocimientos. La experiencia humana no es un complemento opcional, sino un elemento central para un uso seguro y eficaz.

La implicación más amplia

La conclusión principal de los autores es sencilla: sin educación pública y supervisión, la IA corre el riesgo de amplificar la desinformación en lugar de reducirla. Importan las herramientas, pero también los datos con los que se entrenan, cómo se despliegan, las salvaguardas que incorporan y el conocimiento de quien las usa. En salud, medicina y nutrición deportiva, la fluidez del lenguaje no debe confundirse con comprensión. Una respuesta pulida puede ser errónea, una respuesta segura puede inducir a error y una lista de citas puede ser inventada.

Conclusiones prácticas para nutricionistas deportivos y estudiantes

  • Usa la IA para tareas de apoyo: estructurar información, agilizar trabajo rutinario y preparar borradores iniciales.
  • No delegues la interpretación de evidencia ni las decisiones clínicas: en ámbitos complejos como nutrición y rendimiento, la cautela es imprescindible.
  • Verifica siempre las referencias: comprueba que existan en PubMed u otras bases de datos y que digan lo que el chatbot afirma.
  • Cuestiona las respuestas seguras: contrasta con guías de consenso, revisiones sistemáticas y posicionamientos de sociedades científicas.
  • Formula preguntas concretas y cerradas cuando sea posible, ya que las abiertas aumentan el riesgo de respuestas muy problemáticas.
  • No confundas legibilidad o fluidez con calidad: un texto bien escrito no es sinónimo de un texto correcto.
  • Educa a tus deportistas y pacientes: los chatbots son cómodos, pero la comodidad no equivale a fiabilidad.
  • Refuerza tu pensamiento crítico: la buena práctica basada en la evidencia sigue dependiendo del conocimiento profundo y del juicio profesional.

Referencia

Tiller NB, Marcon AR, Zenone M, Kidd KE, Jeukendrup AE, Master Z, Caulfield T. Generative artificial intelligence-driven chatbots and medical misinformation: an accuracy, referencing and readability audit. BMJ Open. 2026;16:e112695. doi: 10.1136/bmjopen-2025-112695

Analizado e interpretado por inteligencia artificial de Anthropic model claude-sonnet-4-6.
Publicación Original