Repaso: alucinaciones con exceso de confianza

En la Parte 1, al pedirle a una IA generativa que analizara mapas meteorológicos, observamos errores fatales: inventó una borrasca inexistente y pronosticó "mal tiempo generalizado" cuando la zona estaba bajo un anticiclón. Más inquietante aún, la IA tampoco detectó esos errores en la fase de autoverificación, y afirmó por partida doble que "todo era completamente coherente".

¿Por qué ocurren estos fallos? ¿Se pueden corregir ajustando el prompt, o son limitaciones estructurales inherentes a la arquitectura actual de la IA? En este artículo profundizamos en las causas desde cuatro perspectivas.


Nota importante sobre el alcance de "IA" y "limitaciones" en este artículo

Cuando hablamos de "limitaciones" aquí, nos referimos al enfoque de hacer que un LLM multimodal de propósito general —como ChatGPT o Claude— lea mapas meteorológicos diseñados para humanos (en PDF o imagen). Esto es completamente distinto de los modelos especializados de predicción numérica con IA (GraphCast, Pangu, AIFS, etc.), que en los últimos años se han descrito como "listos para uso operativo".

Estos últimos no leen en absoluto la "imagen" de un mapa meteorológico. Aprenden directamente a partir de valores numéricos previos al renderizado para humanos (tensores de reanálisis como ERA5) y generan el campo numérico del siguiente instante a partir del campo numérico actual. En algunos dominios superan la precisión humana (predicción numérica operativa), como una mejora de aproximadamente un 20% en la trayectoria de tifones respecto a los métodos tradicionales.

En otras palabras, que "un LLM falle al leer la imagen de un mapa meteorológico" y que "la predicción numérica con IA sea operativa" no son afirmaciones contradictorias. Ambas pertenecen a capas distintas del stack de IA meteorológica. Salvo que se indique lo contrario, todo lo que se discute a continuación se limita al primer caso (LLM de propósito general que lee mapas dibujados). Esta distinción resulta decisiva en la Limitación 3 (véase más adelante).


Distinguir de antemano el "alcance" de las cuatro limitaciones

Las cuatro limitaciones que se presentan en este artículo no tienen todas el mismo peso ni la misma universalidad. Conviene aclarar primero hasta qué categoría de IA afecta cada una.

Limitación Naturaleza Alcance (¿hasta dónde llega?)
Limitación 1: Incompatibilidad de proyección cartográfica Exclusiva de modelos de visión. Inherente al hecho de leer imágenes Solo aplica cuando un LLM lee imágenes. Si se pasan los datos numéricos directamente, se evita: es un problema de "diseño de entrada"
Limitación 2: Dificultad para trazar isolíneas Exclusiva de modelos de visión. Ídem Solo aplica cuando un LLM lee imágenes. Si ya se tienen los valores numéricos, no hace falta seguir líneas
Limitación 3: Ausencia de modelo físico y sentido climatológico Depende de la categoría Solo aplica cuando un LLM de propósito general lee imágenes. No aplica a los modelos especializados de predicción numérica con IA (véase más adelante)
Limitación 4: Exceso de confianza Universal, independiente del tipo de modelo Afecta a toda IA generativa. Es la más fundamental y la más difícil de evitar

En resumen: las limitaciones 1 y 2 son problemas evitables si se cambia el diseño, ya que derivan de haber elegido hacer que un LLM lea un mapa dibujado. La limitación 3 depende de la categoría de IA y no aplica a los modelos especializados de predicción numérica. Y solo la limitación 4 es universalmente válida, independientemente del tipo de modelo, y es la más problemática.

Tengan presente esta diferencia de "temperatura" al leer cada sección.


Limitación 1: Incompatibilidad de proyección cartográfica — no puede reconocer un "mapa" como mapa

Los mapas meteorológicos de altura de la Agencia Meteorológica de Japón se trazan en proyección estereográfica polar (referencia: 60°N, 140°E). Se trata de una proyección azimutal centrada en el Polo Norte, donde la cuadrícula de latitud y longitud se representa como curvas.

Un meteorólogo humano puede corregir mentalmente y de forma dinámica la distorsión de esta proyección: "Por la curvatura de esta paralela, deduzco que esto no es el interior del continente, sino el Mar de Japón".

Sin embargo, los modelos de reconocimiento de imágenes de IA procesan la imagen como una matriz 2D de píxeles y no disponen internamente de un motor para realizar transformaciones de coordenadas de forma dinámica. Aunque el prompt indique "analiza con proyección estereográfica polar", eso no genera un SIG (Sistema de Información Geográfica) en el interior del modelo.

Como resultado, la IA interpreta la "posición relativa" en pantalla de forma plana y literal, cometiendo errores de percepción espacial como:

  • "Teletransportar" una borrasca situada sobre el continente y ubicarla cerca de Kyushu
  • Confundir la latitud 40° con la 50°
  • Juzgar erróneamente si una isolínea afecta o no a Japón

El fenómeno observado en el caso real —"generó un pronóstico de mal tiempo teletransportando una borrasca continental hasta las cercanías de Kyushu"— es el ejemplo más típico de esta limitación.

Cabe señalar que esta es una limitación inherente al hecho de que un modelo de visión lea una imagen. Dicho de otro modo, si desde el principio se pasan los datos numéricos con coordenadas y latitud/longitud en formato de texto, este problema no se produce en principio. Recuerden que la Limitación 1 es también un problema de "diseño de entrada".


Limitación 2: Baja capacidad para descomponer información visual densa — dificultad para "seguir líneas"

Los mapas meteorológicos especializados contienen infinidad de curvas superpuestas sin etiqueta: isolíneas de altura, isotermas, líneas de temperatura potencial equivalente, barbas de viento, símbolos de frentes, etc.

Un meteorólogo humano puede fijar la vista en una sola línea y seguirla de extremo a extremo (trazarla). Para la IA, esto es extremadamente difícil.

Los modelos de visión actuales:

  • Son buenos reconociendo objetos aislados y caracteres (por ejemplo, etiquetas como "H", "L", "1018")
  • Son muy malos rastreando una curva sin etiqueta distinguiéndola de otras líneas en un entorno denso

Por eso, al analizar zonas frontales o vaguadas donde las líneas se acumulan, la IA suele conformarse con un reconocimiento de textura aproximado del tipo "hay muchas líneas por aquí, así que debe de ser una zona frontal". Esta es la causa raíz de los errores al leer el gradiente de temperatura potencial equivalente o la posición del máximo de vorticidad.

Al igual que la Limitación 1, este es también un problema derivado de haber elegido "hacer que la IA lea una imagen". Si se pudiera trabajar directamente con los valores numéricos en puntos de rejilla que dieron origen a las isolíneas, la tarea de trazar líneas visualmente sería innecesaria.


Limitación 3: Ausencia de modelo físico y "sentido climatológico" — pero solo cuando un LLM de propósito general lee imágenes

Un meteorólogo humano lee los mapas con conocimientos de dinámica de fluidos y termodinámica. Por eso puede activar de forma natural una alarma física y climatológica (metacognición) ante situaciones como:

  • "¿La superficie está bajo un anticiclón (1018 hPa) pero hay una fuerte corriente ascendente en 700 hPa? Algo no cuadra."
  • "¿Una masa de aire de pleno invierno y una borrasca de 996 hPa en Kyushu en abril? Climatológicamente imposible."

Un LLM de propósito general que lee mapas dibujados carece de esto. No tiene una rejilla tridimensional de la atmósfera en su interior ni un motor de cálculo de dinámica de fluidos. Solo "habla" de fenómenos meteorológicos como una secuencia probabilística de texto.

Por eso su comportamiento es:

  • Yuxtaponer sin problema interpretaciones físicamente contradictorias entre distintos niveles del mapa
  • No reconocer como "anómalos" valores extremos para la estación y simplemente emitirlos
  • Ser incapaz de verificar a posteriori si su propia salida es coherente con las leyes naturales

La descripción observada en el caso real —"un frente frío pasa cerca del centro de un anticiclón"— es una contradicción lógica que cualquier humano detectaría al instante, pero el LLM de propósito general la escribe hasta el final sin percatarse de la incoherencia.

Matización importante: esta no es una limitación de "la IA en general"

Lo que quiero subrayar aquí es que la Limitación 3 solo se cumple en el caso concreto de "hacer que un LLM de propósito general, no entrenado específicamente en meteorología, lea un mapa meteorológico dibujado para humanos". Extenderla a la proposición general de que "la IA no entiende la física" sería contrario a los hechos.

En efecto, los modelos especializados de predicción numérica con IA (GraphCast, Pangu, AIFS) refutan los tres puntos anteriores (basado en la conferencia del Dr. Tsuyoshi Sekiyama del Instituto de Investigación Meteorológica).

  • No solo "no carecen" de una rejilla tridimensional, sino que esta es su núcleo. Estos modelos dividen la Tierra en una rejilla tridimensional y mantienen el estado de la atmósfera en ella. Existen implementaciones como modelos con rejilla estirada que resuelven el entorno de Japón con una malla de 5 km. "No tener rejilla tridimensional interna" es algo propio de los LLM de propósito general; los modelos especializados precisamente tienen un campo de estado tridimensional que evolucionan en el tiempo.
  • La estimación de parámetros físicos es, en algunos casos, mejor que la humana. Los modelos especializados de predicción numérica con IA aprenden el comportamiento físico a partir de datos de reanálisis y, para ciertos parámetros, superan a los humanos (predicción numérica convencional).
  • Se puede inyectar física en la función de pérdida (Physics-informed). Al incorporar la coherencia física en la propia función objetivo del entrenamiento, se puede restringir que la salida se desvíe de las leyes físicas. No se "espera la física a posteriori", sino que se integra en la fase de diseño.
  • Tampoco son cajas negras. Existen técnicas para examinar el estado interno y rastrear en cierta medida en qué se basa el pronóstico. La imagen de una "caja opaca cuyo interior se desconoce" no es necesariamente acertada.

Resumen de la Limitación 3: Las críticas de "sin modelo físico / sin rejilla tridimensional / incapaz de detectar contradicciones / caja negra" solo se sostienen cuando un LLM de propósito general lee un mapa meteorológico dibujado. No aplican a los modelos especializados de predicción numérica con IA. Como este artículo trata el primer caso, la Limitación 3 es un obstáculo real, pero no debe reinterpretarse como "una limitación física de la IA en general". Confundir las categorías llevaría a la generalización errónea de que "la IA no sirve para la meteorología".


Limitación 4: Exceso de confianza (overconfidence)

Técnicamente, las Limitaciones 1 a 3 pueden parecer el núcleo del problema, pero la más peligrosa en términos de daño real, y la que actúa de forma universal independientemente del tipo de modelo, es esta. Las Limitaciones 1 y 2 se pueden evitar con un diseño de entrada adecuado, y la Limitación 3 depende de la categoría, pero la Limitación 4 no tiene esa escapatoria.

Los grandes modelos de lenguaje están entrenados y ajustados para "generar respuestas de forma fluida, verosímil y con un tono autoritativo". Aunque internamente la certeza sea del 10%, en la salida se convierte en frases como:

  • "Se puede afirmar que…"
  • "Se prevé que…"
  • "Se ha verificado que…"

…expresadas con una confianza del 100%.

Esto impide que el usuario distinga "hasta dónde ha leído realmente la IA y a partir de dónde está especulando". La salida observada en la Parte 1 —"se ha verificado que es completamente coherente"— fue el resultado de que un procesamiento interno vacilante quedó sobreescrito por un tono de total seguridad.

Lo que hace que las alucinaciones sean tan peligrosas no es el error factual en sí, sino que se presentan con un tono de plena confianza.


La pregunta práctica: ¿qué pasa con los mapas de superficie en color?

Aquí surge una pregunta concreta:

Los mapas ASAS y FSAS tienen información textual y están codificados por colores. Si se indica explícitamente que se analice con proyección estereográfica polar, ¿no podría alcanzarse un nivel práctico al menos para los mapas de superficie?

Esto es mitad correcto, mitad aún limitado.

Mejoras esperables:

  • La precisión de extracción de elementos con alto contraste y acompañados de información textual —como "línea roja (frente cálido)", "línea azul (frente frío)", "valor de presión central"— mejora claramente
  • Los errores de reconocimiento de disposición geográfica general —como "la borrasca está al norte de Hokkaido"— se reducen considerablemente

Limitaciones que persisten:

  • Como no se genera un motor SIG dinámico en el interior de la IA, la transformación precisa de coordenadas de latitud y longitud sigue siendo imposible
  • La tarea de leer cuantitativamente el gradiente de presión a partir del número e intervalo de isobaras sigue siendo difícil

En resumen, si nos limitamos a mapas de superficie con abundante información en color y texto, aumenta la probabilidad de evitar los errores espaciales más graves. Esto constituye una mitigación de riesgo válida.

Por el contrario, parece más sensato asumir que el análisis visual de mapas de altura en blanco y negro con líneas densas (FXJP854, FXFE502, etc.) es, por ahora, inviable.


La idea del reparto de roles — ¿qué le encomendamos a la IA y qué reservamos para los humanos?

A la vista de estas limitaciones, surge de forma natural la siguiente filosofía de diseño:

Dejar de esperar que la IA sea un "analista perfecto" y posicionarla como un "asistente que extrae datos y presenta listas de verificación teóricas"

En concreto:

Tarea Responsable Motivo
Extracción de información textual (presión central, parámetros de tifones) IA El procesamiento tipo OCR es su punto fuerte
Reconocimiento general de la disposición en mapas de superficie en color IA Alto contraste
Verbalizar "los puntos clave a verificar a continuación" IA La generación de texto es su especialidad
Trazado de isolíneas en mapas de altura Humano Limitación de los modelos de visión (Limitación 2)
Juicio final sobre la coherencia física entre niveles Humano Difícil para un LLM que lee mapas dibujados (Limitación 3)
Detección de anomalías climatológicas Humano Requiere metacognición

Esta idea se concretará en la Parte 3, donde la trasladaremos a un diseño de prompts específico y a la implementación en un servicio real.


Nota adicional: ¿pueden los prompts estructurados eliminar las alucinaciones?

A partir de la experiencia de probar varios "prompts estructurados para que la IA analice con precisión", lo que puedo decir es que superar las Limitaciones 1 a 4 solo con ajustes de prompt es, a día de hoy, imposible.

Sin embargo, sí es posible orientar el comportamiento para que las alucinaciones sean menos frecuentes. Las claves son tres:

  1. Forzar la "prohibición de especular" y la "declaración de ilegibilidad" — permitir que la salida sea "Ilegible (Unreadable)"
  2. Hacer que la IA practique la metacognición — que declare desde el principio "en esta zona del mapa las líneas están muy densas y mi nivel de certeza es bajo"
  3. Convertir la detección de contradicciones físicas y climatológicas en la tarea central — que el protagonismo no sea crear un escenario de pronóstico, sino "verificar la coherencia de los datos"

El diseño de prompts que incorpora estos elementos, y cómo gestionar los riesgos que persisten (advertencias al usuario), se tratarán en detalle en la Parte 3.


Conclusión

Las limitaciones que tiene actualmente la IA generativa cuando se usa para leer mapas meteorológicos dibujados son estructurales y van más allá de lo que se puede resolver ajustando prompts. Sin embargo, el alcance de cada limitación es distinto.

  • Limitación 1: No puede corregir dinámicamente la distorsión de la proyección cartográfica y comete errores de geolocalización (exclusiva de modelos de visión; evitable si se pasan los datos numéricos directamente)
  • Limitación 2: No puede trazar isolíneas densas y se conforma con el reconocimiento de texturas (exclusiva de modelos de visión; ídem)
  • Limitación 3: Carece de modelo físico y sentido climatológico, y no detecta las contradicciones en su propia salida (solo aplica cuando un LLM de propósito general lee imágenes; los modelos especializados de predicción numérica con IA aprenden física y no les aplica)
  • Limitación 4: Independientemente de su certeza interna, siempre emite respuestas con un tono de plena confianza (universal, independiente del tipo de modelo; la más fundamental)

Sería imprudente ser optimista y pensar que "los modelos de próxima generación resolverán esto automáticamente", pero también sería excesivo afirmar que "es imposible en principio y la estructura no cambiará en años". De hecho, en el campo de la predicción numérica con IA, el AIFS de ECMWF se operacionalizó más rápido de lo que muchos expertos predecían, lo que demuestra que la tecnología de IA meteorológica ha avanzado a un ritmo que supera las expectativas. La capacidad de los LLM multimodales para leer gráficos y tablas podría no ser una excepción.

Por tanto, la postura de este artículo es: "Difícil a día de hoy. Pero sin subestimar la velocidad de avance, hay que revisar periódicamente." Y la conclusión práctica sigue siendo inamovible: al menos por ahora, es imprescindible un diseño que no delegue todo en la IA, y la responsabilidad de detectar las mentiras al final no debe abandonarla el ser humano.

En la próxima entrega abordaremos, partiendo de estas limitaciones, cómo integrar la IA en un servicio real: el diseño de uso como "copiloto" en una aplicación meteorológica como Tenkiz Port.

Continúa → Parte 3: El camino hacia la aplicación práctica — Diseño de uso de la IA como "copiloto"