Mostrando entradas con la etiqueta mapas. Mostrar todas las entradas
Mostrando entradas con la etiqueta mapas. Mostrar todas las entradas

31 de julio de 2020

¿Por qué cambiar las escalas de colores en los mapas?

Fíjense en estos dos mapas. Los dos proceden de la web de Instituto Carlos III, en la sección llamada "Panel Covid-19". El color de las provincias se refiere a la incidencia acumulada del virus durante la última semana (lunes a domingo) disponible, expresada en número de casos detectados por 100.000 habitantes.

Este era el mapa disponible en la versión de la web actualizada el 3 de julio, con datos de la semana del 22 al 28 de junio:



Y este es el mapa disponible ahora mismo, actualizado ayer 30 de julio, con datos de la semana del 20 al 26 de julio:



Un primer problema con estos mapas es que la graduación de la paleta de colores es tan tenue que es difícil ver diferencias que pueden ser importantes. Por ejemplo, en la versión publicada ayer, es prácticamente imposible ver ninguna diferencia entre, pongamos, Lugo, Asturias y Cantabria, que tenían, en la semana de referencia, 8,50, 2,05 y 7,06 casos por 100.000 habitantes, respectivamente. La diferencia entre Granada (6,89) y Almería (31,95) es ligeramente más observable. Pero la gama de colores parece sugerir que fuera de Aragón y Cataluña casi todas las provincias se movieran en una banda de datos muy estrecha. No es así en realidad, pero la paleta de colores elegida, que me parece muy poco afortunada, impide ver las diferencias que no sean estruendosas.

Por otro lado, comparando los dos mapas, la impresión es que estamos un poco peor ahora que a finales de junio. El virus se ha extendido más por Aragón y Cataluña, algo por Navarra, y en los demás territorios parece que todo está igual que hace un mes. Sin embargo, en la semana acabada el 28 de junio, representada en el primer mapa, estábamos en 4,16 casos por 100.000 habitantes, de media, en España, y en la semana terminada el 26 de julio estamos en 27,28 casos, unas siete veces más.

¿Cómo es que los mapas son tan parecidos? Pues porque la escala de colores de estos mapas, que yo he dejado fuera deliberadamente en los recortes que les he presentado arriba, ha cambiado, y mucho.

A la izquierda, la escala de colores del mapa publicado el 3 de julio, a la derecha la del mapa del 30 de julio:








Lo que el 3 de julio era el valor máximo, azul oscurísimo (Lleida, con 85,99 casos por 100.000 habitantes), está en el mapa del 30 de julio por debajo de la mitad de la escala, (Navarra, con 80,55 casos). De hecho, en el mapa del 30 de julio parecería que Lleida está mejor que en el del 3 de julio, cuando en realidad ha subido de 85,99 casos a 202,56.

Da la impresión de que cada semana se recalculan las escalas, jugando solo con un color (azul) y dejando que el programa haga la distribución lineal de colores entre el máximo de la semana y el valor cero. Como la mayoría de los valores están agrupados en la banda baja, el resultado es un mapa poco legible, como he señalado. Y además, los mapas de cada actualización son incomparables con los publicados anteriormente.

El caso es muy parecido al que se discutía en Twitter hace unos días, sobre los mapas publicados por el estado de Georgia:
El tuit produjo una interesante conversación. Algunas respuestas señalaban simplemente que estos mapas no tenían la intención de mostrar cambios en el tiempo, sino solo diferencias entre lugares en un momento dado, y que por lo tanto no había problema en los cambios de escalas (que al avanzar el mes fueron haciéndose mayores: el color rojo unos días más tarde denotaba lugares con más de 11.000 casos acumulados por 100.000 habitantes).

Lo mismo sucede en el caso del Instituto Carlos III: la web ofrece en cada momento un solo mapa (en realidad, en cada actualización están disponibles el mapa de una semana y la anterior, con la misma escala). Si el lector tiene en la memoria una idea vaga de los mapas de semanas anteriores, que ya no están en la web oficial (como el que yo he recuperado, usando la Internet Wayback Machine), es cosa suya, y no hay una presentación engañosa, uno junto a otro, de mapas con escalas diferentes.

Y en efecto, es casi seguro que no estamos ante un intento deliberado de engañar, sino más bien ante un uso poco meditado de las herramientas informáticas, porque sí, el visitante habitual de esta web tendrá en su memoria los mapas de semanas pasadas, y la constante revisión de las escalas dificulta una buena recepción de la información. Es como si los mapas de colores de las temperaturas en los mapas del tiempo cambiaran a lo largo del año, para adaptarlos a las bandas de temperaturas presentes en cada momento, y así el rojo intenso representara temperaturas de más de 40 ºC en verano, de 25 ºC en otoño y de 15 ºC en invierno. No sería buena idea.

Y creo que lo que hace el Instituto Carlos III tampoco lo es, la verdad.

2 de abril de 2019

Otro día, otra infografía inútil

En los comentarios a mi entrada del domingo, donde criticaba un mapa de España que coloreaba las provincias por el número absoluto de fallecidos, me alerta un lector de que El País publicaba el mismo domingo otro mapa igualmente inútil. Es este:



Esta vez no es por provincias, sino por comunidades autonómas, y no se colorean, sino que se representan sobre ellas burbujas de diferentes tamaños  (que afortunadamente, al menos, sí que tienen áreas proporcionales a los números que repesentan, algo hemos aprendido).

Pero el problema principal persiste: la información es poco útil porque lógicamente, en valores absolutos, los números más altos corresponden a las comunidades autónomas con más población. O más bien, esto sucede aproximadamente así, no del todo así. Si usted se sabe los tamaños de población aproximados de las comunidades autónomas, o al menos el orden entre ellas, verá en ese mapa "cosas raras": el número mayor está en Cataluña, no en Andalucía; la Comunidad Valenciana tiene más personas en espera que Madrid; Castilla-La Mancha muchas más que comunidades con población similar o mayor, como País Vasco, Castilla y León o Galicia...

Todo ello es interesante, y apunta a qué comunidades pueden estar mejor o peor que la media... Pero sólo se desprende del gráfico si el lector le añade sus propios conocimientos y empieza a hacer cálculos. Cosa que sería innecesaria si El País hubiera simplemente calculado, para representar sobre el mapa, los pacientes en espera por 1.000 o 10.000 habitantes, lo que requiere apenas unos minutos, muchos menos que los dedicados a aspectos formales de la infografía.

También podrían haber usado el mapa para representar otros datos que aparecen más tarde en el texto, como el número medio de días de espera hasta la operación o el porcentaje de pacientes con más de seis meses de espera. Ambas son variables que no dependen de los números absolutos, y por tanto, que apuntan por sí mismas, sin cálculos mentales del lector, hacia qué comunidades lo hacen mejor o peor en la gestión de este tema.

El número absoluto de pacientes no nos sirve para eso. Nunca. Da igual que usemos tablas, mapas coloreados, diagramas de barras, burbujas, o pirámides. No dan información valiosa y comprensible al lector, salvo que este use conocimientos previos, y haga cálculos mentales, que serán siempre imprecisos e incompletos. Por enésima vez: la infografía que no ayuda al lector a comprender mejor la información es una pérdida de tiempo y espacio. Un mínimo esfuerzo cambia un mapa inútil por un mapa muy informativo. ¿Por qué no se hace?

31 de marzo de 2019

¡Qué bien se está en Soria, que no se muere nadie!

Me escribe Antonio (gracias) señalando una noticia del Diario de Sevilla que dice que "Los hombres sevillanos, los que menos esperanza de vida tienen de España". Es un dato relevante y reseñable para los lectores de ese periódico, sin duda, así que en este caso la "localización" de la estadística de mortalidad parece claramente adecuada.

En realidad, el titular no es completamente exacto, como reconoce la propia noticia, porque Sevilla sólo tiene el valor mínimo si se excluye a los varones nacidos en Ceuta y Melilla. Dada la peculiaridad de esas poblaciones, su pequeño tamaño, y las limitaciones de los titulares, la licencia parece admisible. Hubiera sido más exacto decir algo como "Sevilla, la provincia con menor esperanza de vida masculina", dado que las ciudades del norte de África no son provincias. Pero el mensaje real, para el lector que no se adentrara en el texto, sería el mismo.

Lo que sí es más criticable es el poco cuidado de la redacción, ya que tras exponer los datos de Sevilla, y de otras dos provincias andaluzas con relativamente baja esperanza de vida, y explicar la exclusión de Ceuta y Melilla, la noticia dice lo siguiente:
La esperanza de vida media en España es de 84 años en los hombres y 89 años en las mujeres. Madrid es la provincia donde los hombres son más longevos (81,91 años) y Soria en la que las mujeres viven más (88,08 años). 
¿Notan ustedes algo raro? En efecto, el valor medio no puede ser mayor que el valor máximo. Es matemáticamente imposible que la media nacional de cualquier variable sea más alta que el valor máximo de esa variable en una provincia. Lo mismo pasaría con una media europea de cualquier cosa y los valores medios de cada país.

Aparte de la contradicción lógica, el párrafo plantea el misterio sobre el origen del error. Es decir, los datos de Madrid y Soria son correctos, y el error está en las medias nacionales. Las correctas son 80,37 años para los hombres y 85,73 para las mujeres. ¿De dónde salen los 84 y 89 años que aparecen en la noticia? Es difícil saberlo, aunque una posible pista es que la esperanza de vida a los 65 años, que también está en la web del INE, es de 19,12 años para los hombres y 22,97 años para las mujeres, lo que equivale a llegar a los 84,12 años en el caso de ellos y a los 87,97 años en el de ellas. En el caso de los varones, el dato, redondeado, coincide con el que aparece erróneamente en la noticia; en el de las mujeres, se acerca, pero no llega (se quedaría en 88 años).

En fin, no sabemos de dónde viene, pero en todo caso es un dato erróneo e intrínsecamente contradictorio con el resto de los datos de la noticia (que incluye un gráfico con la esperanza de vida de todas las provincias).

Para acabar de estropear la cosa, la noticia sobre esperanza de vida se completa con un mapa que colorea las diferentes provincias... ¡por el número total de fallecidos en cada una en el año 2017! Sí, aquí lo tienen:

Mapa de España con las provincias coloreadas, de más claro a más oscuro, según el número de fallecidos en el año 2017





















¡Qué sorpresa! El año pasado murieron más de 25.000 personas en provincias como Madrid, Barcelona, Valencia, Alicante, Sevilla... y en cambio murieron menos de 1.143 personas (punto de corte grotesco, por otra parte) en Palencia, Soria, Segovia, Ávila, Guadalajara... La provincia donde menos gente murió fue Soria, con 649 fallecidos. Con Segovia y Teruel, son las únicas provincias donde murieron menos de 1.000 personas. ¡Qué suertudos! No se entiende que estén justo hoy por Madrid quejándose de los problemas de la España vacía. Si leyeran el Diario de Sevilla se darían cuenta de lo bien que les va, en realidad.

Obviamente no, claro. Es un mapa irrelevante y sin valor, por caer en un error fácil de entender. De hecho, se acerca bastante al ejemplo completamente absurdo, inimaginable, que yo proponía hace 14 años:
Si yo les dijera que Madrid, Cataluña y Andalucía son las comunidades autónomas de España donde más gente muere cada año, y que en La Rioja, Ceuta y Melilla es donde menos gente muere, y que por lo tanto, si quieren ustedes vivir muchos años, deberían mudarse a una de esas tres comunidades, supongo que me responderían que soy imbécil. Claro que muere más gente cada año en Madrid que en La Rioja: en Madrid hay casi seis millones de habitantes y en La Rioja rondan el cuarto de millón.

Comparar las cifras absolutas de cualquier fenómeno relacionado con la población entre territorios con una población muy diferente es un disparate. Pero es un disparate que aparece con cierta frecuencia en nuestros medios.
Disparate en 2005, disparate en 2019. Y sin embargo, era fácil de evitar: el mapa se podía haber hecho con los datos, precisamente, de la esperanza de vida, que la propia noticia maneja. Y eso habría permitido, tal vez, ver patrones geográficos con algún interés. En su lugar, un mapa que nos dice lo que ya sabemos. Un desperdicio.

22 de febrero de 2017

Los peligros de la moda

Cuando doy algún curso de estadística básica suelo incluir una sección explicando que para resumir una información numérica de una serie de casos hay otras herramientas distintas a la media, y que son a veces preferibles, pero no siempre.

Una de esas herramientas es la moda, que es simplemente el valor más común. Por ejemplo, en 2015 esta era la distribución de los hogares españoles por número de personas que vivían en ellos (Encuesta Continua de Hogares, INE):


Total% vertical
Total18.346,20100,00%
1 persona4.584,2024,99%
2 personas5.606,7030,56%
3 personas3.854,7021,01%
4 personas3.243,2017,68%
5 personas818,34,46%
6 personas177,40,97%
7 personas39,40,21%
8 personas o más22,10,12%


El tamaño medio era de 2,51 personas, pero la moda era 2, simplemente porque dos era el valor más frecuente: había más hogares con dos personas que hogares de cualquier otro tamaño.

Ahora bien, que la moda sea 2 no quiere decir que la mayoría de los hogares tengan dos residentes. Como se ve en la tabla los hogares con dos personas son solamente el 30,56% de los hogares. Algo menos de un tercio. Dos es el tamaño más frecuente, si se compara con cada uno de los otros tamaños posibles de hogar, uno a uno. Pero dos no es más frecuente que todos los demás tamaños de hogar juntos. 

Por definición, la moda es simplemente el valor más frecuente de todos los valores considerados, pero no tiene por qué ser el valor mayoritario, es decir el valor que tienen la mitad más uno más de la mitad de los casos considerados. De hecho, cuando el número de valores diferentes es muy grande, la moda puede que sea un valor que tenga solo un 10% o un 5% de los casos. Es "el más común" comparado con cada uno de los otros. Pero no debe confundirse  "el más común" con "el mayoritario".

Veamos lo que sucede, como ilustración, en esta tabla que representa la estructura de población por edades de una sección censal de la ciudad de Madrid, tomada de la última estimación del padrón:


EdadesPoblación% vertical
0-4423,90%
5-9363,40%
10-14333,10%
15-19242,20%
20-24373,50%
25-29686,30%
30-34948,80%
35-39868,00%
40-44676,30%
45-49837,70%
50-54716,60%
55-59928,60%
60-64787,30%
65-69484,50%
70-74403,70%
75-79464,30%
80-84484,50%
85-89494,60%
90-94222,10%
95-9960,60%
100 y más10,10%


La moda es la edad de 30 a 34 años (marcada en verde). Es el valor "más frecuente" ya que, individualmente considerado, ningún otro grupo de edad tiene más habitantes. Pero no es el valor "mayoritario", ni "el más común" en el sentido de que sea más frecuente que todos los demás juntos. Ni muchísimo menos: sólo el 8,8% de los habitantes de esa sección tienen esa edad.

[Actualización: como me han hecho ver en los comentarios, con el diccionario en la mano parece que soy yo el que está equivocado al identificar "mayoritario" con "mayor de la mitad". Es cierto. Aún así, creo que yo nunca escribiría que "la mayoría de los residentes en España tienen de 40 a 44 años". En todo caso, mi crítica principal al uso de la moda tiene que ver con los párrafos siguientes, que no se ven afectados por esta cuestión lingüística.]

La tabla ilustra otro asunto importante: aunque la moda es un concepto fácilmente comprensible (lo más frecuente) puede ser también, en ocasiones como esta, en la que hay muchos valores, con frecuencias similares, un poco errático. El segundo valor más frecuente es de la edad de 55 a 59 años (marcada en rosa). Y tiene solo dos personas menos que el valor modal. Es decir, que un mínimo cambio de tres personas más en un grupo o en otro nos llevaría a decir que la edad modal de esa manzana de casas es de 55 a 59 años. Una edad 25 años superior a la que obtenemos ahora, que nos daría una impresión subjetiva muy diferente, sin que la estructura de edad cambiase apenas nada. 

En todo caso, la cuestión clave aquí es que la moda es el valor más frecuente, pero no "el mayoritario". Cuando hay muchos valores distintos, como en este caso, casi seguro que no es mayoritario. Seguramente está muy lejos de serlo. Y es posible que además no sea particularmente "representativo" de la población de que se trate.

Todo esto se les ha escapado a los amigos de El Confidencial que han volcado en un mapa de España, a partir de la misma fuente de la que procede la tabla anterior, la edad modal de todas las secciones censales de España (gracias a Carlos García por la pista). La intención es estupenda, pero hay dos problemas importantes.

Primero, que el texto confunde continuamente la edad modal ("más común") con la edad "mayoritaria". Para empezar, en el propio mapa, la leyenda indica que cada color representa un "grupo de edad mayoritario" y la misma expresión aparece en el cuadro flotante con el nombre del municipio y el número de sección cuando pasamos el ratón por las diferentes partes del mapa. En una gráfica se representa también la distribución de las secciones según cual sea la edad "mayoritaria". Y en el texto se repite varias veces la idea de que lo representado en los diferentes lugares es el grupo "mayoritario".

Pero no, pese a lo que diga el mapa los menores de 5 años no son el grupo "mayoritario" en Navares de las Cuevas (Segovia), ni en ninguna otra parte (probablemente). Y en La Riba de Escalote (Soria), los 4 habitantes de 90 a 94 años que había el 1 de enero de 2016 no eran tampoco la "mayoría" de los 15 habitantes empadronados.

Segundo: como he señalado antes la moda puede ser un poco errática en su comportamiento. Diferencias muy pequeñas entre secciones censales similares pueden dar lugar a que la moda sea distinta en 20 o en 30 años. Un ejemplo entre cientos que podríamos encontrar: la sección censal de Madrid cuya tabla hemos visto antes con moda 30-34 años es vecina de otra con moda 55-59. Las dos aparecen, por tanto, en el mapa, con colores que las representan como muy diferentes respecto a la edad "mayoritaria". En el gráfico siguiente vemos la distribución de población en las dos:

Las distribuciones no son demasiado distintas, pero una tiene la moda 25 años por encima de la otra. Sin embargo, tiene más niños y menos viejos. De hecho, si calculamos la edad media (aproximada) encontramos que es más baja (45,2 años) en la sección que tiene la moda 55-59 que en la sección que tiene la moda 30-34 (47,6 años). Y la mediana (la edad que tiene por debajo y por encima a la mitad de la población) es la misma en los dos casos: el tramo 45-49 años.

Cosas parecidas pueden pasar en muchos otros lugares: secciones vecinas que parecen muy distintas, y en lugar no lo son tanto.

En definitiva, a pesar del trabajazo que han hecho en El Confidencial, el mapa (y el artículo) no resulta demasiado informativo. La moda da saltos entre lugares cercanos y similares, sin significar mucho en realidad. En algunos lugares la moda es muy alta o muy baja, lo que da pistas de población joven o envejecida, pero seguramente exagerando las diferencias.

Con un pequeño trabajo adicional, sustituyendo la moda por la mediana o por la media (que se puede calcular aproximadamente, sustituyendo cada tramo de edad por su punto central), habrían producido un mapa más realista y más informativo. Lástima.

13 de enero de 2017

¿Pero qué demonios significa este mapa?

Veo en Elpais.com la llamada a una noticia, "destacada" (literalmente) en la portada, sobre la evolución del tráfico en los aeropuertos españoles. La ilustración que acompaña al titular es un mapa de España con círculos de diferentes tamaños y colores que se supone que representan los diferentes aeropuertos.

Mapa con titular: ¿Cuáles son los aeropuertos con menos pasajeros de España? ¿Y con más?

Entro en la noticia y encuentro, efectivamente, el mapa, precedido de esta extraña leyenda, que intento reproducir en su tamaño "original" (variable, en realidad, claro, según dónde vean ustedes este texto y el de El País; en mi pantalla se ven muy similares):


Lo del color es claro: en rojo los aeropuertos donde disminuye el tráfico, en verde aquellos donde el tráfico aumenta. ¿Pero el tamaño de los círculos? ¿Qué proporción es esa? ¿Y cómo van a representar a la mayoría de los aeropuertos, que tienen tráficos por debajo de 5 millones, y unos cuantos de menos de un millón?

Luego resulta que en realidad el mapa no es una imagen fija, sino una inserción en una ventana, en la que uno puede hacer zoom sobre diferentes zonas de España, o verlo todo en su conjunto... ¡¡y donde el tamaño de los círculos va cambiando según el zoom!!! O sea que la escala de arriba no sirve, literalmente, para nada.

Aún peor, les presento mi captura de pantalla de una zona, al norte de la Península, a la que he añadido unos rótulos con los datos de cinco aeropuertos, extraídos del propio mapa (al hacer click sobre cada aeropuerto se presenta el nombre del mismo, el número de pasajeros en el 2016 y la variación porcentual respecto a 2015). 



¿Alguien puede entender qué valor se está representando con el tamaño de los círculos? No puede ser el número de pasajeros, porque Asturias y Bilbao son casi iguales, aunque el segundo casi multiplica por cuatro el tráfico del primero. Y ambos son sólo un poco más pequeños que Madrid, que tiene un tráfico que es más de nueve veces la suma de ambos.  ¿Es tal vez la variación porcentual respecto a 2015? Pues tampoco, porque la mayor es la de Reus (+16%) que está representado mucho más pequeño que cualquiera de los anteriores, o que el de Barcelona, a su lado, que crece un 11,2%. El círculo de Asturias tendría que ser también claramente mayor (en torno al doble) que el de Madrid o Bilbao.

En definitiva, o yo no capto algo muy sutil, o estamos antes simples bolitas de colores, como en un árbol de Navidad... que solo sirven para saber si el tráfico sube o baja. Podrían ser todas del mismo tamaño. O sustituirlas por flechas que suben o bajan.

¿Alguno de ustedes puede imaginar qué es lo que han querido hacer?

16 de agosto de 2016

Cómo contar mal las elecciones presidenciales en USA

Lleva hoy Elpais.com una noticia sobre lo improbable de una victoria aplastante en noviembre de alguno de los candidatos presidenciales norteamericanos. El texto es un pequeño desastre por varias razones.

1. Explica muy mal a qué se refiere con el término "voto electoral" que usa en el texto. Véase:
Desde 1944, ocho elecciones se han resuelto con una victoria aplastante de un candidato a la presidencia de EE UU. Los republicanos lo han conseguido en seis ocasiones y, entre ellos, el caso más palmario es el de Ronald Reagan en 1984. Se impuso sobre el demócrata Walter Mondale con más del 95% del voto electoral. Para los demócratas, su mayor victoria por avalancha (landslide victory, en la jerga política estadounidense) la logró Lyndon B. Johnson en 1964: obtuvo el 90% del voto electoral frente a Barry Goldwater.
El lector español no particularmente interesado en política norteamericana no tiene por qué saber a qué se refiere esa expresión, y podría creer que Reagan tuvo el 95% de los votos, o Johnson el 90%. Naturalmente no fue así, y Reagan venció en 1984 con un 58,8% y Johnson en 1964 con un 61,1%. Pero esas victorias en el voto popular se vieron magnificadas en el Colegio Electoral, la institución intermedia que eligen los estadounidenses cada cuatro años, y que es la que realmente elige al presidente (por eso Bush fue elegido en 2000 con menos votos populares). En el Colegio Electoral cada estado tiene un número de escaños aproximadamente proporcional a su población, y la mayoría de los estados dan todos sus escaños al candidato que gana en ese estado. Por eso un candidato que gane por una victoria muy rotunda, y muy uniforme, ganando en casi todos los estados, puede conseguir, con alrededor de un 60% del voto popular, un 90% o más de los escaños en el Colegio Electoral.

Sería bueno que esta cosa tan simple se hubiera explicado en el texto, y en los gráficos que lo acompañan, que usan sólo los porcentajes de voto en el Colegio Electoral, y no los porcentajes de voto populares, para ilustrar los casos históricos de "avalanchas electorales". Y además lo llaman "% voto", como aquí.


2. Por cierto, ¿sabe alguno de ustedes quien ese ese señor que sale a la derecha de George H.W. Bush?


No es Michael Dukakis, el derrotado candidato demócrata de 1988, que tiene esta otra pinta (recientemente).


Google no ha sido capaz de reconocer la foto del falso Dukakis usada por El País, y aunque la cara me es vagamente familiar, no consigo reconocerlo. Agradezco la ayuda de aficionados a la política estadounidense con más memoria. [Actualización: Iñigo S. Ugarte lo ha reconocido. Es George J. Mitchell, que fue senador, líder de la mayoría demócrata en el Senado, y luego enviado especial para Irlanda del Norte y para Oriente Medio. Gracias ].

3. Por otra parte, es curioso que la noticia ponga el énfasis en que esta no va a ser una "avalancha", precisamente cuando algunos medios están especulando con que, en la situación actual, es casi tan probable una avalancha de Clinton como una victoria (ordinaria) de Trump.

4. Pero aún queda el desastre mayor. Justo al principio de la noticia, se ilustra la idea de que esta no va a ser una avalancha con un mapa que pretende ilustrar como están ahora las encuestas para Clinton y Trump, por estados. Se pinta cada estado con un tono de rojo o de azul según la probabilidad de victoria de Trump y de Clinton, respectivamente. Y en él se ve que hay una mezcla variada de rojo y azul que contrasta con los mapas, como el representado arriba, que ilustran las anteriores victorias aplastantes, en las que casi todo el país aparece coloreado de rojo (republicano) o azul (demócrata).

Este es el mapa que usa El País, y que dice que viene de el New York Times (en la noticia original puede pasar el ratón por encima del mapa, que es interactivo, y ver los porcentajes de probabilidad de victoria de cada partido en cada estado):


Un problema inicial es que el rótulo está al revés. Dice que rojo es más demócrata y azul más republicano. Pero si pasan su ratón por los estados verán que no es así: los estados en azul son los que tienen más probabilidad de victoria de Clinton. Además, si conocen ustedes algo de geografía política de los Estados Unidos sabrán que sitios como California o Nueva York son muy demócratas, y que el Sur y el Oeste (excepto los estados costeros) son más republicanos.

Pero ese no es el problema más importante del mapa: es que hay unos cuantos estados que están mal coloreados (y al pasar por ellos el ratón dan datos erróneos). Las predicciones de hoy mismo de The New York Times son estas:




Que se convierten en este mapa:


Click the map to create your own at 270toWin.com


En el mapa de El País aparecen en rojo erróneamente el estado de Washington, con un 99% de probabilidad de votar a Trump, mientras que el New York Times le da un 96% a Clinton. También Carolina del Norte (según El País, 95% de probabilidad de votar republicano, según el New York Times, que es supuestamente su fuente, un 67% de probabilidad de votar a Clinton).

Los errores en favor de los demócratas son todavía más serios: aparecen en azul (demócrata) los estados de Dakota del Norte, Nebraska y Virginia Occidental, estados tradicionalmente republicanos en los que, según el New York Times, las probabilidades de victoria republicana son del 86, 95 y 99% respectivamente. De hecho Virginia Occidental es según el New York Times, el estado con máxima probabilidad de victoria de Trump, y según El País, en cambio, aparece con un 97% de probabilidad de victoria de Clinton.

En fin, que los patinazos son enormes, y el mapa inservible, como en realidad, prácticamente toda la pieza.

22 de septiembre de 2015

En La Rioja hay muchos menos cajeros que en Madrid ¿de verdad?

Otra vez El Mundo tropezando en la falacia de los números absolutos, también conocida como "Andalucía encabeza", esta vez en forma de mapa, publicado en su edición en papel. Vean:




¿De verdad nadie se ha dado cuenta de que simplemente están coloreando las comunidades más y menos pobladas? En fin, cuánta tinta desperdiciada. Con lo fácil que hubiera sido calcular una tasa de cajeros por 100 habitantes, por ejemplo. Así hubiéramos podido ver, qué sé yo, que Andalucía tiene menos cajeros (relativamente) que Cataluña, o incluso, precisamente, que La Rioja. ¡Habríamos aprendido algo que no sabíamos!

13 de octubre de 2014

¿Sólo dos casos de ébola en el hemisferio norte?

Alguien en El Mundo ha decidido hacer una pieza comparando a los dos primeros pacientes cuya infección por ébola fue detectada estando en un país rico (aunque uno la contrajera en África y otro en Europa). Vale, puede ser una comparación interesante. Pero a la hora de subrayar lo que tienen en común se les ha ido un poco la pinza con la geografía: "son los dos primeros casos de ébola detectados en el hemisferio norte".


Problema: el mapa de África (vía aularagon.org).



Uupps. 

8 de octubre de 2014

Mapa de dudosa utilidad sobre el ébola

Estos días muchos medios están haciendo un gran esfuerzo para informar sobre el ébola, su prevención, su tratamiento, su expansión por el mundo, los cuidados que tienen que adoptar los equipos médicos y sanitarios... Algunas de esas informaciones llevan unos acompañamientos gráficos muy valiosos (ejemplos abundantes en la cuenta de Twitter de La Buena Prensa, un blog, por cierto, estupendo, para superar el pesimismo que les puede entrar si visitan demasiado el mío).

Pues bien, un lector que se llama Andreu (gracias) me muestra que en Diario de Mallorca no se han esforzado demasiado y han publicado este mapa:


Cito literalmente a Andreu:
Como puedes ver, se destacan siete países en los que se ha detectado la enfermedad pero creo que incluir a Nigeria y Senegal (con una veintena de casos) y, sobre todo, a España y EEUU (con sólo uno en el momento de la elaboración del mapa) en el saco "De 0 a 770" me parece un sesgo inaceptable.
Y eso sin contar el tema de los colores: la mayoría de la población identificará a primera vista el rojo con un mayor número de afectados, mientras Sierra Leona, Guinea y Liberia (los más golpeados por el virus) aparecen en un neutro salmón o en un engañoso azul.
Lo de los colores sin duda es opinable, pero sí que normalmente se asocia lo rojo con lo peligroso y lo malo. Parece que el mapa es francamente mejorable. Desde luego, no todos los medios tienen los mismos recursos, pero creo que hacer algo bastante mejor, como una versión mucho menos detallada (solo con los datos por país) de este gráfico de El Mundo sí debería estar al alcance de "cualquier" medio.




28 de mayo de 2014

Se pierden más votos... ¡donde se tienen más votos!

Hoy El País (pág. 12, ed. Madrid) incluía, en su análisis de los resultados electorales, este mapa sobre la pérdida de votos del PSOE (luego hay otro similar sobre el PP):




Afortunadamente, las áreas de los círculos son proporcionales al número de votos (no como otras veces), pero el gráfico sigue siendo, aún así, defectuoso, claro, porque se pierden más votos donde hay más votos que perder, que a su vez es, en líneas generales, donde hay más población. Los sitios donde más votos pierde el PSOE son Madrid, Cataluña, Andalucía, la Comunidad Valenciana... Son las comunidades más pobladas, y en las que más votos tenía. Y claro, en La Rioja se pierden pocos, y en Ceuta y Melilla, muchos menos. Qué contentos deben estar los socialistas de esos territorios. No, claro, con este mapa no podemos saber si los socialistas más contentos (o más bien, probablemente, menos tristes) son los de La Rioja, o los de Canarias, los de Madrid o los de Andalucía...

Es una vez más la falacia de las comparaciones en números absolutos. Esta comparación es inútil porque no nos dice nada sobre la pérdida relativa de votos, que es la importante. De hecho, dos páginas más adelante se nos informa de que los resultados de Andalucía se consideran muy buenos. Pero quien vea este mapa y no se sepa de memoria el tamaño de los electorados del PSOE en las grandes comunidades no tiene ninguna forma de saber que lo de Andalucía es, relativamente, bueno (pérdida del 26% de los votos), y lo de Cataluña (-50,6%) o Madrid (-51,4%) catastrófico.

En fina, una pérdida de espacio, muy poco informativa. Hubiera sido mucho mejor un mapa con colores distintos según el porcentaje de pérdida, o incluso uno como este, pero con círculos proporcionales a la proporción de la sangría de votos.

25 de mayo de 2013

Un mapa absolutamente inútil

El otro día nos reíamos mucho en la clase de periodismo de datos organizada por la APM, con las noticias que se empeñan en contar, como si aportaran algo, que donde hay más X es en Andalucía, Cataluña y Madrid, y donde hay menos X en La Rioja y Cantabria, y las dos ciudades autónomas.

Es la falacia de las comparaciones en valores absolutos, que cuando se hace entre territorios con poblaciones muy diferentes es inútil. Absolutamente inútil, si se me permite el juego de palabras.

Les decía yo de broma que con esa lógica podríamos publicar una noticia diciendo que quien quiera vivir muchos años debe mudarse a Ceuta o Melilla, porque allí muere muy poca gente cada año, mientras que en Andalucía, Madrid... mueren decenas de miles, por lo cual vivir allí debe de ser peligrosísimo.

Todos nos reíamos mucho... pero algunos ejemplos se acercan peligrosamente a esa caricatura. 

Vean el mapa que se han cascado los de Eldiario.es en la misma noticia que acabo de comentar  sobre la violencia de género en España. [Actualización 29 de mayo: el mapa ha sido corregido después. Vean mi comentario más abajo]





Claro, donde vive más gente, hay más muertes por violencia de género, y donde vive menos gente hay menos. Como hay más/menos muertes por cáncer, suicidio, accidentes de tráfico, ataques al corazón y cualquier otra cosa que podamos imaginar. La pobre Andalucía va a estar siempre roja-rojísima y La Rioja siempre en un tono clarito. Este mapa es total y estrictamente inútil para entender qué zonas del país son más o menos propensas a la violencia mortal contra las mujeres. No da ninguna información valiosa. Ninguna.

Un ridículo que se podría evitar en dos minutos, porque los datos de población de las CCAA necesarios para convertir esos números absolutos en tasas por millón están en el INE a cinco clicks de distancia. Basta con saber lo que se está haciendo y con querer hacerlo bien. Pero se ve que en este caso estas dos condiciones no se daban.

Actualización 29 de mayo, sobre la corrección del mapa. Unos días después de publicar mi comentario comprobé que el mapa criticado había sido eliminado y sustituido por otro que refleja datos distintos. Ya no se trata de víctimas mortales, sino de todo tipo de víctimas; los datos se refieren solo a un año (2011); y los datos se expresan en tasas relativas a la población (en concreto, tasas por 100.000 mujeres mayores de 14 años). La fuente es un registro del INE que se acaba de publicar por primera vez. Este es el resultado:



Este sí es un mapa útil e informativo.

Con todo, llama la atención que, a la hora de "corregir" el mapa anterior, en lugar de simplemente convertir los datos que se tenían en tasas por millón de habitantes, o similar, se haya optado por representar una realidad diferente (las víctimas no solo mortales, sino de todo nivel de gravedad, pero de un solo año, y en tasas suministradas directamente por el INE). Me temo que aquí está manifestándose una mezcla de inseguridad matemática (a ver si calculando la tasa meto la pata; ¿hago tasa anual o por los 15 años?; ¿por millón, por 100.000?; ¿por habitantes, por mujeres, por mujeres de tal edad?; ¿cómo integro el tamaño cambiante de la población?) y de respeto reverencial al dato oficial (si publico la tasa del INE nadie me puede criticar). Ambas son limitaciones que perjudican la capacidad de los medios para trabajar con números, y que habría que ir superando.