Mostrando entradas con la etiqueta encuesta electoral. Mostrar todas las entradas
Mostrando entradas con la etiqueta encuesta electoral. Mostrar todas las entradas

miércoles, 13 de julio de 2016

136. Elecciones 26J y prediciones electorales. ¿Error de la predicción o incertidumbre del suceso?

No dejo de preguntarme: si yo usé datos de Google Trends para hacer las previsiones electorales y no encuestas, ¿por qué fallé de modo tan parecido a las encuestas?  

Encuestas publicadas durante la campaña electoral (Electomanía)

Encuestas publicadas el día anterior y el mismo día de las elecciones (Electomanía)
Última previsión electoral que hice el 26/6, el mismo día de las elecciones. 

Mi previsión se basaba em la correlación entre búsquedas en Google con pasados resultados electorales pero también con las encuestas del CIS, de modo que , en cierto modo,  lo que yo calculaba era tanto los resultados de las elecciones como las previsiones de las encuestas CIS, pero lo cierto es que:

1.- NADIE daba al PP más de un 30%, y
2.- la mayoría daban a UP cerca del 25 % 

Media de encuestas desde enero de 2015 calculada por K. Llaneras


¿Y entonces?

Bien, la mayoría de los opinadores coincide en achacar lo ocurrido a tres tipos de causas.  

1.- Un sutil cambio sociopolítico del 20D al 26J no detectado. Tanto si usamos datos de Google como encuestas, con independencia de los métodos, usamos las correlaciones del pasado (la experiencia) para prever el futuro, pero en cierto modo estas fueron unas elecciones inéditas, a segunda vuelta, cosa que nunca se había dado y, por tanto, tanto los supuestos previos que traducían interés, simpatía o afinidad con voto no funcionaron. Lo que no se explica, no obstante, es porqué falló también (y tanto) el megasondeo a pie de urna de Sigma Dos (132.000 entrevistas, nada menos), pues aquí ya no estamos en la indeterminación de traducir un interés o intención (de votar) en una acción, sino en una simple encuesta sobre lo hecho. ¿Es que los votantes no solo cambiaron su opinión respecto del 20D sino que se volvieron más mentirosos? 

2.- El efecto manada, o efecto cascada, según el nombre que cada cual le quiera poner. En un juicio más severo no sería más que un chusco corta y pega, pero en un juicio más benévolo sería como el dicho de Newton: levantarse sobre los hombros de gigantes; el habitual proceso acumulativo con el que se capitaliza conocimiento. Yo mismo me basé en los datos de CIS, y es posible que todos en España sigan un poco al gran encuestador gubernativo. Sin embargo, tampoco explica todo lo ocurrido, pues por ejemplo, mi previsión para Cs se alejó tanto de los resultados como de las encuestas (salvo, de nuevo, del macrosondeo de 132.000 entrevistas a pie de urna de Sigma Dos, la famosa israelita para TVE, que daba a Cs apenas un 11%). 

3.- El error intrínseco de las encuestas. Lo que es algo así como decir que no siempre se acierta, o que las encuestas son probabilísticas, no determinísticas. Sin embargo, creo que aquí se confunde el error de la encuesta con la incertidumbre del suceso electoral para sumar un todo que no es. Por ejemplo, en la gráfica de medias de encuestas  que puse arriba, el valor medio es suavizado. La razón no solo es simular más certidumbre en el resultado como parecen decir aquí, sino lograr una mejor lectura de la tendencia general. 

Aquí lo vemos en la última de las gráficas de votos a partir de búsquedas en Google que fui publicando cada tres o cuatro semanas desde el 20D. Están suavizadas a 24 horas. 


Hora a hora, que es el paso con el que Google Trends da datos semanales, el aspecto de la gráfica de arriba es: 


Y no solo esto. Al dar los pronósticos, como el del 26J, no usé medias diarias sino medias semanales de medias diarias. La razón es bien sencilla: son los datos de mayor confianza. Pero esas fluctuaciones que se ven no son errores del medida, son debidas a la incertidumbre del suceso, que en este caso es el hecho de buscar pp o psoe o podemos en Google. Hay un claro ciclo diario de búsquedas comos e ve en la gráfica de abajo, y es posible que haya ciclos semanales, mensuales o estacionales... 



Hace años era recurrente en cada proceso electoral en Galicia discutir lo que influiría el hecho de que lloviese o no lloviese el día de elecciones.No tengo ninguna duda de que si las votaciones fueran en horario nocturno, los resultados cambiarían. También cambarían si fuese un día laboral, un sábado o un lunes, o en medio de un largo puente, en verano o en invierno.   

Yo contaba con un error del 8 % en mi previsión. Me separé de los resultados un 12 % pero no tengo claro que ese 4 % (al menos) sea un error estadístico del modelo o sea parte de la incertidumbre asiociada al suceso de votar. El 26J ocurrió una anomalía, pero tratar lo ocurrido como un error de las encuestas puede ser un error de juicio más general. Votar, elegir, decidir, es un suceso no determinista, con una incertidumbre asociada, irreductible a la encuesta, a toda monitorización. Quizá por eso, mientras que la técnica logra reducir los errores de todos los sistemas mecánicos, las encuestas siguen fallando con sorprendente regularidad. Quizá también habría que prestar menos atención a las causas de error de las encuestas y un poco más a las causas de la incertidumbre en los sucesos electorales. 

lunes, 21 de diciembre de 2015

105. Poniéndome nota. Comparación con resto de encuestas.

En Electomania han inventado un sencillo índice para medir el acierto o fracaso de las encuestas y proyecciones de votos en el 20-D. He añadido la última andorrana de Gesop del 19/12, la megaencuesta de 450.000 euros de TNS Demoscopia para Forta/RTVE y la encuesta final de Redondo y Asociados publicada justo tras el cierre de urnas el 20-12. Me he incluido para ver dónde quedaban mis predicciones, la del 19-12 y la del 12-12, último día de encuestas legales y éste es el resultado: he quedado entre el montón.


Puedo decir, sin embargo, que no estoy muy contento. Estoy bastante disgustado con mi previsión para el PP tres puntos por debajo de sus resultados. Porque Google señalaba una mínima distancia entre las búsquedas de PSOE y PP. ¿Qué pasó?

Le daré unas vueltas. 

29/12/2015.

Pues le he dado unas vueltas.

1.- Aunque resulta muy arriesgado analizar series temporales mediante regresiones, lo cierto es que los resultados de PSOE y Cs el 20D son congruentes con su evolución en lso último años/meses. El PP mantiene cierta resistencia a regresar a su tendencia, pero su desviación todavía no es significativa. 

2.- Las últimas elecciones tampoco han alterado demasiado las correlaciones entre búsquedas en Google y previsiones y resultados electorales.

3.- De hecho, si uso el índice de acierto de Electomania con las previsiones de votos calculadas a partir de las búsquedas en Google, los resultados que obtuve para las últimas elecciones están en el rango de acierto medio, que es del 91% (para 5 partidos). 


Así que acertar, acerté lo previsible. Me temo que para mejorar el acierto me quedan dos o tres cosas que probar:

a) mejorar los datos de partida, puede que introduciendo nuevas variables de control. He tanteado un poco y difícil lo veo. En cualquier caso será mucho más trabajoso.
b) cambiar las correlaciones simples por una estadística multivariante. No tengo SPSS o similar, así que tendré que intentarlo con mi open office. Se hará lo que se pueda.
c) cualquier otra cosa que se me ocurra.

sábado, 19 de diciembre de 2015

101. Votos y escaños: más para el que más tiene. Estrategias electorales en 1977 y en 2015.

Casi todo el mundo sabe ya que en España el sistema electoral se basa en el sistema d'Hondt y la circunscrpicción procincial. Casi todo el mundo sabe también que tanto uno como otro tienden a favorecer al primer y segundo partidos más votados. El bipartidismo no es casual. 

Lo que sabe menos gente es porqué tenemos este sistema: lo diseñó el Gobierno preconstitucional de Adolfo Suárez en 1976 para apañar una mayoría absoluta de escaños en las elecciones en 1977. Ni siquiera habían fundado UCD pero ya calculaban que sacarían el 34-35 % de los votos aunque querían el 50 % de escaños. Fue en aquél tiempo cuando Pío Cabanillas (el ministro de Franco que sustituó a Fraga en 1973) soltó la gracia aquella de: No sé quiénes, pero ganaremos.

Casi lo consiguen, sacaron 34 % de los votos y 166 escaños, 43 escaños más de los que les correspondían en proporción a su resultado electoral aunque a 9 de la absoluta. Como la Ley favorecía también al segundo partido, el PSOE, en 1979 se constitucionalizó como "pacto de Estado por la gobernabilidad".  

Efecto de la Ley electoral de 1979 (cocinada en 1976 para facilitar la victoria de UCD) en los resultados electorales de la democracia española: 314 escaños robados a los minoritarios en 11 elecciones. 
Durante décadas he escuchado cientos de veces echar pestes del sistema electoral español por favorecer  a los nacionalistas, cuando la verdad es que lo que favoreció fue el bipartidismo. Ya nadie duda que la corrupción en España es sistémica y tiene raíces muy profundas, ésta es una de ellas.

Encuestas, votos y escaños. 

Hecha la introducción, intentaré ser breve. El cálculo de escaños exige estimaciones de votos provinciales que no tengo. Pero no hay problema, lo que sigue es un ajuste potencial de la predicción de votos y escaños para la encuesta y estimación de escaños del CIS del 3/12 para PP, PSOE, Cs, Iu y Pod. R2 es prácticamente 1.

Lo mismo para un puñado de encuestas y estimaciones de escaños de GAD3 para ABC.

Y para otro puñado de encuestas y estimaciones de escaños de CELESTE-TEL (algunas incluyen también a UPyD)

En resumen, el ajuste a una curva potencial funciona. La expresión varía ligeramente según el reparto de votos, pero creo que una media puede funcionar. La selección es un tanto aleatória. Son datos de los 5-6 partidos de ámbito nacional que pueden obtener representación recogidos de 26 encuestas de 9 empresas distintas, aunque las más representadas son CELESTE-TEL para El Diario y GAD3 para ABC.
A pesar de que el ajuste es bueno, se ve una quiebra en torno al 20 %, algo así:
En definitiva, las estimaciones dicen que un 1 % de votos valen más cuantos más tengas hasta el 20 %, que ahí hay un premio extra de 10 escaños y a partir de ahí, ganas 6 escaños por cada 1 % de votos que sumes.


Conclusión: Estrategias electorales.

Supongo que ahora entenderéis el interés en situar a determinados partidos por encima o por debajo del 20% en las encuestas.

Cuatro partidos por encima del 20 % es la peor situación posible para el PP, pero resulta muy improbable. Mi impresión es que el PP ha jugado toda la campaña a subir todo lo posible a Cs hasta el límite del 20 %, (pero sin alcanzarlo) y así dejar al PSOE como oposición en un raquítico 21 % y a Podemos perdido con un 10-15 %. Ésa sería la situación ideal para la pírrica victoria del PP.



miércoles, 2 de diciembre de 2015

87. Google Trends se anticipa de uno a tres meses a las encuestas medias.

Fue ver el gráfico de evolución de medias de encuestas electoral.com y preguntarme qué tal correlacionarían sus datos con los semanales de búsquedas de los cinco partidos en Google Trends. 



La respuesta (que se las trae) la resumo en este otro gráfico: 

Lo que hice fue correlacionar la serie de datos medios de encuestas publicados por electoral.com, de la semana del 6 de marzo al 27 de noviembre (sin las dos semanas centrales de agosto) con la serie de datos semanales de Google en ese mismo periodo y con las de periodos equivalentes pero adelantados hasta trece semanas y retrasados hasta dos. Como digo, la cosa se las trae.

La gráfica muetra la variación del factor de correlación R2, que señala un desfase de unas cinco semanas entre los resultados de las encuestas promediadas por electoral.com y los registros de Google Trends para Cs y Pod y de unas 11-13 semanas para PP, PSOE ¿e IU? 

En principio, el desfase se explica porque los datos de las encuestas -lógicamente- se toman semanas antes de su publicación, aunque lo que no se entiende muy bien es por qué PP y PSOE presentan un desfase de correlación tan retrasado de ¡tres meses! 

Incluso la serie de medias de resultados electorales de Podemos correlaciona bastante bien con las búsquedas en Google diez y once semanas antes. Es como si los datos de las encuestas reflejaran no ya el periodo en que se toman, sino el de los meses anteriores. Una posibilidad que se me ocurre es que las medias calculadas por electoral.com  sean de todas las encuestas publicadas en los dos meses anteriores, que darían datos de hasta tres meses atrás. Pero en ese caso queda por explicar porqué el desfase con Pod y Cs es de solo 5 semanas. He preguntado a electoral.com y espero respuesta. Veremos.

Sea como sea, lo que salta a la vista es:

1.- Google Trends nos da datos que se anticipan hasta 3 meses a la información que una media de encuestas pueda dar (que básicamente será una tendencia). No me cabe duda de que se acabará imponiendo como un método más de predicción electoral, si no es ya EL método. Empiezan a verse ejemplos (1, 2, 3).

2.- Incluso para interpretar encuestas PP y PSOE son una cosa y Podemos y Cs, otra. 

****
06/12/2015
No tengo la respuesta que esperaba de electoral.com, pero creo que la correlación a tres meses es espúrea. Las corr. espúreas son comunes en series temporales, y he comprobado que sucede algo similar con los Barómetros CIS. El pico de cinco semanas es el correcto, que se epxlica bien por el retraso entre toma de datos y publicación de resultados y el tiempo transcurrido entre las distintas encuestas promediadas.