Conectar wallet

Superpronosticadores: qué hacen de otra manera

Por insiderz9 min de lectura

Ilustración plana y abstracta sobre fondo oscuro: un punto brillante muy por delante de un grupo denso de puntos más apagados a lo largo de una escala horizontal de acierto

Un superpronosticador es alguien que quedó en el 2% mejor por acierto a lo largo de cientos de preguntas puntuadas y luego siguió haciéndolo. La etiqueta salió de un torneo de investigación, no de un departamento de marketing, y la ventaja es medible: mejor calibración, separación más nítida entre lo que ocurre y lo que no, y un conjunto de hábitos de trabajo baratos de copiar. Nada de la lista exige un talento con el que haya que nacer.

¿De dónde viene el término?

Entre 2011 y 2014 la Intelligence Advanced Research Projects Activity de Estados Unidos organizó tres torneos de predicción geopolítica en los que cinco programas universitarios de investigación compitieron por producir estimaciones de probabilidad certeras. El programa ganador fue el Good Judgment Project, dirigido por Barbara Mellers y Philip Tetlock en la Universidad de Pensilvania. Todos los grupos se puntuaron con la misma métrica, el Brier score que Glenn Brier introdujo para las previsiones meteorológicas en 1950.

Los detalles importan, porque definen la muestra. Cada torneo duró unos nueve meses. Los dos primeros plantearon algo más de 100 preguntas, el tercero unas 150, y las preguntas estuvieron abiertas una media de 102 días. Cada año arrancó con entre 2.200 y 3.900 pronosticadores. Al final del primer año el proyecto ordenó a todo el mundo, tomó a los cinco mejores de cada una de las doce condiciones experimentales, 60 personas, y los puso en cinco equipos de élite de doce. A esos equipos se les dio el nombre de superpronosticadores. Todo esto está documentado en Identifying and Cultivating Superforecasters, publicado por Mellers y sus colegas en Perspectives on Psychological Science en 2015.

Lo esperable era la regresión a la media. No ocurrió. Los superpronosticadores siguieron por delante el segundo año y otra vez el tercero.

En español el trabajo llegó al público general con Superpronosticadores: el arte y la ciencia de la predicción, la edición de Katz Editores del libro de Tetlock y Gardner, publicada en 2017 con 326 páginas. Es la traducción que fijó el término en castellano, y de ahí viene que aquí se diga superpronosticador y no cualquier otra cosa.

¿Qué aspecto tiene la ventaja medida?

Medida Superpronosticadores o multitud de élite Grupo de comparación Estudio y fecha
Brier score estandarizado, media de los años 2 y 3 -0,34 -0,14 el siguiente escalón, +0,04 el resto Mellers et al., 2015
Error de calibración 0,01 0,03 el siguiente escalón, 0,04 el resto Mellers et al., 2015
Resolución 0,40 0,35 el siguiente escalón, 0,32 el resto Mellers et al., 2015
Área bajo la curva ROC 96% 84% el siguiente escalón, 75% el resto Mellers et al., 2015
Valores de probabilidad distintos usados 57 29 el siguiente escalón, 30 el resto Mellers et al., 2015
Previsiones enviadas por pregunta, año 1 2,77 1,47 los grupos de comparación Mellers et al., 2015
Noticias abiertas, años 2 y 3 255 55 y 58 Mellers et al., 2015
Brier score agregado, encuesta de élite frente a multitud de más de 300 0,166 0,228 Atanasov et al., 2024
Mediana del Brier score, 498 preguntas de benchmark 0,096 0,121 la mediana del público Karger et al., ICLR 2025

Dos notas para leer esta tabla. El torneo del Good Judgment usó la definición original de Brier a dos resultados, que va de 0 a 2, así que esos números no son directamente comparables con las puntuaciones de 0 a 1 de la última fila. Y las puntuaciones estandarizadas son relativas al conjunto de participantes en las mismas preguntas, que es la única forma justa de comparar a pronosticadores que no respondieron todos a lo mismo.

¿Cuáles son los hábitos, dichos como pasos?

Siete, en el orden en que se ejecutan de verdad.

  1. Toma primero la vista de fuera. Pregunta cuántas veces ocurren las cosas de esta clase de referencia, antes de mirar las particularidades de este caso.
  2. Parte la pregunta en trozos que puedas estimar. Descomponer es la habilidad más transferible de esta lista.
  3. Busca los criterios de resolución antes de buscar una respuesta. La mitad de las discusiones sobre predicción son discusiones sobre definiciones.
  4. Di un número concreto. Los superpronosticadores usaron una media de 57 valores de probabilidad distintos en sus preguntas, frente a 29 y 30 en los dos grupos de comparación, y fueron el grupo con más tendencia a usar números divisibles por 1% en vez de redondear a múltiplos de 10.
  5. Actualiza a menudo y en pasos pequeños. En el primer año de torneo los superpronosticadores enviaron 2,77 previsiones por pregunta frente a 1,47 de los grupos de comparación. La frecuencia de actualización de creencias resultó ser el predictor conductual más fuerte del acierto en el proyecto.
  6. Haz la lectura. A lo largo del segundo y el tercer año los superpronosticadores abrieron una media de 255 noticias en el lector del proyecto, frente a 55 y 58 de los grupos de comparación.
  7. Lleva la puntuación y mírala. El proyecto midió el aprendizaje como la reducción del error a lo largo de un año de torneo, y los superpronosticadores mejoraron más deprisa.

Los hábitos venían además con diferencias cognitivas reales. Los superpronosticadores puntuaron al menos una desviación típica por encima de la población general en pruebas de inteligencia fluida y en pruebas de conocimiento político. El resumen honesto del artículo es que en parte se descubrieron y en parte se crearon. La parte creada es la de la lista de arriba.

¿Cómo funciona descomponer en la práctica?

Descomponer significa cambiar una pregunta que no sabes estimar por varias que sí.

"¿Se aprobará esta ley antes de fin de año?" no se puede estimar como bloque. Partida queda así: ¿sale de comisión?, ¿queda tiempo de pleno en las sesiones que restan?, ¿la dirección del grupo quiere votarla?, ¿ha salido antes alguna ley comparable con esta correlación de fuerzas? Cada parte tiene una tasa base aproximada. Multiplica las que tienen que ocurrir todas y tendrás un número de partida que viene de algo y no de una sensación.

La ventaja mecánica es que deja al descubierto el eslabón débil. Cuando escribes cuatro subpreguntas y descubres que una carga con toda la incertidumbre, sabes exactamente qué investigar y qué ignorar. También te da algo que actualizar: cuando llega una noticia, suele afectar a una subpregunta, no al conjunto.

¿Por qué actualizar en pasos pequeños?

Porque casi toda noticia mueve una probabilidad un poco, y la disciplina de moverla un poco es lo que separa una previsión de una reacción.

Las actualizaciones pequeñas y frecuentes fueron el predictor conductual más fuerte del acierto en los datos del Good Judgment. El mecanismo no es misterioso. Quien revisa una pregunta cada semana incorpora diez pruebas pequeñas en diez semanas. Quien pone un número y se olvida no incorpora ninguna, y quien salta del 20% al 80% con un solo titular ha sustituido todas las demás pruebas por una.

Los pasos pequeños protegen además la granularidad que hace útiles a los números. Si tus únicos movimientos son de 10 puntos porcentuales, no puedes expresar la diferencia entre una prueba leve y una moderada.

¿Por qué importa tanto llevar la puntuación?

Porque sin puntuación no hay retroalimentación, y sin retroalimentación los hábitos de arriba son solo preferencias.

Aquí es donde falla casi toda la predicción pública. Las previsiones se hacen en sitios donde se pueden borrar, ignorar o reinterpretar después. Un historial que puedes editar no te dice nada sobre la persona y, peor todavía, no le dice nada a la persona sobre sí misma. El resultado del Good Judgment depende por completo de que cada previsión estaba fechada, puntuada con una regla fija y era imposible de retirar.

El segundo requisito es un referente. Un número de acierto en bruto depende de lo difíciles que fueran las preguntas. Puntuar contra algo que respondió a las mismas preguntas en los mismos momentos, otro pronosticador, una tasa base o un precio de mercado, es lo que convierte un número en una prueba sobre ti.

¿Cómo se comparan con los mercados y con la IA en 2026?

Frente a los mercados, el hallazgo útil es que importa más la multitud que el mecanismo. En Crowd prediction systems: Markets, polls, and elite forecasters, publicado en el International Journal of Forecasting en 2024, Pavel Atanasov, Jens Witkowski, Barbara Mellers y Philip Tetlock compararon mercados de predicción con encuestas de predicción por equipos usando datos del torneo del Good Judgment, con cada sistema operado o bien por una multitud grande no seleccionada o bien por una pequeña de élite. Las multitudes pequeñas de élite superaron a las grandes, mientras que los dos sistemas quedaron estadísticamente empatados entre sí. La encuesta de élite agregada obtuvo un Brier score de 0,166 frente al 0,228 de una multitud no seleccionada de más de 300 pronosticadores sobre las mismas preguntas, y una descomposición mostró que la diferencia venía enteramente de una mejor discriminación, no de una mejor calibración. El corte de élite en esos datos era el 2% mejor. El mismo artículo recoge trabajo publicado antes según el cual los pronosticadores de élite en encuestas por equipos eran más certeros que analistas de inteligencia profesionales con acceso a información clasificada.

Frente a la IA, la foto queda fechada en el momento en que se escribe. En ForecastBench, presentado en ICLR 2025, la mediana del Brier score de los superpronosticadores fue 0,096 sobre 498 preguntas, frente a 0,121 de la mediana del público y 0,122 del mejor modelo de lenguaje probado, Claude 3.5 Sonnet. Las previsiones humanas se recogieron en julio de 2024. El mismo artículo ajusta una tendencia entre calidad de modelo y acierto al pronosticar y proyecta que los modelos llegarían al nivel de superpronosticador con una puntuación de Arena de unos 1406, con un intervalo de confianza amplio. A septiembre de 2026, cualquier afirmación sobre la distancia actual necesita detrás una ejecución actual del benchmark.

¿Se puede practicar sin un torneo?

Sí, y los requisitos son cortos: preguntas que se resuelvan de verdad, una forma de registrar una probabilidad que no se pueda cambiar después y un referente contra el que ser puntuado.

Metaculus y Good Judgment Open organizan preguntas puntuadas. insiderz da el tercer ingrediente de serie. Una call en insiderz es una afirmación de sí o no sobre un evento real con tu nivel de seguridad adjunto, sobre los mismos eventos que lista Polymarket. La call queda bloqueada en el segundo en que la publicas, con la hora y el precio de Polymarket de ese instante congelados a su lado. Nada se puede editar ni borrar, ni por ti ni por nosotros. Cuando el evento se resuelve, la call se puntúa contra ese precio congelado, lo que significa que el referente viene incorporado en lugar de elegirse después.

No hay dinero por medio ni nada que apostar. La clasificación de insiders ordena a la gente por cuántas veces bate al precio de mercado, cuántos eventos ha resuelto, su ventaja media contra el precio y con cuánta anticipación acertó. Los eventos abiertos están aquí.

Para la puntuación en sí, en palabras llanas, lee el Brier score explicado. Para el fallo que estos hábitos están diseñados para arreglar, lee la calibración. Para la versión práctica de todo esto aplicada a un precio en vivo, lee cómo batir al mercado.

Preguntas frecuentes

¿Qué es un superpronosticador?
En el Good Judgment Project la etiqueta era operativa, no honorífica: el 2% mejor por acierto al final de un año de torneo, promocionado a pequeños equipos de élite. Significa un historial medido sobre preguntas puntuadas, no un cargo.
¿Se puede aprender a pronosticar mejor?
Sí. En el Good Judgment Project el predictor conductual más fuerte del acierto fue la frecuencia con la que la gente actualizaba sus previsiones, y un módulo breve de formación en probabilidad mejoró el acierto. Las dos cosas se pueden copiar, y las dos solo funcionan si las previsiones se puntúan.
¿Los superpronosticadores baten a los mercados de predicción?
Las multitudes pequeñas de élite baten a las grandes no seleccionadas en los dos formatos, mientras que los mercados de predicción y las encuestas de predicción por equipos quedaron estadísticamente empatados entre sí en los datos del Good Judgment. Importó más quién estaba en la multitud que qué mecanismo se usaba.
¿Siguen batiendo a la IA en 2026?
En ForecastBench, cuyas previsiones humanas se recogieron en julio de 2024, la mediana del Brier score de los superpronosticadores fue 0,096 frente a 0,122 del mejor modelo de lenguaje. El propio artículo proyecta que esa distancia se cierre a medida que mejoren los modelos, así que trata cualquier afirmación al respecto como fechada.
¿Cómo se llega a serlo?
No hay atajo que evite el historial. Haz previsiones sobre preguntas que se resuelvan, di un número en lugar de una opinión, conserva todas las previsiones incluidas las malas y púntualas contra un referente sobre los mismos eventos.

Fuentes

  1. Barbara Mellers et al., Identifying and Cultivating Superforecasters as a Method of Improving Probabilistic Predictions, Perspectives on Psychological Science 10(3), 2015
  2. Pavel Atanasov, Jens Witkowski, Barbara Mellers y Philip Tetlock, Crowd prediction systems: Markets, polls, and elite forecasters, International Journal of Forecasting, 2024
  3. Ezra Karger et al., ForecastBench: A Dynamic Benchmark of AI Forecasting Capabilities, ICLR 2025, arXiv, revisado en febrero de 2025
  4. Glenn W. Brier, Verification of Forecasts Expressed in Terms of Probability, Monthly Weather Review 78(1), American Meteorological Society, enero de 1950
  5. Philip E. Tetlock y Dan Gardner, Superpronosticadores: el arte y la ciencia de la predicción, Katz Editores, 2017, ISBN 9788415917274, ficha en Marcial Pons consultada el 4 de septiembre de 2026

Sigue leyendo

Cómo batir al mercado: guía práctica

Batir a un mercado de predicción significa acertar donde el precio se equivocaba, con la frecuencia suficiente y sobre suficientes eventos como para que la suerte deje de ser la explicación. No hay truco que funcione en todas partes. Lo que funciona es un método: parte del precio y no de tu opinión, discrepa solo en las pocas situaciones donde se sabe que los precios están flojos, pon un número concreto y puntúa cada call contra el precio del momento en que la hiciste.

11 min de lectura

El Brier score explicado en palabras llanas

Un Brier score mide cuánto se alejaron tus probabilidades de la realidad. Para cada previsión, coge la probabilidad que diste, réstale el resultado escrito como 1 si pasó y 0 si no pasó, y eleva el resultado al cuadrado. Promedia eso sobre todas tus previsiones. Cero es perfecto, 0,25 es lo que sacas diciendo 50% siempre, y 1 es lo más equivocado que se puede estar.

9 min de lectura

Calibración: qué significa acertar el 70% de las veces

La calibración es el ajuste entre lo que declaras y lo que ocurre. Si estás calibrado, los eventos a los que pones un 70% ocurren alrededor del 70% de las veces, los que pones al 90% ocurren alrededor del 90% de las veces, y así por toda la escala. Es una propiedad de un conjunto de previsiones, nunca de una sola. Una única call al 70% que se cumple no demuestra nada.

8 min de lectura