Conectar wallet

Calibración: qué significa acertar el 70% de las veces

Por insiderz8 min de lectura

Ilustración plana y abstracta sobre fondo oscuro: una línea diagonal de referencia y una curva que se dobla por debajo, sugiriendo un gráfico de calibración sin texto

La calibración es el ajuste entre lo que declaras y lo que ocurre. Si estás calibrado, los eventos a los que pones un 70% ocurren alrededor del 70% de las veces, los que pones al 90% ocurren alrededor del 90% de las veces, y así por toda la escala. Es una propiedad de un conjunto de previsiones, nunca de una sola. Una única call al 70% que se cumple no demuestra nada.

¿Cómo se lee una tabla de calibración en diez segundos?

Una tabla de calibración agrupa tus previsiones resueltas en bandas de seguridad y pregunta, banda por banda, cuántas veces ocurrió el evento de verdad. La probabilidad declarada va a la izquierda, la tasa de acierto real a la derecha. Calibración perfecta significa que las dos columnas coinciden.

Aquí va un ejemplo resuelto: 100 previsiones resueltas de una persona, ordenadas en seis bandas. Los números son una ilustración, no calls reales.

Banda de seguridad Calls en la banda Probabilidad declarada media Veces que ocurrió Tasa real Diferencia
0 a 10% 8 0,05 1 0,13 +0,08
10 a 30% 12 0,20 3 0,25 +0,05
30 a 50% 15 0,39 6 0,40 +0,01
50 a 70% 20 0,59 12 0,60 +0,01
70 a 90% 25 0,78 17 0,68 -0,10
90 a 100% 20 0,94 15 0,75 -0,19

Lee la columna de diferencia y nada más. Cerca de cero en las bandas centrales, negativa arriba, positiva abajo. Esta persona peca de exceso de confianza: cuando está segura, acierta menos de lo que dice, y cuando descarta algo, ocurre más veces de las que admite.

¿Qué aspecto tiene el exceso de confianza?

El exceso de confianza es una tabla de calibración donde las bandas altas cumplen de menos y las bajas cumplen de más. Dibujado como curva contra la diagonal, queda por dentro de la línea en los dos extremos: demasiado plana, pegada al centro del eje de resultados mientras tus probabilidades declaradas se van a los bordes.

En la tabla de arriba, la banda del 90 al 100% es el daño. Veinte calls declaradas a una media del 94% se cumplieron 15 veces, una tasa del 75%. Esas cinco sorpresas salen caras con cualquier puntuación de error cuadrático, y además son las que la gente recuerda.

El arreglo es mecánico, no motivacional. Si tus noventas caen en 75, escribe 75 la próxima vez. No hace falta saber más para cerrar una brecha de calibración. Hace falta dejar de usar números que tu historial no respalda.

¿Por qué la falta de confianza también es un fallo?

La falta de confianza es el patrón inverso: los eventos que llamaste al 70% ocurren el 85% de las veces. Tu curva queda por fuera de la diagonal. Da más sensación de seguridad y sigue siendo un error, porque dejaste información sin usar. Quien lee tus previsiones no puede recuperar la certeza de más que tenías y no dijiste.

Los mercados de predicción también muestran este patrón en algunos tipos de pregunta. En Decomposing Crowd Wisdom, un preprint de arXiv de febrero de 2026 revisado en agosto de 2026, Nam Anh Le analizó 353 millones de operaciones sobre 429.000 contratos binarios de Kalshi y Polymarket y encontró que la calibración varía según el dominio del evento, el tiempo hasta la resolución y el tamaño de la operación, con los mercados políticos mostrando una falta de confianza persistente en la que los precios se comprimen hacia el 50%. Un precio que no se moja es la versión de mercado del mismo fallo.

Calibración, resolución y nitidez: ¿qué diferencia hay?

La calibración es una de tres partes, y por sí sola no basta.

Allan Murphy demostró en A New Vector Partition of the Probability Score, publicado en 1973, que una puntuación de previsión por error cuadrático se descompone en tres términos: la incertidumbre de los propios eventos, la fiabilidad de las previsiones (esto es la calibración) y la resolución, es decir, cuánto separó el pronosticador los eventos que ocurrieron de los que no.

  • La calibración pregunta si tus números significan lo que dicen.
  • La resolución pregunta si tus números distinguen entre casos.
  • La nitidez es la versión en palabras llanas de la resolución: si estás dispuesto a alejarte del 50%.

Decir 50% en todo está perfectamente calibrado y tiene resolución cero. También es inútil. Importa el par: un buen pronosticador está calibrado y es nítido.

El estudio de superpronosticadores de Barbara Mellers y sus colegas, publicado en Perspectives on Psychological Science en 2015, informa de los dos números por separado para los tres grupos del Good Judgment Project. Promediado sobre el segundo y el tercer año de torneo, el error de calibración fue de 0,01 para los superpronosticadores, 0,03 para el siguiente escalón de buenos rendimientos y 0,04 para el resto, mientras que la resolución fue de 0,40, 0,35 y 0,32 en el mismo orden. Los superpronosticadores fueron mejores en las dos dimensiones a la vez, que es lo difícil.

¿Cuántas previsiones resueltas hacen falta para que la curva signifique algo?

Unas 100 previsiones resueltas antes de que merezca la pena mirar la forma de la curva, y unos cientos antes de que una diferencia pequeña sea un hecho y no ruido.

La aritmética es simple ruido binomial. Si tu tasa real en una banda es del 70% y tienes 20 calls resueltas en ella, el error estándar ronda los 10 puntos porcentuales, así que una tasa observada entre el 49% y el 90% es compatible con estar perfectamente calibrado. Con 100 calls en la banda el error estándar baja a unos 4,6 puntos, y con 400 calls a unos 2,3.

Dos consecuencias prácticas. Primera, no rediseñes tu forma de pronosticar después de una docena de eventos resueltos. Segunda, una curva de calibración de seis bandas necesita varios cientos de previsiones en total, porque cada banda necesita su propia muestra. Esta es la razón principal de que casi todas las afirmaciones publicadas sobre calibración sean más débiles de lo que parecen.

¿Cómo se mejora la calibración?

Cuatro hábitos, en el orden que más rinde.

  1. Escribe el número antes de mirar nada. Tu propia probabilidad primero, luego el precio de mercado, luego las noticias. Anclarte en un precio que ya has visto destruye la prueba sobre tu propio criterio.
  2. Registra todas las previsiones, también las que te avergüenzan. Un historial que puedes podar no es un historial. Por eso las calls fechadas y no editables son las únicas que merece la pena puntuar.
  3. Agrupa y recuenta cada pocos meses. Construye la tabla de arriba con tus propias previsiones resueltas. La columna de diferencia te dice exactamente qué bandas mover.
  4. Usa más números. En el Good Judgment Project los superpronosticadores usaron una media de 57 valores de probabilidad distintos en las preguntas que respondieron, frente a 29 y 30 en los dos grupos de comparación, y eran más propensos a dar valores divisibles solo por 1%. Redondear a múltiplos de 10 tiraba información real.

El acierto también se puede medir contra un patrón externo fijo. En ForecastBench, presentado en ICLR 2025, la mediana de los superpronosticadores puntuó 0,096 sobre 498 preguntas mientras que la del público general puntuó 0,121, con previsiones humanas recogidas en julio de 2024. La calibración es buena parte de esa diferencia, y es la parte que se puede arreglar a propósito.

La calibración que ya lees cada día

En España el ejemplo cotidiano de una previsión probabilística es la probabilidad de precipitación. AEMET la obtiene del sistema de predicción por conjuntos del Centro Europeo, que ejecuta 51 predicciones distintas, un análisis sin perturbar y 50 ligeramente perturbados, y cuenta en cuántas de ellas se supera un umbral de lluvia. Un 60% no significa que llueva en el 60% de la provincia ni durante el 60% del día: significa que 6 de cada 10 escenarios simulados acaban con lluvia.

Los servicios meteorológicos publican y verifican esa clase de número desde hace décadas, y es el único campo donde el público general convive a diario con probabilidades calibradas. Cuando alguien se queja de que "AEMET falló" porque no llovió con un 30%, está cometiendo el mismo error que quien juzga una call al 70% por un solo resultado. Una probabilidad sola no se puede evaluar. Solo se puede evaluar un conjunto.

¿Dónde se puede construir una curva sin un torneo?

Necesitas tres cosas: un flujo de preguntas que se resuelvan, una forma de registrar una probabilidad que no se pueda cambiar después, y un referente contra el que compararte.

En insiderz, una call es una afirmación de sí o no sobre un evento real con tu nivel de seguridad adjunto. La call queda bloqueada en el segundo en que la publicas, con la hora y el precio de Polymarket de ese instante congelados a su lado. Nada se puede editar ni borrar, ni por ti ni por nosotros. Cuando el evento se resuelve, la call se puntúa contra ese precio congelado, y tu perfil lleva el historial entero, también las malas. Los eventos abiertos están aquí y la clasificación de insiders muestra quién va por delante del precio ahora mismo.

insiderz salió en septiembre de 2026, así que todavía no hay historial resuelto suficiente para una curva de calibración de toda la plataforma. Estos son los recuentos hasta ahora.

insiderz ahora mismo

En directo desde insiderz.
calls
0
insiders
0
eventos resueltos
0
eventos abiertos
1904

Para la puntuación que combina calibración y nitidez en un solo número, lee el Brier score explicado. Para saber qué significa de verdad una probabilidad de mercado antes de intentar igualarla, lee qué significa realmente un 34% de probabilidad. Para los hábitos que hay detrás de la mejor calibración medida que existe, lee superpronosticadores.

Preguntas frecuentes

¿Qué significa estar calibrado al pronosticar?
Que las cosas a las que pones un 70% ocurren alrededor del 70% de las veces, a lo largo de muchas previsiones. La calibración es una propiedad de un conjunto de previsiones, nunca de una sola.
¿Calibración y acierto son lo mismo?
No. Puedes estar perfectamente calibrado y ser inútil diciendo 50% siempre. También hace falta nitidez, que es alejarse del 50% cuando las pruebas lo permiten.
¿Cómo compruebo mi calibración?
Agrupa tus previsiones resueltas por bandas de seguridad, cuenta cuántas veces ocurrió el evento en cada banda y compara esa tasa con la banda. Cualquier diferencia mayor que el ruido aleatorio es un sesgo que puedes corregir.
¿Cuántas previsiones necesito para que mi curva de calibración signifique algo?
Unas 100 previsiones resueltas antes de que las bandas merezcan lectura, y unos cientos antes de que las diferencias pequeñas signifiquen algo. Con 20 previsiones en una banda, una tasa real del 70% puede salir entre el 49% y el 90% solo por azar.
¿Qué diferencia hay entre exceso y falta de confianza?
El exceso de confianza hace que tus bandas altas cumplan menos y las bajas cumplan más, así que tu curva queda por dentro de la diagonal. La falta de confianza es lo contrario: acertaste más veces de las que dijiste y dejaste información sin decir.

Fuentes

  1. Allan H. Murphy, A New Vector Partition of the Probability Score, Journal of Applied Meteorology 12(4), American Meteorological Society, 1973
  2. Barbara Mellers et al., Identifying and Cultivating Superforecasters as a Method of Improving Probabilistic Predictions, Perspectives on Psychological Science 10(3), 2015
  3. Ezra Karger et al., ForecastBench: A Dynamic Benchmark of AI Forecasting Capabilities, ICLR 2025, arXiv, revisado en febrero de 2025
  4. Nam Anh Le, Decomposing Crowd Wisdom: Domain-Specific Calibration Dynamics in Prediction Markets, arXiv, febrero de 2026, revisado en agosto de 2026
  5. Interpretación: probabilidad de precipitación, AEMET, consultada el 4 de septiembre de 2026

Sigue leyendo

El Brier score explicado en palabras llanas

Un Brier score mide cuánto se alejaron tus probabilidades de la realidad. Para cada previsión, coge la probabilidad que diste, réstale el resultado escrito como 1 si pasó y 0 si no pasó, y eleva el resultado al cuadrado. Promedia eso sobre todas tus previsiones. Cero es perfecto, 0,25 es lo que sacas diciendo 50% siempre, y 1 es lo más equivocado que se puede estar.

9 min de lectura

¿Qué significa de verdad una probabilidad del 34 %?

Un 34 % de probabilidad significa que, en un conjunto grande de afirmaciones hechas con la misma confianza, se cumplen unas 34 de cada 100. Es una afirmación sobre un grupo, no sobre un hecho concreto. Cuando el hecho ocurre, el pronóstico del 34 % no estaba equivocado. Era un pronóstico que decía que eso pasa alrededor de un tercio de las veces, y un tercio de las veces es a menudo.

6 min de lectura

Superpronosticadores: qué hacen de otra manera

Un superpronosticador es alguien que quedó en el 2% mejor por acierto a lo largo de cientos de preguntas puntuadas y luego siguió haciéndolo. La etiqueta salió de un torneo de investigación, no de un departamento de marketing, y la ventaja es medible: mejor calibración, separación más nítida entre lo que ocurre y lo que no, y un conjunto de hábitos de trabajo baratos de copiar. Nada de la lista exige un talento con el que haya que nacer.

9 min de lectura