Conectar wallet

El Brier score explicado en palabras llanas

Por insiderz9 min de lectura

Ilustración plana y abstracta sobre fondo oscuro: una fila de cuadrados de tamaño creciente sobre un eje horizontal, que sugiere errores al cuadrado entre una previsión y un resultado

Un Brier score mide cuánto se alejaron tus probabilidades de la realidad. Para cada previsión, coge la probabilidad que diste, réstale el resultado escrito como 1 si pasó y 0 si no pasó, y eleva el resultado al cuadrado. Promedia eso sobre todas tus previsiones. Cero es perfecto, 0,25 es lo que sacas diciendo 50% siempre, y 1 es lo más equivocado que se puede estar.

¿Qué es un Brier score, en una frase y un ejemplo?

En una frase: un Brier score es el error cuadrático medio de una previsión probabilística, donde el resultado cuenta como 1 o como 0.

En un ejemplo: dices que un candidato tiene un 70% de probabilidades de ganar, y el candidato gana. Tu error en esa previsión es 1 menos 0,70, o sea 0,30. Al cuadrado, 0,09. Si esa fuera tu única previsión, tu Brier score sería 0,09.

La puntuación viene de la meteorología. Glenn Brier la propuso en Verification of Forecasts Expressed in Terms of Probability, publicado en Monthly Weather Review en enero de 1950, para calificar previsiones de lluvia. Desde entonces es la medida de acierto por defecto para previsiones probabilísticas.

La probabilidad de precipitación que sale cada día en España se calcula con la misma lógica. AEMET explica que la probabilidad de precipitación se obtiene del sistema de predicción por conjuntos del Centro Europeo, que ejecuta 51 predicciones distintas, un análisis sin perturbar y 50 ligeramente perturbados, y cuenta en cuántas de ellas se supera un umbral de lluvia. Cuando la previsión dice 60% no dice que vaya a llover un 60% de la superficie, dice que 6 de cada 10 escenarios simulados acaban con lluvia. Verificar esa clase de número es exactamente el problema para el que Brier inventó su fórmula.

¿Cuál es la fórmula?

La fórmula, una vez: el Brier score es la media de (p menos o) al cuadrado, donde p es tu probabilidad entre 0 y 1 y o vale 1 si el evento ocurrió y 0 si no.

Hay una trampa que conviene conocer. La definición original de Brier de 1950 suma el error al cuadrado sobre todos los resultados posibles, así que para una pregunta de sí o no suma el error del "sí" y el del "no" y va de 0 a 2. La versión que casi todo el mundo usa hoy para preguntas de sí o no cuenta solo un lado y va de 0 a 1. Las dos se diferencian en un factor de dos. Mellers y sus colegas usaron la versión de 0 a 2 en su artículo de 2015 sobre superpronosticadores, así que una puntuación de esa literatura no es directamente comparable con un 0,096 de un benchmark binario moderno. Comprueba siempre qué versión usa un número antes de compararlo con el tuyo.

Un ejemplo resuelto

Cinco calls, cinco resultados, una puntuación. La columna de resultado vale 1 si pasó y 0 si no.

Call Tu probabilidad Resultado Error Error al cuadrado
El gobierno actual revalida 0,85 1 0,15 0,0225
La ley se aprueba antes de diciembre 0,60 0 0,60 0,3600
Bajada de tipos en la próxima reunión 0,30 0 0,30 0,0900
El equipo se clasifica 0,95 1 0,05 0,0025
La fusión se cierra este trimestre 0,40 1 0,60 0,3600

Los errores al cuadrado suman 0,835. Dividido entre cinco calls, el Brier score es 0,167. Las dos calls que duelen son aquellas en las que estabas seguro del lado equivocado, y ese es el sentido de elevar al cuadrado: equivocarse en 60 puntos cuesta dieciséis veces lo que cuesta equivocarse en 15.

Estos números son un ejemplo resuelto, no calls reales.

¿Por qué 0,25 es el número que hay que recordar?

0,25 es la puntuación que sacas diciendo 50% en todo, siempre. El error es siempre 0,5, y 0,5 al cuadrado es 0,25. Da igual lo que pase, y da igual lo difíciles que sean las preguntas.

Eso convierte al 0,25 en la línea entre decir algo y no decir nada. Una puntuación por encima de 0,25 significa que tus probabilidades fueron peor que inútiles: habrías quedado mejor negándote a responder. Una puntuación por debajo de 0,25 significa que aportaste información. Cuánto por debajo es la única pregunta interesante.

¿Qué es un buen Brier score?

No hay una buena puntuación universal, porque la puntuación depende de las preguntas. Quien solo llama a casi certezas va a ganarle a quien se mete con eventos genuinamente inciertos, y el segundo es más útil. Cualquier Brier score citado sin su conjunto de preguntas no es un dato, es adorno.

Dicho eso, aquí van anclas de benchmarks publicados, cada una con su conjunto de preguntas y su fecha.

Pronosticador o regla Brier score Conjunto de preguntas Fecha
Pronosticador perfecto 0,000 cualquiera por definición
Mediana de superpronosticadores, preguntas de mercado 0,074 ForecastBench, N=76 previsiones humanas recogidas en julio de 2024
Mediana de superpronosticadores, general 0,096 ForecastBench, N=498 previsiones humanas recogidas en julio de 2024
Mediana del público general 0,121 ForecastBench, N=498 previsiones humanas recogidas en julio de 2024
Mejor modelo de lenguaje (Claude 3.5 Sonnet) 0,122 ForecastBench, N=498 previsiones humanas recogidas en julio de 2024
Decir 50% en todo 0,250 cualquiera por definición
Pronosticador máximamente equivocado 1,000 cualquiera por definición

Las cuatro filas de benchmark vienen de ForecastBench, un benchmark dinámico de predicción publicado en ICLR 2025 por Ezra Karger, Philip Tetlock y coautores. Los grupos humanos de comparación se encuestaron en julio de 2024. En ese conjunto, los superpronosticadores batieron tanto al público general como al mejor modelo de lenguaje con p por debajo de 0,001.

Fíjate en cuánto más baja es la puntuación de las preguntas de mercado que la general para las mismas personas: 0,074 frente a 0,096. Las preguntas sacadas de mercados de predicción en vivo fueron más fáciles para todos, que es justo por lo que un Brier score en bruto no se puede leer como un nivel de habilidad.

¿Por qué no se puede hacer trampa diciendo 50%?

Porque el Brier score es una regla de puntuación propia. Eso significa que tu puntuación esperada es la mejor cuando declaras la probabilidad que de verdad crees. Si de verdad piensas que algo tiene un 80% de probabilidades y escribes 65% para parecer prudente, tu Brier score esperado empeora, no mejora.

La intuición: acercarte al 50% te compra un castigo menor cuando fallas, pero te cuesta más que eso en los casos en los que aciertas. La aritmética de elevar al cuadrado hace que el número honesto sea el rentable. Es la propiedad que hace que valga la pena usar el Brier score, y es la razón por la que los torneos de predicción lo usan desde los años cincuenta.

Decir 50% siempre sí te protege de puntuar nunca peor que 0,25. También te garantiza que nunca puntuarás mejor que 0,25, lo que significa que nunca demuestras nada.

¿Brier score o log score?

Los dos son reglas de puntuación propias. La diferencia está en la dureza con la que castigan los errores cometidos con seguridad.

El Brier score eleva el error al cuadrado, así que la peor previsión posible cuesta 1. La puntuación logarítmica toma el logaritmo negativo de la probabilidad que asignaste a lo que de verdad pasó, así que una previsión del 0% sobre algo que ocurre cuesta infinito. La puntuación logarítmica es más sensible en los extremos y se prefiere cuando importan las colas. El Brier score está acotado, es más fácil de promediar y más fácil de explicar, que es por lo que los torneos y los servicios meteorológicos siguen apoyándose en él.

Para casi todo el mundo la respuesta práctica es: usa Brier, y no escribas nunca 0% ni 100%.

¿Qué es un Brier score relativo?

Un Brier score relativo es tu puntuación menos la puntuación de un referente en las mismas preguntas y en los mismos momentos. Es la única versión del número que responde a "comparado con qué".

El referente puede ser una regla sencilla, como la tasa base histórica, u otro pronosticador, o un precio de mercado. Allan Murphy demostró en A New Vector Partition of the Probability Score, publicado en 1973, que un Brier score se descompone en tres partes: cuánta incertidumbre tenían los eventos de partida, lo bien calibrado que estabas y cuánto separaste los eventos que ocurrieron de los que no. La primera parte pertenece a las preguntas, no a ti. Restar un referente es la forma barata de quitarla.

Esto importa especialmente en los mercados de predicción. Los precios de mercado son fuertes pero no uniformes. En un estudio de más de 2.500 mercados políticos que cubría las cinco últimas semanas de la campaña presidencial estadounidense de 2024, publicado en SocArXiv el 1 de diciembre de 2025, Joshua Clinton y TzuFeng Huang encontraron que el 93% de los mercados de PredictIt predijo el resultado mejor que el azar, frente al 78% en Kalshi y el 67% en Polymarket. El listón que estás superando es distinto en cada plataforma y en cada pregunta, que es el argumento entero para puntuar contra el precio y no en abstracto.

Cómo lo usa insiderz

En insiderz, una call es una afirmación de sí o no sobre un evento real con un nivel de seguridad adjunto. La call queda bloqueada en el momento en que se publica, con la hora y el precio de Polymarket de ese instante congelados a su lado. Nada se puede editar ni borrar.

Cuando el evento se resuelve, la call se puntúa contra ese precio congelado. La columna Edge de la clasificación de insiders es la media de esa comparación: cuánto mejores, o peores, fueron las calls de una persona que el precio de mercado al que se enfrentaban. Bate el mercado cuenta cuántas veces quedó por delante. Las palabras Brier y Brier relativo no aparecen en el producto, pero esa es la aritmética de debajo, y este artículo es su sitio.

Puedes leer el artículo hermano sobre la calibración, que mide un fallo distinto: si las cosas a las que pones un 70% ocurren de verdad alrededor del 70% de las veces. Un buen Brier score necesita a la vez calibración y disposición a alejarse del 50%. Si quieres las pruebas sobre lo certeros que son los precios de mercado antes de intentar batirlos, empieza por ¿son certeros los mercados de predicción?, y para ver qué aspecto tiene un historial puntuado en la práctica, mira cómo encontrar a gente que de verdad bate al mercado.

Preguntas frecuentes

¿Qué es un Brier score?
La diferencia al cuadrado media entre la probabilidad que diste y lo que pasó de verdad, codificado como 1 o 0. Cero es perfecto, 0,25 es una moneda al aire y 1 es lo más equivocado posible.
¿Qué es un buen Brier score?
Depende por completo del conjunto de preguntas, así que una puntuación sin su conjunto de preguntas no significa nada. En el conjunto humano de ForecastBench, la mediana de los superpronosticadores fue 0,096 en general y 0,074 en preguntas tomadas de mercados de predicción.
¿Por qué se dice que el Brier score es una regla de puntuación propia?
Porque tu puntuación esperada es la mejor cuando declaras la probabilidad que de verdad crees. Acercar un número al 50% para parecer prudente empeora tu puntuación esperada, no la mejora.
¿Se pueden comparar dos Brier scores directamente?
Solo si vienen de las mismas preguntas. Las preguntas fáciles producen puntuaciones bajas para todo el mundo, así que la comparación justa es contra un referente sobre los mismos eventos, como el precio de mercado del momento en que se hizo cada previsión.
¿Un Brier score más bajo es siempre mejor?
Más bajo es mejor sobre un conjunto fijo de preguntas. Entre conjuntos distintos no es comparable, porque quien solo responde a preguntas casi seguras puntuará mejor que quien responde a las difíciles.

Fuentes

  1. Glenn W. Brier, Verification of Forecasts Expressed in Terms of Probability, Monthly Weather Review 78(1), American Meteorological Society, enero de 1950
  2. Allan H. Murphy, A New Vector Partition of the Probability Score, Journal of Applied Meteorology 12(4), American Meteorological Society, 1973
  3. Ezra Karger et al., ForecastBench: A Dynamic Benchmark of AI Forecasting Capabilities, ICLR 2025, arXiv, revisado en febrero de 2025
  4. Barbara Mellers et al., Identifying and Cultivating Superforecasters as a Method of Improving Probabilistic Predictions, Perspectives on Psychological Science 10(3), 2015
  5. Joshua D. Clinton y TzuFeng Huang, Prediction Markets? The Accuracy and Efficiency of $2.4 Billion in the 2024 Presidential Election, preprint en SocArXiv, 1 de diciembre de 2025
  6. Interpretación: probabilidad de precipitación, AEMET, consultada el 4 de septiembre de 2026

Sigue leyendo

Calibración: qué significa acertar el 70% de las veces

La calibración es el ajuste entre lo que declaras y lo que ocurre. Si estás calibrado, los eventos a los que pones un 70% ocurren alrededor del 70% de las veces, los que pones al 90% ocurren alrededor del 90% de las veces, y así por toda la escala. Es una propiedad de un conjunto de previsiones, nunca de una sola. Una única call al 70% que se cumple no demuestra nada.

8 min de lectura

¿Son fiables los mercados de predicción? Qué dicen los datos

Los mercados de predicción son fiables donde son profundos y de plazo corto, y poco fiables donde no lo son. En una muestra de mercados resueltos en varias plataformas medida hasta el 14 de octubre de 2025, Polymarket obtuvo una pérdida Brier de 0,1652 y Kalshi de 0,1982, frente a 0,25 de contestar siempre 50 %. En las elecciones estadounidenses de 2024 en concreto, un estudio encontró que solo el 67 % de los mercados de Polymarket cotizaban al ganador final por encima del 50 %.

7 min de lectura

Cómo encontrar a gente que de verdad bate al mercado

Juzga a un pronosticador por cuatro números y olvida el resto. Cuántas veces bate al precio de mercado en el momento en que habla. Por cuánto. Con cuánta anticipación, es decir, si el precio se movió después hacia él. Y sobre cuántos eventos resueltos. El cuarto número decide si los tres primeros significan algo, y casi ninguna clasificación pública lo incluye.

8 min de lectura