El Brier score explicado en palabras llanas
Por insiderz9 min de lectura

Un Brier score mide cuánto se alejaron tus probabilidades de la realidad. Para cada previsión, coge la probabilidad que diste, réstale el resultado escrito como 1 si pasó y 0 si no pasó, y eleva el resultado al cuadrado. Promedia eso sobre todas tus previsiones. Cero es perfecto, 0,25 es lo que sacas diciendo 50% siempre, y 1 es lo más equivocado que se puede estar.
¿Qué es un Brier score, en una frase y un ejemplo?
En una frase: un Brier score es el error cuadrático medio de una previsión probabilística, donde el resultado cuenta como 1 o como 0.
En un ejemplo: dices que un candidato tiene un 70% de probabilidades de ganar, y el candidato gana. Tu error en esa previsión es 1 menos 0,70, o sea 0,30. Al cuadrado, 0,09. Si esa fuera tu única previsión, tu Brier score sería 0,09.
La puntuación viene de la meteorología. Glenn Brier la propuso en Verification of Forecasts Expressed in Terms of Probability, publicado en Monthly Weather Review en enero de 1950, para calificar previsiones de lluvia. Desde entonces es la medida de acierto por defecto para previsiones probabilísticas.
La probabilidad de precipitación que sale cada día en España se calcula con la misma lógica. AEMET explica que la probabilidad de precipitación se obtiene del sistema de predicción por conjuntos del Centro Europeo, que ejecuta 51 predicciones distintas, un análisis sin perturbar y 50 ligeramente perturbados, y cuenta en cuántas de ellas se supera un umbral de lluvia. Cuando la previsión dice 60% no dice que vaya a llover un 60% de la superficie, dice que 6 de cada 10 escenarios simulados acaban con lluvia. Verificar esa clase de número es exactamente el problema para el que Brier inventó su fórmula.
¿Cuál es la fórmula?
La fórmula, una vez: el Brier score es la media de (p menos o) al cuadrado, donde p es tu probabilidad entre 0 y 1 y o vale 1 si el evento ocurrió y 0 si no.
Hay una trampa que conviene conocer. La definición original de Brier de 1950 suma el error al cuadrado sobre todos los resultados posibles, así que para una pregunta de sí o no suma el error del "sí" y el del "no" y va de 0 a 2. La versión que casi todo el mundo usa hoy para preguntas de sí o no cuenta solo un lado y va de 0 a 1. Las dos se diferencian en un factor de dos. Mellers y sus colegas usaron la versión de 0 a 2 en su artículo de 2015 sobre superpronosticadores, así que una puntuación de esa literatura no es directamente comparable con un 0,096 de un benchmark binario moderno. Comprueba siempre qué versión usa un número antes de compararlo con el tuyo.
Un ejemplo resuelto
Cinco calls, cinco resultados, una puntuación. La columna de resultado vale 1 si pasó y 0 si no.
| Call | Tu probabilidad | Resultado | Error | Error al cuadrado |
|---|---|---|---|---|
| El gobierno actual revalida | 0,85 | 1 | 0,15 | 0,0225 |
| La ley se aprueba antes de diciembre | 0,60 | 0 | 0,60 | 0,3600 |
| Bajada de tipos en la próxima reunión | 0,30 | 0 | 0,30 | 0,0900 |
| El equipo se clasifica | 0,95 | 1 | 0,05 | 0,0025 |
| La fusión se cierra este trimestre | 0,40 | 1 | 0,60 | 0,3600 |
Los errores al cuadrado suman 0,835. Dividido entre cinco calls, el Brier score es 0,167. Las dos calls que duelen son aquellas en las que estabas seguro del lado equivocado, y ese es el sentido de elevar al cuadrado: equivocarse en 60 puntos cuesta dieciséis veces lo que cuesta equivocarse en 15.
Estos números son un ejemplo resuelto, no calls reales.
¿Por qué 0,25 es el número que hay que recordar?
0,25 es la puntuación que sacas diciendo 50% en todo, siempre. El error es siempre 0,5, y 0,5 al cuadrado es 0,25. Da igual lo que pase, y da igual lo difíciles que sean las preguntas.
Eso convierte al 0,25 en la línea entre decir algo y no decir nada. Una puntuación por encima de 0,25 significa que tus probabilidades fueron peor que inútiles: habrías quedado mejor negándote a responder. Una puntuación por debajo de 0,25 significa que aportaste información. Cuánto por debajo es la única pregunta interesante.
¿Qué es un buen Brier score?
No hay una buena puntuación universal, porque la puntuación depende de las preguntas. Quien solo llama a casi certezas va a ganarle a quien se mete con eventos genuinamente inciertos, y el segundo es más útil. Cualquier Brier score citado sin su conjunto de preguntas no es un dato, es adorno.
Dicho eso, aquí van anclas de benchmarks publicados, cada una con su conjunto de preguntas y su fecha.
| Pronosticador o regla | Brier score | Conjunto de preguntas | Fecha |
|---|---|---|---|
| Pronosticador perfecto | 0,000 | cualquiera | por definición |
| Mediana de superpronosticadores, preguntas de mercado | 0,074 | ForecastBench, N=76 | previsiones humanas recogidas en julio de 2024 |
| Mediana de superpronosticadores, general | 0,096 | ForecastBench, N=498 | previsiones humanas recogidas en julio de 2024 |
| Mediana del público general | 0,121 | ForecastBench, N=498 | previsiones humanas recogidas en julio de 2024 |
| Mejor modelo de lenguaje (Claude 3.5 Sonnet) | 0,122 | ForecastBench, N=498 | previsiones humanas recogidas en julio de 2024 |
| Decir 50% en todo | 0,250 | cualquiera | por definición |
| Pronosticador máximamente equivocado | 1,000 | cualquiera | por definición |
Las cuatro filas de benchmark vienen de ForecastBench, un benchmark dinámico de predicción publicado en ICLR 2025 por Ezra Karger, Philip Tetlock y coautores. Los grupos humanos de comparación se encuestaron en julio de 2024. En ese conjunto, los superpronosticadores batieron tanto al público general como al mejor modelo de lenguaje con p por debajo de 0,001.
Fíjate en cuánto más baja es la puntuación de las preguntas de mercado que la general para las mismas personas: 0,074 frente a 0,096. Las preguntas sacadas de mercados de predicción en vivo fueron más fáciles para todos, que es justo por lo que un Brier score en bruto no se puede leer como un nivel de habilidad.
¿Por qué no se puede hacer trampa diciendo 50%?
Porque el Brier score es una regla de puntuación propia. Eso significa que tu puntuación esperada es la mejor cuando declaras la probabilidad que de verdad crees. Si de verdad piensas que algo tiene un 80% de probabilidades y escribes 65% para parecer prudente, tu Brier score esperado empeora, no mejora.
La intuición: acercarte al 50% te compra un castigo menor cuando fallas, pero te cuesta más que eso en los casos en los que aciertas. La aritmética de elevar al cuadrado hace que el número honesto sea el rentable. Es la propiedad que hace que valga la pena usar el Brier score, y es la razón por la que los torneos de predicción lo usan desde los años cincuenta.
Decir 50% siempre sí te protege de puntuar nunca peor que 0,25. También te garantiza que nunca puntuarás mejor que 0,25, lo que significa que nunca demuestras nada.
¿Brier score o log score?
Los dos son reglas de puntuación propias. La diferencia está en la dureza con la que castigan los errores cometidos con seguridad.
El Brier score eleva el error al cuadrado, así que la peor previsión posible cuesta 1. La puntuación logarítmica toma el logaritmo negativo de la probabilidad que asignaste a lo que de verdad pasó, así que una previsión del 0% sobre algo que ocurre cuesta infinito. La puntuación logarítmica es más sensible en los extremos y se prefiere cuando importan las colas. El Brier score está acotado, es más fácil de promediar y más fácil de explicar, que es por lo que los torneos y los servicios meteorológicos siguen apoyándose en él.
Para casi todo el mundo la respuesta práctica es: usa Brier, y no escribas nunca 0% ni 100%.
¿Qué es un Brier score relativo?
Un Brier score relativo es tu puntuación menos la puntuación de un referente en las mismas preguntas y en los mismos momentos. Es la única versión del número que responde a "comparado con qué".
El referente puede ser una regla sencilla, como la tasa base histórica, u otro pronosticador, o un precio de mercado. Allan Murphy demostró en A New Vector Partition of the Probability Score, publicado en 1973, que un Brier score se descompone en tres partes: cuánta incertidumbre tenían los eventos de partida, lo bien calibrado que estabas y cuánto separaste los eventos que ocurrieron de los que no. La primera parte pertenece a las preguntas, no a ti. Restar un referente es la forma barata de quitarla.
Esto importa especialmente en los mercados de predicción. Los precios de mercado son fuertes pero no uniformes. En un estudio de más de 2.500 mercados políticos que cubría las cinco últimas semanas de la campaña presidencial estadounidense de 2024, publicado en SocArXiv el 1 de diciembre de 2025, Joshua Clinton y TzuFeng Huang encontraron que el 93% de los mercados de PredictIt predijo el resultado mejor que el azar, frente al 78% en Kalshi y el 67% en Polymarket. El listón que estás superando es distinto en cada plataforma y en cada pregunta, que es el argumento entero para puntuar contra el precio y no en abstracto.
Cómo lo usa insiderz
En insiderz, una call es una afirmación de sí o no sobre un evento real con un nivel de seguridad adjunto. La call queda bloqueada en el momento en que se publica, con la hora y el precio de Polymarket de ese instante congelados a su lado. Nada se puede editar ni borrar.
Cuando el evento se resuelve, la call se puntúa contra ese precio congelado. La columna Edge de la clasificación de insiders es la media de esa comparación: cuánto mejores, o peores, fueron las calls de una persona que el precio de mercado al que se enfrentaban. Bate el mercado cuenta cuántas veces quedó por delante. Las palabras Brier y Brier relativo no aparecen en el producto, pero esa es la aritmética de debajo, y este artículo es su sitio.
Puedes leer el artículo hermano sobre la calibración, que mide un fallo distinto: si las cosas a las que pones un 70% ocurren de verdad alrededor del 70% de las veces. Un buen Brier score necesita a la vez calibración y disposición a alejarse del 50%. Si quieres las pruebas sobre lo certeros que son los precios de mercado antes de intentar batirlos, empieza por ¿son certeros los mercados de predicción?, y para ver qué aspecto tiene un historial puntuado en la práctica, mira cómo encontrar a gente que de verdad bate al mercado.
Preguntas frecuentes
- ¿Qué es un Brier score?
- La diferencia al cuadrado media entre la probabilidad que diste y lo que pasó de verdad, codificado como 1 o 0. Cero es perfecto, 0,25 es una moneda al aire y 1 es lo más equivocado posible.
- ¿Qué es un buen Brier score?
- Depende por completo del conjunto de preguntas, así que una puntuación sin su conjunto de preguntas no significa nada. En el conjunto humano de ForecastBench, la mediana de los superpronosticadores fue 0,096 en general y 0,074 en preguntas tomadas de mercados de predicción.
- ¿Por qué se dice que el Brier score es una regla de puntuación propia?
- Porque tu puntuación esperada es la mejor cuando declaras la probabilidad que de verdad crees. Acercar un número al 50% para parecer prudente empeora tu puntuación esperada, no la mejora.
- ¿Se pueden comparar dos Brier scores directamente?
- Solo si vienen de las mismas preguntas. Las preguntas fáciles producen puntuaciones bajas para todo el mundo, así que la comparación justa es contra un referente sobre los mismos eventos, como el precio de mercado del momento en que se hizo cada previsión.
- ¿Un Brier score más bajo es siempre mejor?
- Más bajo es mejor sobre un conjunto fijo de preguntas. Entre conjuntos distintos no es comparable, porque quien solo responde a preguntas casi seguras puntuará mejor que quien responde a las difíciles.
Fuentes
- Glenn W. Brier, Verification of Forecasts Expressed in Terms of Probability, Monthly Weather Review 78(1), American Meteorological Society, enero de 1950
- Allan H. Murphy, A New Vector Partition of the Probability Score, Journal of Applied Meteorology 12(4), American Meteorological Society, 1973
- Ezra Karger et al., ForecastBench: A Dynamic Benchmark of AI Forecasting Capabilities, ICLR 2025, arXiv, revisado en febrero de 2025
- Barbara Mellers et al., Identifying and Cultivating Superforecasters as a Method of Improving Probabilistic Predictions, Perspectives on Psychological Science 10(3), 2015
- Joshua D. Clinton y TzuFeng Huang, Prediction Markets? The Accuracy and Efficiency of $2.4 Billion in the 2024 Presidential Election, preprint en SocArXiv, 1 de diciembre de 2025
- Interpretación: probabilidad de precipitación, AEMET, consultada el 4 de septiembre de 2026


