Calcular el xG en fútbol consiste en estimar la probabilidad de que un remate termine en gol a partir de las características concretas de la ocasión. El modelo analiza datos históricos de tiros y relaciona variables como distancia, ángulo, tipo de remate, asistencia previa o contexto defensivo para asignar a cada acción un valor entre 0 y 1.
Ese valor no describe únicamente dónde se produjo el disparo. Los modelos de xG transforman información espacial y contextual en una probabilidad de gol, por lo que dos remates desde una posición similar llegan a recibir valores diferentes. Entender este proceso exige analizar primero qué datos intervienen, cómo se convierten en variables y de qué forma el modelo aprende sus relaciones con el gol.
Qué datos y modelos necesitas para calcular el xG en fútbol
Para calcular el xG en fútbol se necesita un histórico de remates bien estructurado y un modelo capaz de transformar las características de cada ocasión en una probabilidad de gol. La precisión del cálculo depende de la calidad de los datos, de las variables que describen cada tiro y de la capacidad del modelo para identificar su relación con el gol.
El proceso parte de una secuencia sencilla, ya que cada tiro se registra con sus coordenadas y su contexto. Después esas observaciones se transforman en variables que el modelo interpreta y, finalmente, el sistema devuelve una probabilidad. Esa probabilidad constituye el valor xG del remate. Un tiro valorado con 0,30 xG representa una ocasión que el modelo asocia con una probabilidad aproximada del 30 % de terminar en gol dentro de situaciones comparables.
El punto clave es que el analista no asigna manualmente ese valor. El modelo lo aprende a partir de miles de tiros etiquetados como gol o no gol y detecta relaciones entre variables como distancia, ángulo, parte del cuerpo, tipo de asistencia o presión defensiva.
El artículo explica cómo calcular el xG en fútbol mediante datos, modelos probabilísticos, variables contextuales, machine learning y validación estadística
Por eso, el flujo técnico del cálculo se resume así
Se registra el remate y su localización.
Se obtienen distancia, ángulo y contexto.
El algoritmo procesa las características del tiro.
El modelo asigna una probabilidad entre 0 y 1.
Se comprueba la calidad de las probabilidades.
Qué variables intervienen en el cálculo del xG en fútbol
El valor de xG depende de las variables que describen la ocasión antes del remate. Los modelos de goles esperados no analizan únicamente la posición del disparo, sino que combinan geometría, tipo de ejecución y contexto defensivo para estimar la probabilidad de gol con mayor precisión.
Las variables más relevantes suelen agruparse en varios bloques:
- Posición del remate: Las coordenadas permiten localizar con precisión dónde se produce el tiro y sirven de base para calcular otras variables derivadas.
- Distancia a portería: Cuanto mayor es la separación entre el punto de remate y la línea de gol, menor suele ser la probabilidad de marcar.
- Ángulo de tiro: Un remate centrado dispone de una superficie visible de portería mayor que otro ejecutado desde una posición muy escorada.
- Parte del cuerpo: Los modelos diferencian entre remates con el pie, de cabeza u otras formas de finalización porque presentan tasas de conversión distintas.
- Tipo de asistencia: Un pase atrás, un centro lateral, un pase filtrado o una segunda jugada generan contextos de remate diferentes.
- Situación de juego: El modelo distingue entre juego abierto, contraataque, córner, falta directa o penalti.
- Presión defensiva: La distancia del defensor más cercano, la posibilidad de bloqueo y la densidad de jugadores entre balón y portería modifican la dificultad real del disparo.
- Posición del portero: Cuando existen datos de tracking, su colocación añade información sobre el espacio disponible y el grado de cobertura de la portería.
Estas variables explican por qué dos tiros realizados desde prácticamente la misma zona no tienen necesariamente el mismo xG. Un remate limpio tras un pase atrás y otro ejecutado bajo presión desde la misma posición representan situaciones distintas. El siguiente paso consiste en transformar toda esa información en una probabilidad cuantificable.
Cómo se convierten distancia, ángulo y contexto en una probabilidad de gol
El cálculo comienza con la posición exacta desde la que se produce el remate. A partir de sus coordenadas, el modelo obtiene variables geométricas como la distancia hasta la portería y el ángulo disponible entre ambos postes. Estas medidas describen una parte esencial de la ocasión, aunque no explican por sí solas toda su dificultad.
Una manera clara de entender cómo esas variables terminan convertidas en xG es utilizar una regresión logística. Este modelo transforma diferentes características del tiro en una probabilidad comprendida entre 0 y 1 mediante la función
P(gol) = 1 / (1 + e-z)
El valor de z combina la información disponible sobre el remate
z = β0 + β1d + β2θ + β3X3 + … + βnXn
En esta expresión, d representa la distancia y θ el ángulo de tiro. Las variables X incorporan información adicional como la parte del cuerpo, el tipo de asistencia, la presión defensiva o la posición del portero. Los coeficientes β no se asignan manualmente, sino que el modelo los aprende durante el entrenamiento a partir de tiros históricos etiquetados como gol o no gol.
La diferencia se entiende mejor con un ejemplo práctico. Un remate centrado dentro del área, tras un pase atrás y sin un defensor próximo presenta unas condiciones geométricas y contextuales más favorables que un disparo escorado desde mayor distancia y bajo presión. El modelo procesa esas diferencias y asigna una probabilidad distinta a cada acción, sin establecer valores fijos únicamente por la zona desde la que se dispara.
La probabilidad final obtenida constituye el xG del tiro. Si varios remates pertenecen al mismo jugador, equipo o partido, sus probabilidades se suman para calcular el xG acumulado y cuantificar la calidad conjunta de las ocasiones generadas.

Cómo se entrena un modelo de xG con tiros históricos
El entrenamiento de un modelo de xG en fútbol parte de un conjunto amplio de remates históricos etiquetados según su resultado. Cada tiro se convierte en una observación y la variable objetivo adopta una estructura binaria, donde gol = 1 y no gol = 0. A partir de esa base, el modelo aprende qué combinaciones de características están asociadas con una mayor o menor probabilidad de marcar.
Antes de entrenar el algoritmo se realiza el proceso de feature engineering, es decir, la transformación de los datos originales en variables que el modelo utiliza para aprender patrones. Las coordenadas del disparo se convierten en información como distancia y ángulo, mientras que elementos categóricos como tipo de remate, pase atrás, centro, balón parado o parte del cuerpo se codifican para que el modelo los interprete correctamente.
No todos los algoritmos responden igual ante este problema, ya que la elección depende del volumen de datos, la complejidad de las variables y el nivel de interpretabilidad que necesite el análisis.
| Modelo | Uso dentro del xG | Principal fortaleza |
|---|---|---|
| Regresión logística | Probabilidad base de gol | Interpretabilidad |
| GAM | Relaciones no lineales | Equilibrio entre precisión y explicación |
| Gradient Boosting | Interacciones complejas | Capacidad predictiva |
| XGBoost | Grandes datasets estructurados | Rendimiento y escalabilidad |
| Redes neuronales | Contexto espacial complejo | Representación avanzada |
Los penaltis, las faltas directas y otros contextos muy específicos suelen requerir un tratamiento separado o variables que identifiquen claramente su naturaleza, porque su distribución de gol difiere de la de los remates en juego abierto. Entrenar un modelo de xG significa aprender esas relaciones a partir de datos históricos, pero un buen ajuste durante el entrenamiento no garantiza todavía que las probabilidades generadas sean fiables fuera de esa muestra.
Cómo validar si un modelo de xG en fútbol calcula bien las probabilidades
Validar un modelo de xG no consiste en comprobar cuántos goles predice correctamente, sino en determinar si las probabilidades asignadas mantienen una relación coherente con la frecuencia real de gol. Esta diferencia es fundamental porque el xG funciona como una métrica probabilística y no como un sistema de clasificación entre gol y no gol.
La primera comprobación es la calibración. Si un conjunto suficientemente amplio de remates recibe valores próximos a 0,20 xG, alrededor del 20 % debería terminar en gol. Cuando esta correspondencia se mantiene en diferentes rangos de probabilidad, el modelo ofrece estimaciones interpretables y comparables.
Para medir esa calidad probabilística se utilizan varias herramientas:
- Brier Score mide la diferencia cuadrática entre la probabilidad estimada y el resultado real de cada tiro.
- Log Loss penaliza especialmente las predicciones excesivamente seguras que terminan siendo incorrectas.
- Curvas de calibración comparan gráficamente las probabilidades generadas por el modelo con la proporción real de goles observada.
La evaluación también debe realizarse fuera de los datos utilizados durante el entrenamiento. La validación temporal consiste en entrenar el modelo con temporadas anteriores y comprobar después su comportamiento sobre partidos posteriores, reduciendo así el riesgo de evaluar únicamente patrones que el algoritmo ya conoce.
Además, un buen resultado global no garantiza un comportamiento uniforme. Un modelo podría estar bien calibrado en términos generales y, sin embargo, sobrevalorar los cabezazos, infravalorar remates desde determinados ángulos o cometer errores sistemáticos cuando el portero está desplazado. Por eso, la validación debe segmentarse por zonas, tipos de remate y situaciones de juego.
Calcular el xG en fútbol exige, por tanto, construir, interpretar y validar probabilidades con criterio estadístico y conocimiento deportivo, competencias que forman parte del trabajo aplicado que desarrolla un analista de datos y que se profundizan en el Máster en Big Data Deportivo de Sports Data Campus.
Rellena el siguiente formulario para obtener información del Máster en Big Data Deportivo y aprende a transformar datos de rendimiento y juego en decisiones reales
