Spaces:
Running
Running
File size: 3,582 Bytes
e58615a | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 71 72 73 74 75 76 77 78 79 80 81 82 83 84 85 86 87 88 89 90 91 92 93 94 95 96 97 98 99 100 101 102 103 104 105 106 107 108 109 110 111 112 113 114 115 116 117 118 119 | """
Script para concatenar y normalizar datasets de features de partido.
Lee dos CSV existentes en:
- ~/Documents/Racing/Datasets/match_post_1row.csv
- ~/Documents/Racing/Datasets/match_post_1row__20260210_112234.csv
Hace lo siguiente:
- Normaliza las columnas clave de identificación de partido/equipos para que
ambos datasets tengan el mismo esquema:
matchId, fecha, competencia, temporada, home_team_id, away_team_id,
equipo_local, equipo_visitante, ...
- Se queda solo con las columnas que existen en ambos datasets.
- Concatena fila a fila.
- Elimina las columnas que quedan completamente vacías (todo NaN).
- Guarda el resultado en:
- data/match_features.parquet
- opcionalmente data/match_features.csv (para inspección rápida).
"""
from pathlib import Path
import pandas as pd
PROJECT_ROOT = Path(__file__).resolve().parents[1]
DOCS_DATASETS_DIR = Path.home() / "Documents" / "Racing" / "Datasets"
SRC_FILES = [
DOCS_DATASETS_DIR / "match_post_1row.csv",
DOCS_DATASETS_DIR / "match_post_1row__20260210_112234.csv",
]
OUTPUT_PARQUET = PROJECT_ROOT / "data" / "match_features.parquet"
OUTPUT_CSV = PROJECT_ROOT / "data" / "match_features.csv"
def load_and_normalize_first() -> pd.DataFrame:
"""
Carga el primer dataset (match_post_1row.csv) y renombra las columnas
clave para alinearlas con nombres genéricos.
Este archivo tiene cabeceras tipo:
home_matchId, home_competencia, home_temporada, home_equipo_local, ...
"""
path = SRC_FILES[0]
df = pd.read_csv(path)
rename_map = {
"home_matchId": "matchId",
"home_fecha_x": "fecha",
"home_competencia": "competencia",
"home_temporada": "temporada",
"home_teamId": "home_team_id",
"away_teamId": "away_team_id",
"home_equipo_local": "equipo_local",
"home_equipo_visitante": "equipo_visitante",
}
cols_to_rename = {k: v for k, v in rename_map.items() if k in df.columns}
df = df.rename(columns=cols_to_rename)
return df
def load_and_normalize_second() -> pd.DataFrame:
"""
Carga el segundo dataset (match_post_1row__20260210_112234.csv),
que ya tiene las columnas clave con nombres "limpios":
matchId, fecha, competencia, temporada, home_team_id, away_team_id,
equipo_local, equipo_visitante, ...
"""
path = SRC_FILES[1]
df = pd.read_csv(path)
return df
def build_match_features() -> pd.DataFrame:
"""
Construye el dataset concatenado de features de partido.
- Intersección de columnas entre ambos datasets.
- Concatena.
- Elimina columnas con todo NaN.
"""
df1 = load_and_normalize_first()
df2 = load_and_normalize_second()
common_cols = sorted(set(df1.columns).intersection(df2.columns))
df1_common = df1[common_cols].copy()
df2_common = df2[common_cols].copy()
df_all = pd.concat([df1_common, df2_common], ignore_index=True)
# Eliminar columnas que quedan completamente vacías en el conjunto unido
df_all = df_all.dropna(axis=1, how="all")
return df_all
def main(save_csv: bool = True) -> None:
df_all = build_match_features()
OUTPUT_PARQUET.parent.mkdir(parents=True, exist_ok=True)
df_all.to_parquet(OUTPUT_PARQUET, index=False)
if save_csv:
df_all.to_csv(OUTPUT_CSV, index=False)
print(f"Dataset concatenado guardado en: {OUTPUT_PARQUET}")
if save_csv:
print(f"También se guardó CSV en: {OUTPUT_CSV}")
print(f"Filas totales: {len(df_all)}, columnas: {len(df_all.columns)}")
if __name__ == "__main__":
main()
|