Data · IA
Análisis Big Data del Mundial
Análisis de datos de la Copa Mundial con PySpark: DataFrames, RDDs y Spark SQL en un pipeline único.
portada procedural — capturas reales a la esperaPortada procedural del proyecto Análisis Big Data del Mundial.
01 Resumen
Proyecto académico de Big Data que resuelve una guía de evaluación sobre la Copa Mundial de la FIFA usando Apache Spark (PySpark). Integra cinco fuentes de datos (equipos, estadios, jugadores, partidos en CSV y torneos en JSON multilínea) en un modelo relacional, y ejercita las tres APIs principales de Spark: RDDs, DataFrames y Spark SQL. El notebook cubre desde la limpieza de datos hasta joins, reparticionamiento, columnas calculadas con reglas de negocio y diez agregaciones analíticas en SQL declarativo.
02 Aspectos destacados
- Pipeline completo en PySpark que integra cinco fuentes de datos bajo un modelo relacional con claves foráneas.
- Diez agregaciones analíticas en Spark SQL sobre vistas temporales, además de joins con resolución de ambigüedad de columnas.
- Columnas calculadas con reglas de negocio (IMC de jugadores, etiquetas por edad y puntaje).
- Control explícito de particionamiento para ejercitar paralelismo en RDDs y DataFrames.
03 Capturas
Captura a la espera
Interfaz — a la espera