Ingeniería
Aplicada
Resultados
samuel-torres.com
Construir un pipeline ETL pequeño y completo: extraer datos de precios de criptomonedas de una API pública, transformarlos a una forma lista para análisis, y guardarlos de forma eficiente para consultas posteriores. Proyecto personal.
Python · pandas · Parquet · requests · ETL · Ingeniería de Datos
Un pipeline ETL (Extract, Transform, Load) pequeño y completo, construido para practicar fundamentos de ingeniería de datos sobre datos de mercado reales y de acceso libre. Extrae datos de precios de criptomonedas de una API pública, los limpia y transforma con pandas, y guarda el resultado en un formato columnar pensado para análisis repetido, no para lecturas de una sola vez.
requests de Python.Parquet guarda datos tipados y columnares con compresión integrada — leer un puñado de columnas de una serie de tiempo grande es mucho más barato que parsear un CSV completo cada vez.
Volver a correr el pipeline para un rango de fechas ya procesado no debería crear filas duplicadas — el paso de carga está escrito para verificar qué ya existe antes de escribir.
La extracción no sabe nada de pandas, y el paso de transformación no sabe de dónde vinieron los datos ni a dónde van — cada etapa se puede probar y razonar por su cuenta.
Un pipeline ETL que extrae datos de precios de criptomonedas de una API pública, los transforma con pandas, y los carga en Parquet para análisis repetido y eficiente.