Data Pipeline desde MySQL a HDFS usando Sqoop
Introducción
Data Pipeline desde MySQL a HDFS usando Sqoop
Introducción
En la era de Big Data, manejar y analizar grandes volúmenes de datos es fundamental para extraer información útil y tomar decisiones basadas en datos. Uno de los desafíos comunes es transferir datos de bases de datos relacionales (como MySQL) a sistemas de almacenamiento distribuidos como HDFS (Hadoop Distributed File System) para análisis a gran escala.
Este blog muestra cómo construir un pipeline de datos que migra datos de MySQL a HDFS usando Apache Sqoop. Este proceso permite la ingesta de datos en formatos Avro y Textfile, dos de los formatos más utilizados para almacenamiento y procesamiento en el ecosistema Hadoop.
Esquema de la Base de Datos MySQL

Importación de Datos con Sqoop
Para realizar la importación de datos, usamos el siguiente script de Bash. Este script ejecuta varios comandos de sqoop import para trasladar datos desde la base de datos MySQL hacia el HDFS en dos formatos distintos: Avro y Textfile.
Importación en Formato Avro

El comando sqoop import se utiliza para importar datos desde MySQL a HDFS. Las opciones clave en este script incluyen:
-
- -as-avrodatafile: Define el formato de salida como Avro.
-
- -target-dir: Especifica el directorio de destino en HDFS.
-
- -delete-target-dir: Elimina el directorio de destino antes de la importación para evitar duplicados.
Importación en Formato Textfile

Este bloque de código realiza una importación similar, pero en formato Textfile. Algunas opciones adicionales en estos comandos son:
-
- -as-textfile: Define el formato de salida como Textfile.
- Redirección a archivos de log (>/tmp/log_customer.log), que permite registrar los resultados y errores de cada importación.
Conclusión
Este pipeline permite automatizar la migración de datos desde una base de datos MySQL hacia un sistema distribuido como HDFS usando Sqoop. Los datos importados en formatos Avro y Textfile pueden ser utilizados en diversos procesos de análisis, incluyendo sistemas de machine learning, dashboards o aplicaciones de business intelligence.
메타데이터
- post_id
- 197bd3e2ee2b
- slug
- data-pipeline-desde-mysql-a-hdfs-usando-sqoop-197bd3e2ee2b
- url
- https://medium.com/@ryan19pool/data-pipeline-desde-mysql-a-hdfs-usando-sqoop-197bd3e2ee2b
- canonical_url
- https://medium.com/@ryan19pool/data-pipeline-desde-mysql-a-hdfs-usando-sqoop-197bd3e2ee2b
- author_url
- https://medium.com/@ryan19pool
- status
- ok
- fetched_at
- 2026-07-22 04:22:49