← Back to list

Data Pipeline desde MySQL a HDFS usando Sqoop

Introducción

Jeanpool Bryan Vega · 2024-11-14 23:22 · 0 claps · 1.7 min read
#mysql #hdfs #sqoop #migration #big-data
Open on Medium ↗
Wiki topics: 🔧 · Data Engineering

Data Pipeline desde MySQL a HDFS usando Sqoop

Introducción

En la era de Big Data, manejar y analizar grandes volúmenes de datos es fundamental para extraer información útil y tomar decisiones basadas en datos. Uno de los desafíos comunes es transferir datos de bases de datos relacionales (como MySQL) a sistemas de almacenamiento distribuidos como HDFS (Hadoop Distributed File System) para análisis a gran escala.

Este blog muestra cómo construir un pipeline de datos que migra datos de MySQL a HDFS usando Apache Sqoop. Este proceso permite la ingesta de datos en formatos Avro y Textfile, dos de los formatos más utilizados para almacenamiento y procesamiento en el ecosistema Hadoop.

Esquema de la Base de Datos MySQL

Importación de Datos con Sqoop

Para realizar la importación de datos, usamos el siguiente script de Bash. Este script ejecuta varios comandos de sqoop import para trasladar datos desde la base de datos MySQL hacia el HDFS en dos formatos distintos: Avro y Textfile.

Importación en Formato Avro

El comando sqoop import se utiliza para importar datos desde MySQL a HDFS. Las opciones clave en este script incluyen:

    • -as-avrodatafile: Define el formato de salida como Avro.
    • -target-dir: Especifica el directorio de destino en HDFS.
    • -delete-target-dir: Elimina el directorio de destino antes de la importación para evitar duplicados.

Importación en Formato Textfile

Este bloque de código realiza una importación similar, pero en formato Textfile. Algunas opciones adicionales en estos comandos son:

    • -as-textfile: Define el formato de salida como Textfile.
  • Redirección a archivos de log (>/tmp/log_customer.log), que permite registrar los resultados y errores de cada importación.

Conclusión

Este pipeline permite automatizar la migración de datos desde una base de datos MySQL hacia un sistema distribuido como HDFS usando Sqoop. Los datos importados en formatos Avro y Textfile pueden ser utilizados en diversos procesos de análisis, incluyendo sistemas de machine learning, dashboards o aplicaciones de business intelligence.


메타데이터
post_id
197bd3e2ee2b
slug
data-pipeline-desde-mysql-a-hdfs-usando-sqoop-197bd3e2ee2b
url
https://medium.com/@ryan19pool/data-pipeline-desde-mysql-a-hdfs-usando-sqoop-197bd3e2ee2b
canonical_url
https://medium.com/@ryan19pool/data-pipeline-desde-mysql-a-hdfs-usando-sqoop-197bd3e2ee2b
author_url
https://medium.com/@ryan19pool
status
ok
fetched_at
2026-07-22 04:22:49