← Back to list

Construyendo un pipeline de datos de extremo a extremo en Microsoft Fabric

En este artículo muestro cómo construí, de extremo a extremo, una solución de ingeniería de datos en Microsoft Fabric que ingiere noticias…

Andreretorta · 2026-06-25 09:50 · 0 claps · 4.4 min read
#microsoft-fabric #data-engineering #pipeline #data-fabric #medallion-architecture
Open on Medium ↗
Wiki topics: 🔧 · Data Engineering 🏛️ · Architecture

Construyendo un pipeline de datos de extremo a extremo en Microsoft Fabric

En este artículo muestro cómo construí, de extremo a extremo, una solución de ingeniería de datos en Microsoft Fabric que ingiere noticias de una API pública, organiza los datos con una arquitectura Medallón (Bronze → Silver → Gold), aplica análisis de sentimientos, publica un informe en Power BI y dispara alertas en tiempo real con Data Activator.

La idea central del proyecto: ¿cuál es el “estado de ánimo” de las noticias publicadas? Recopilando titulares de la NewsAPI, procesé el contenido y clasifiqué cada noticia como positiva, neutral o negativa, transformando texto en bruto en una métrica que se puede monitorear.

Visión general de la arquitectura

Visión general de la arquitectura

Todo se construyó dentro de un único workspace de Fabric, bing_api_project, que concentra el Lakehouse, los notebooks, el modelo semántico, el informe y el pipeline de orquestación.

— -

1. Capa Bronze — Ingesta desde la NewsAPI:

La ingesta comienza con una actividad Copy data (“Ingestion — Bronze”) dentro de un Data Pipeline. Es la responsable de llamar a la API y escribir la respuesta en bruto en el Lakehouse, sin ninguna transformación.

El origen es una conexión REST que apunta al endpoint [https://newsapi.org/v2/everything](https://newsapi.org/v2/everything`). La URL relativa se construye de forma dinámica, lo que permite reutilizar el mismo pipeline para cualquier término de búsqueda.

La conexión usa autenticación anónima, ya que la clave de la API se pasa como parámetro en la propia URL, manteniendo el conector simple y reutilizable.

El gran truco está en el constructor de expresiones del pipeline. Usando la función [@concat](http://twitter.com/concat), combino los parámetros search_term y API_KEY para construir la consulta en tiempo de ejecución:

El destino es el Lakehouse bing_lake_db, en la carpeta de Archivos, guardando el resultado como news-happiness-news.json en formato JSON. Este es el corazón de la capa Bronze: datos crudos, fieles a la fuente.

— -

2. Capa Silver — Limpieza de los datos:

Con el JSON en bruto en el Lakehouse, un Notebook (“Silver — Data Cleaning”) entra en acción para estandarizar y limpiar los datos: aplanar la estructura JSON, tratar valores nulos, normalizar fechas y seleccionar solo los campos relevantes (author, title, description, content, source, publishedAt,url).

En la configuración de la actividad, el notebook se vincula al workspace bing_api_project, ejecutando el “Silver Notebook” orquestado por el pipeline.

— -

3. Capa Gold — Análisis de Sentimientos:

La capa Gold es donde aparece el valor de negocio. El notebook “Sentimental Analysis — Gold” recibe los datos limpios de la Silver y aplica procesamiento de lenguaje natural (NLP) para clasificar cada noticia.

El resultado de la capa Bronze/Silver se puede inspeccionar mediante el SQL analytics endpoint del Lakehouse. La tabla t_raw_news muestra las noticias ya estructuradas:

La tabla t_raw_sentiment_nalysis trae el resultado del NLP, con la clasificación (sentiment) y las puntuaciones de probabilidad sentiment_pos, sentiment_neutral y sentiment_neg para cada artículo.

— -

4. Visualización — Informe en Power BI:

Sobre la capa Gold, construí el informe “News PBI” en Power BI. Resume los porcentajes de sentimiento en tarjetas (Negative / Neutral / Positive Sentiment %), lista las noticias con título, fuente y descripción, y ofrece un filtro por fecha de publicación (publishedAt).

— -

5. Tiempo real — Alertas con Data Activator:

Para cerrar el ciclo, configuré Data Activator sobre las métricas del informe. Cada vez que el Neutral Sentiment % disminuye más allá de un umbral definido, se dispara una alerta, con una notificación enviada directamente a Microsoft Teams.

En el hub de tiempo real, el objeto newspbi registra cada evento de métrica de Power BI, lo que permite seguir la evolución del sentimiento a lo largo del tiempo.

— -

Orquestación de extremo a extremo:

Todas las etapas se enlazan en un único Data Pipeline, que ejecuta las tres capas en secuencia, garantizando dependencias y orden correctos:

Ingestion — Bronze → Silver — Data Cleaning → Sentimental Analysis — Gold

— -

Conclusión:

Con Microsoft Fabric fue posible entregar, en una única plataforma SaaS, todas las piezas de una solución de datos moderna:

  • Ingesta desde una API REST mediante un Data Pipeline;
  • Arquitectura Medallón (Bronze, Silver, Gold) en el Lakehouse;
  • Análisis de sentimientos con NLP en notebooks PySpark;
  • Visualización en Power BI;
  • Alertas en tiempo real con Data Activator e integración con Teams.

La gran ventaja es la integración nativa: no tuve que unir servicios separados: todo (almacenamiento, procesamiento, BI y alertas) vive en el mismo ecosistema, con gobernanza y seguridad centralizadas.


메타데이터
post_id
8fe2d2d3cc92
slug
construyendo-un-pipeline-de-datos-de-extremo-a-extremo-en-microsoft-fabric-8fe2d2d3cc92
url
https://medium.com/@andreretorta046/construyendo-un-pipeline-de-datos-de-extremo-a-extremo-en-microsoft-fabric-8fe2d2d3cc92
canonical_url
https://medium.com/@andreretorta046/construyendo-un-pipeline-de-datos-de-extremo-a-extremo-en-microsoft-fabric-8fe2d2d3cc92
author_url
https://medium.com/@andreretorta046
status
ok
fetched_at
2026-07-22 01:37:57