Microsoft Fabric: del caos del stack moderno a una plataforma de datos reinventada
La paradoja de las plataformas de datos modernas
Durante la última década, las empresas han ido acumulando herramientas para montar la “Modern Data Stack” perfecta. En la práctica, el resultado suele ser justo el contrario: datos hay de sobra, pero las arquitecturas se han vuelto enormemente complejas.
El esquema habitual apila piezas especializadas: una herramienta de ingesta, un Data Lake para almacenar, un Data Warehouse para las consultas estructuradas, clústeres Spark para ciencia de datos y una herramienta de BI para el reporting. Esa fragmentación arrastra tres problemas de fondo:
- Datos duplicados: cada etapa de transformación genera una copia nueva, lo que dispara los costes de almacenamiento y abre la puerta a versiones que no cuadran entre sí.
- Fricción operativa: mantener los pipelines ETL que conectan cada herramienta consume una parte enorme del tiempo de los equipos de datos.
- Gobernanza dispersa: aplicar las mismas reglas de seguridad, acceso y cumplimiento en cinco o seis herramientas distintas se vuelve casi imposible de mantener.
Microsoft Fabric: un cambio de paradigma sobre OneLake
Fabric no es una herramienta más que sumar al catálogo, sino un rediseño completo del modelo de arquitectura.
OneLake: el “OneDrive” de los datos de la empresa
En el centro de la propuesta está OneLake, un repositorio SaaS único y compartido por toda la organización:
- Una única fuente de verdad: todas las cargas de trabajo (Data Engineering, Data Science, Data Warehouse, Real-time Analytics, Power BI) trabajan sobre ese mismo repositorio, en formato abierto Delta Parquet.
- Se acabó mover los datos de un sitio a otro: ya no hace falta copiar datos del Lakehouse a un Data Warehouse para consultarlos o analizarlos.
- Doble vista al instante (Lakehouse y SQL Endpoint): Fabric permite alternar con un clic entre la vista de archivos y tablas del Lakehouse y un SQL Analytics Endpoint, con toda la potencia de T-SQL directamente sobre los datos del lago.
| Componente / uso | Enfoque tradicional (multiherramienta) | Enfoque Microsoft Fabric (OneLake) |
| Almacenamiento | Silos múltiples (S3/Blob, Redshift, Snowflake, SQL) | OneLake centralizado en formato abierto Delta Parquet |
| Transformaciones | Duplicación y ETL complejos entre herramientas | Trabajo sobre una sola copia mediante Workspaces |
| Visualización BI | Importación programada o DirectQuery lento | Modo Direct Lake (tiempo real + rendimiento in-memory) |
| Gobernanza | Reglas de seguridad aisladas por herramienta | Integración nativa de extremo a extremo (Microsoft Purview) |
De los datos en bruto a las vistas de negocio en 15 minutos
En una prueba de ingesta masiva con un conjunto de más de 60 millones de filas (los trayectos de taxi de Nueva York), el equipo de data-major mostró lo fluido que resulta el flujo de trabajo en Fabric.
A. Ingesta y transformación sin fricciones
Llevar los datos en bruto al Lakehouse con los pipelines de Data Factory integrados en el Workspace es cuestión de unos pocos clics. Fabric infiere el esquema automáticamente y estructura las tablas Delta sin necesidad de configuración manual complicada.
B. IA generativa y Data Agents al servicio del análisis
Fabric integra Copilot y agentes conversacionales de forma nativa:
- Ayuda con el código: genera scripts de Python/Spark en los notebooks a partir de instrucciones en lenguaje natural.
- Data Agents a medida: configurando directivas de respuesta (reglas de negocio y columnas clave), puedes consultar los datos directamente en lenguaje natural.
- Un ejemplo real: ante una pregunta como “¿cuál es el importe medio de los trayectos pagados con tarjeta a medianoche y qué porcentaje de propina llevan asociado?”, el agente la procesa por su cuenta y devuelve un resultado exacto y verificable (por ejemplo, una tarifa media de 13,31 $ con un 20 % de propina).
C. Direct Lake: el fin del dilema en Power BI
El modo Direct Lake acaba con la vieja disyuntiva entre Import y DirectQuery: Power BI lee directamente los archivos Delta de OneLake con el rendimiento de la memoria, con los datos siempre sincronizados y sin duplicar el conjunto.
Modelo económico y FinOps: una capacidad compartida
En lugar de aprovisionar y pagar por separado cada servicio en la nube (Data Factory, Synapse, Databricks, Power BI Premium), la factura depende de solo dos variables:
- La potencia de computación: una capacidad global y compartida (medida en Capacity Units, CU) que sirve a todas las cargas de trabajo: ingesta, consultas SQL, notebooks, informes e IA.
- El almacenamiento: el volumen real de datos guardado en OneLake.
Este modelo aporta flexibilidad en la asignación de recursos y previsibilidad presupuestaria para los equipos de FinOps.
Recomendaciones de data-major
Tras acompañar a más de un centenar de clientes, en data-major insistimos en tres ideas:
- Gobernanza desde el primer día: aprovecha la integración nativa con Microsoft Purview para definir la trazabilidad de datos y los accesos antes de crear espacios de trabajo.
- Replantea los modelos de BI: usa Direct Lake para simplificar la arquitectura y quitarte de encima actualizaciones que ya no hacen falta.
Ponle un marco a la IA: define un diccionario de datos y unas reglas de negocio claras para que las respuestas de los agentes sean precisas.
Microsoft Fabric centraliza toda la información en un único repositorio SaaS llamado OneLake, utilizando el formato abierto Delta Parquet. Esto permite que todas las cargas de trabajo (Data Engineering, SQL, Ciencia de Datos y Power BI) operen sobre una única copia de los datos, eliminando la necesidad de mover o duplicar archivos entre diferentes herramientas.
El modo Direct Lake permite a Power BI consultar directamente los archivos Delta almacenados en OneLake con un rendimiento en memoria. Esto elimina el dilema entre las importaciones programadas y las consultas directas lentas, logrando que los datos estén siempre actualizados en tiempo real sin tener que duplicar los conjuntos de datos.
