Vojtěch ŠímaData Bender

Datové inženýrství

4 článků na téma Datové inženýrství: benchmarky, vnitřnosti a workaroundy pro Microsoft data stack.

  1. 04
    Fabric Dataflow Gen2 Partitioned Compute: Nastavení a Benchmark

    Zjisti, jak v Dataflow Gen2 nastavit Partitioned Compute pro paralelní zpracování. Mrkni na návod a reálné výsledky mého benchmarku v Microsoft Fabric.

  2. 03
    Automatická údržba delta tabulek ve Fabric Lakehouse (bez PySparku)

    Ponoř se do fungování Delta tabulek & údržba, transakčních logů a rozložení úložiště. Ovládni údržbu, VACUUM a Z-Order pomocí Pythonu (delta-rs) v Microsoft Fabric.

  3. 02
    Automatická synchronizace SQL Analytics Endpointu v Microsoft Fabric

    Zjisti, jak funguje SQL Analytics Endpoint v Microsoft Fabric, proč se může opožďovat za Lakehousem a jak ho automaticky synchronizovat přes REST API.

  4. 01
    Dataflows Gen1 and Gen2: Kam se data ukládají?

    Dataflows vysvětleny: storage v Gen1 vs Gen2, CSV vs Delta, SQL cache a staging Lakehouse a Warehouse. Zjistíš, co kde žije a jak se připojit rychle.