Data Engineering w Fabric: co to jest i od czego zacząć

Temat: Microsoft AI

Plik z zamówieniami trafia do analityka, który poprawia daty, usuwa powtórzenia i dopiero wtedy odświeża raport. Następnego dnia zaczyna od nowa. Data Engineering w Microsoft Fabric pomaga zamienić takie czynności w powtarzalny proces przygotowania danych. Warunkiem jest zapisanie reguł biznesowych i sprawdzenie wyniku. Sam notebook, który raz wykonał się bez błędu, jeszcze tego nie zapewnia.

Jeżeli potok już powstał i szukasz kryteriów, na których go odebrać, przejdź do poradnika o odbiorze potoku danych.

Co obejmuje Data Engineering

Microsoft udostępnia w tym obszarze między innymi lakehouse, notebooki, definicje zadań Apache Spark i współpracę z potokami danych. Notebook służy do interaktywnej pracy z kodem, a definicja zadania Spark opisuje uruchomienie aplikacji przetwarzającej dane. Potok może koordynować kolejne kroki. Dokumentacja Data Engineering opisuje te elementy jako narzędzia do zbierania, przygotowania i analizy danych.

Jeżeli odpowiadasz za raportowanie w firmie usługowej, nie musisz zaczynać od wyboru języka programowania. Najpierw ustal, jaki zbiór ma otrzymać odbiorca. Czy jeden rekord oznacza zamówienie, jego pozycję, czy wykonanie usługi? Bez tej decyzji dwa poprawne technicznie przekształcenia mogą dać różne sumy.

Dobrym pierwszym zadaniem jest zastąpienie jednej regularnej operacji ręcznej. Wybierz taką, której zasady można wyjaśnić i której wynik ktoś rzeczywiście wykorzystuje. Przenoszenie wszystkich arkuszy naraz utrudnia porównanie i zaciera odpowiedzialność za błędy.

Od pliku do tabeli, której można użyć

Lakehouse w Fabric pozwala przechowywać pliki i tabele oraz korzystać z przetwarzania Spark. Dostęp SQL przez SQL analytics endpoint dotyczy tabel Delta; samo umieszczenie CSV w obszarze plików nie daje identycznego rezultatu. Endpoint służy do odczytu danych i nie jest odpowiednikiem pełnego zakresu operacji hurtowni. Te rozróżnienia wynikają z opisu lakehouse.

Dla modelowego importu zamówień proponuję cztery etapy. Są zasadą organizacji pracy, nie obowiązkowym szablonem produktu.

EtapCo robiszCo zachowujesz jako dowód
PrzyjęcieZapisujesz dane wejściowe i moment ich pobraniaNazwę źródła, zakres dat i identyfikator dostawy
PorządkowanieUjednolicasz typy, daty i identyfikatoryListę zastosowanych reguł
KontrolaWykrywasz braki, duplikaty i niezgodnościLiczby rekordów przyjętych i odrzuconych
UdostępnieniePublikujesz uzgodnioną tabelę wynikowąWersję reguł i czas aktualizacji

Odrzucony rekord nie powinien po prostu znikać. Zapisz powód i ścieżkę wyjaśnienia. Brak numeru klienta może oznaczać błąd eksportu, nowego kontrahenta albo dopuszczalną transakcję anonimową. Osoba znająca proces musi rozstrzygnąć, które znaczenie jest właściwe.

Oddziel też porządkowanie techniczne od decyzji biznesowej. Zamiana tekstu na datę to inny rodzaj zmiany niż usunięcie anulowanych zamówień. Ta druga wpływa na interpretację raportu i wymaga uzgodnienia z jego odbiorcą.

Dlaczego działający kod nie wystarcza

Notebook ułatwia sprawdzanie pomysłów na próbce. Przy regularnym uruchamianiu potrzebujesz dodatkowo określonych parametrów, obsługi błędów i informacji o zakończeniu. Proponuję zapisać datę przetwarzanego okresu jako jawne wejście. Dzięki temu zadanie nie będzie zależeć wyłącznie od tego, kiedy ktoś kliknął uruchomienie.

Sprawdź również ponowienie. Jeżeli ten sam plik zostanie dostarczony dwa razy, czy wynik podwoi przychód? Rozwiązanie powinno mieć uzgodniony sposób rozpoznania już obsłużonych danych albo bezpiecznego zastąpienia wyniku. Wybór zależy od źródła, historii i znaczenia korekt. Nie istnieje jedna reguła usuwania duplikatów odpowiednia dla każdej tabeli.

Wprowadź prostą zasadę publikacji: odbiorca otrzymuje wynik dopiero po przejściu kontroli, które uznaliście za konieczne. Jeżeli kontrola nie przejdzie, raport powinien jasno pokazywać stan i czas ostatnich poprawnych danych. Cisza nie może oznaczać jednocześnie sukcesu i awarii.

Jak policzyć jakość wyniku

Przykład syntetyczny: plik zawiera 1000 wierszy. Kontrola wykrywa 20 powtórzeń oraz 30 innych wierszy bez obowiązkowego identyfikatora; obie grupy są rozłączne. Do dalszej pracy dopuszczasz 950 wierszy. Udział dopuszczonych wynosi 95%, ale nie jest to dowód, że pozostałe dane są w pełni poprawne. To wynik konkretnych dwóch kontroli.

Jeżeli wszystkie 30 brakujących identyfikatorów dotyczy największego klienta, niewielki procent braków może istotnie zmienić raport. Dlatego poza liczbą wierszy sprawdzaj wartości oraz rozkład problemów.

KontrolaPytanie do odbiorcyDlaczego jest potrzebna
KompletnośćCzy obejmujemy wszystkie oczekiwane dni i oddziały?Równa liczba rekordów może ukrywać brak jednego okresu
WartośćCzy suma odpowiada zatwierdzonemu źródłu?Mało błędnych wierszy może oznaczać dużą różnicę kwot
RelacjeCzy każda pozycja ma właściwe zamówienie?Połączenie tabel może zwielokrotnić wynik
AktualnośćJak stare dane są jeszcze przydatne?Poprawna historyczna tabela może być za późna do decyzji

Zapisz progi i sposób reakcji przed odbiorem. Gdy wynik odbiega od oczekiwań, zespół powinien wiedzieć, czy zatrzymać publikację, ostrzec odbiorcę, czy przekazać rekordy do poprawy. Sama liczba błędów w dzienniku nie podejmuje tej decyzji.

Co ten proces daje projektowi AI

Uporządkowana tabela może zasilać analizę lub przygotowanie danych do modelowania. Nie gwarantuje jednak lepszego modelu ani trafnej rekomendacji. Potrzebujesz jeszcze właściwego celu, reprezentatywnych danych i osobnej oceny rozwiązania AI. W szczególności nie traktuj braku wartości jako zera, jeżeli oznacza on „nie otrzymaliśmy informacji”.

Zadbaj o możliwość odtworzenia zbioru użytego do konkretnej analizy. Jeżeli po miesiącu zmienisz regułę przypisywania klientów do segmentów, porównanie wyników powinno uwzględnić tę zmianę. W przeciwnym razie możesz przypisać efekt nowemu modelowi, chociaż zmieniły się dane wejściowe.

Pierwszy krok w poniedziałek

Weź jeden regularny eksport i poproś analityka o opisanie wszystkich ręcznych poprawek. Każdą zamień na regułę, przykład wejścia i oczekiwany wynik. Wybierz odbiorcę, który potwierdzi znaczenie tabeli. Dopiero z tym materiałem rozpocznij automatyzację.

Następnie wykorzystaj poradnik o odbiorze potoku Data Engineering, aby sprawdzić powtarzalność rozwiązania. Szersze powiązanie danych i odpowiedzialności opisuje podejście do systemu firmy. Celem jest zbiór, który da się wyjaśnić i ponownie przygotować bez pamięci jednej osoby.

Przełóż temat na projekt w Twojej firmie

Zobacz zakres współpracy: od rozpoznania procesu i danych po projekt rozwiązania AI.