Data Engineering w Fabric: co to jest i od czego zacząć
Temat: Microsoft AI
Plik z zamówieniami trafia do analityka, który poprawia daty, usuwa powtórzenia i dopiero wtedy odświeża raport. Następnego dnia zaczyna od nowa. Data Engineering w Microsoft Fabric pomaga zamienić takie czynności w powtarzalny proces przygotowania danych. Warunkiem jest zapisanie reguł biznesowych i sprawdzenie wyniku. Sam notebook, który raz wykonał się bez błędu, jeszcze tego nie zapewnia.
Jeżeli potok już powstał i szukasz kryteriów, na których go odebrać, przejdź do poradnika o odbiorze potoku danych.
Co obejmuje Data Engineering
Microsoft udostępnia w tym obszarze między innymi lakehouse, notebooki, definicje zadań Apache Spark i współpracę z potokami danych. Notebook służy do interaktywnej pracy z kodem, a definicja zadania Spark opisuje uruchomienie aplikacji przetwarzającej dane. Potok może koordynować kolejne kroki. Dokumentacja Data Engineering opisuje te elementy jako narzędzia do zbierania, przygotowania i analizy danych.
Jeżeli odpowiadasz za raportowanie w firmie usługowej, nie musisz zaczynać od wyboru języka programowania. Najpierw ustal, jaki zbiór ma otrzymać odbiorca. Czy jeden rekord oznacza zamówienie, jego pozycję, czy wykonanie usługi? Bez tej decyzji dwa poprawne technicznie przekształcenia mogą dać różne sumy.
Dobrym pierwszym zadaniem jest zastąpienie jednej regularnej operacji ręcznej. Wybierz taką, której zasady można wyjaśnić i której wynik ktoś rzeczywiście wykorzystuje. Przenoszenie wszystkich arkuszy naraz utrudnia porównanie i zaciera odpowiedzialność za błędy.
Od pliku do tabeli, której można użyć
Lakehouse w Fabric pozwala przechowywać pliki i tabele oraz korzystać z przetwarzania Spark. Dostęp SQL przez SQL analytics endpoint dotyczy tabel Delta; samo umieszczenie CSV w obszarze plików nie daje identycznego rezultatu. Endpoint służy do odczytu danych i nie jest odpowiednikiem pełnego zakresu operacji hurtowni. Te rozróżnienia wynikają z opisu lakehouse.
Dla modelowego importu zamówień proponuję cztery etapy. Są zasadą organizacji pracy, nie obowiązkowym szablonem produktu.
| Etap | Co robisz | Co zachowujesz jako dowód |
|---|---|---|
| Przyjęcie | Zapisujesz dane wejściowe i moment ich pobrania | Nazwę źródła, zakres dat i identyfikator dostawy |
| Porządkowanie | Ujednolicasz typy, daty i identyfikatory | Listę zastosowanych reguł |
| Kontrola | Wykrywasz braki, duplikaty i niezgodności | Liczby rekordów przyjętych i odrzuconych |
| Udostępnienie | Publikujesz uzgodnioną tabelę wynikową | Wersję reguł i czas aktualizacji |
Odrzucony rekord nie powinien po prostu znikać. Zapisz powód i ścieżkę wyjaśnienia. Brak numeru klienta może oznaczać błąd eksportu, nowego kontrahenta albo dopuszczalną transakcję anonimową. Osoba znająca proces musi rozstrzygnąć, które znaczenie jest właściwe.
Oddziel też porządkowanie techniczne od decyzji biznesowej. Zamiana tekstu na datę to inny rodzaj zmiany niż usunięcie anulowanych zamówień. Ta druga wpływa na interpretację raportu i wymaga uzgodnienia z jego odbiorcą.
Dlaczego działający kod nie wystarcza
Notebook ułatwia sprawdzanie pomysłów na próbce. Przy regularnym uruchamianiu potrzebujesz dodatkowo określonych parametrów, obsługi błędów i informacji o zakończeniu. Proponuję zapisać datę przetwarzanego okresu jako jawne wejście. Dzięki temu zadanie nie będzie zależeć wyłącznie od tego, kiedy ktoś kliknął uruchomienie.
Sprawdź również ponowienie. Jeżeli ten sam plik zostanie dostarczony dwa razy, czy wynik podwoi przychód? Rozwiązanie powinno mieć uzgodniony sposób rozpoznania już obsłużonych danych albo bezpiecznego zastąpienia wyniku. Wybór zależy od źródła, historii i znaczenia korekt. Nie istnieje jedna reguła usuwania duplikatów odpowiednia dla każdej tabeli.
Wprowadź prostą zasadę publikacji: odbiorca otrzymuje wynik dopiero po przejściu kontroli, które uznaliście za konieczne. Jeżeli kontrola nie przejdzie, raport powinien jasno pokazywać stan i czas ostatnich poprawnych danych. Cisza nie może oznaczać jednocześnie sukcesu i awarii.
Jak policzyć jakość wyniku
Przykład syntetyczny: plik zawiera 1000 wierszy. Kontrola wykrywa 20 powtórzeń oraz 30 innych wierszy bez obowiązkowego identyfikatora; obie grupy są rozłączne. Do dalszej pracy dopuszczasz 950 wierszy. Udział dopuszczonych wynosi 95%, ale nie jest to dowód, że pozostałe dane są w pełni poprawne. To wynik konkretnych dwóch kontroli.
Jeżeli wszystkie 30 brakujących identyfikatorów dotyczy największego klienta, niewielki procent braków może istotnie zmienić raport. Dlatego poza liczbą wierszy sprawdzaj wartości oraz rozkład problemów.
| Kontrola | Pytanie do odbiorcy | Dlaczego jest potrzebna |
|---|---|---|
| Kompletność | Czy obejmujemy wszystkie oczekiwane dni i oddziały? | Równa liczba rekordów może ukrywać brak jednego okresu |
| Wartość | Czy suma odpowiada zatwierdzonemu źródłu? | Mało błędnych wierszy może oznaczać dużą różnicę kwot |
| Relacje | Czy każda pozycja ma właściwe zamówienie? | Połączenie tabel może zwielokrotnić wynik |
| Aktualność | Jak stare dane są jeszcze przydatne? | Poprawna historyczna tabela może być za późna do decyzji |
Zapisz progi i sposób reakcji przed odbiorem. Gdy wynik odbiega od oczekiwań, zespół powinien wiedzieć, czy zatrzymać publikację, ostrzec odbiorcę, czy przekazać rekordy do poprawy. Sama liczba błędów w dzienniku nie podejmuje tej decyzji.
Co ten proces daje projektowi AI
Uporządkowana tabela może zasilać analizę lub przygotowanie danych do modelowania. Nie gwarantuje jednak lepszego modelu ani trafnej rekomendacji. Potrzebujesz jeszcze właściwego celu, reprezentatywnych danych i osobnej oceny rozwiązania AI. W szczególności nie traktuj braku wartości jako zera, jeżeli oznacza on „nie otrzymaliśmy informacji”.
Zadbaj o możliwość odtworzenia zbioru użytego do konkretnej analizy. Jeżeli po miesiącu zmienisz regułę przypisywania klientów do segmentów, porównanie wyników powinno uwzględnić tę zmianę. W przeciwnym razie możesz przypisać efekt nowemu modelowi, chociaż zmieniły się dane wejściowe.
Pierwszy krok w poniedziałek
Weź jeden regularny eksport i poproś analityka o opisanie wszystkich ręcznych poprawek. Każdą zamień na regułę, przykład wejścia i oczekiwany wynik. Wybierz odbiorcę, który potwierdzi znaczenie tabeli. Dopiero z tym materiałem rozpocznij automatyzację.
Następnie wykorzystaj poradnik o odbiorze potoku Data Engineering, aby sprawdzić powtarzalność rozwiązania. Szersze powiązanie danych i odpowiedzialności opisuje podejście do systemu firmy. Celem jest zbiór, który da się wyjaśnić i ponownie przygotować bez pamięci jednej osoby.
- Dane i analityka
- Modele i LLM
- Azure
- Zarządzanie zmianą
