Data Factory w Fabric: co to jest i kiedy go użyć
Temat: Microsoft AI
Dane z CRM są już skopiowane do platformy analitycznej, ale raport nadal wymaga ręcznego łączenia ich z fakturami. Data Factory w Microsoft Fabric pomaga przenosić dane, przekształcać je i koordynować zadania — to trzy różne potrzeby. Dobór właściwego mechanizmu zaczyna się od określenia wyniku, a nie od narysowania jak największego potoku.
Jeśli odpowiadasz za wdrożenie w firmie usługowej, zapytaj najpierw: co odbiorca ma otrzymać, o której godzinie i z jaką dokładnością? Lista konektorów nie odpowiada na żadne z tych pytań. Pomaga dopiero wtedy, gdy znasz źródło, cel i zasady przygotowania danych.
Jeżeli integracja już działa i szukasz kryteriów, na których ją odebrać, przejdź do poradnika o odbiorze integracji danych.
Co robi Data Factory w Fabric
Data Factory jest obszarem integracji danych w Fabric. Obejmuje mechanizmy przenoszenia informacji, transformacji oraz orkiestracji, czyli sterowania kolejnością i warunkami wykonania zadań. Przegląd Microsoft rozróżnia między innymi Copy job, Copy activity, Dataflow Gen2 i potoki.
Nie traktuj tych nazw jako czterech konkurujących produktów do identycznej pracy. Możesz potrzebować prostego przeniesienia tabeli albo procesu, który po pobraniu danych uruchamia kolejne obliczenia. Wybór powinien wynikać ze stopnia złożoności zadania i umiejętności zespołu, który będzie je utrzymywać.
Pierwszy projekt ogranicz do jednego wyniku biznesowego. Na przykład: zestawienia otwartych zamówień z informacją o wystawionych fakturach. Taki zakres pozwala sprawdzić definicje i odpowiedzialność, zanim dołączysz kolejne źródła.
Kopiowanie, transformacja i kolejność
Copy job służy uproszczonemu przenoszeniu danych; Copy activity jest aktywnością kopiowania używaną w potoku. Pipeline pozwala łączyć aktywności i sterować przepływem pracy. Te role opisuje dokumentacja przeglądowa. Szczegółowe możliwości zależą od źródła, celu i konfiguracji, dlatego nie zakładaj identycznej obsługi wszystkich baz i usług.
| Potrzeba | Mechanizm do oceny | Pytanie przed wyborem |
|---|---|---|
| Regularne przenoszenie tabel | Copy job | Czy obsługuje wymagany sposób aktualizacji dla tej pary źródło–cel? |
| Kopiowanie jako krok większego procesu | Copy activity w pipeline | Co musi nastąpić przed i po kopiowaniu? |
| Przygotowanie danych w edytorze wizualnym | Dataflow Gen2 | Czy reguły da się jasno wyrazić i utrzymać? |
| Uruchomienie kilku zależnych operacji | Pipeline | Jak zachować się po błędzie każdej aktywności? |
Dataflow Gen2 korzysta z doświadczenia Power Query i umożliwia wizualne przygotowanie danych, między innymi filtrowanie, łączenie i zmianę ich kształtu. Może zapisywać wynik w obsługiwanych miejscach docelowych oraz współpracować z potokami. Znajomość Power Query ułatwia start, ale nie zastępuje kontroli znaczenia transformacji.
Jeśli połączysz zamówienia z fakturami po niewłaściwym kluczu, interfejs może poprawnie wykonać błędnie zaprojektowaną operację. Przed konfiguracją ustal, czy relacja jest jeden do jednego, czy jedno zamówienie może mieć kilka faktur. To decyzja o danych firmy, nie o wyglądzie edytora.
ETL czy ELT: gdzie przygotować wynik
W ETL przekształcasz dane przed załadowaniem wyniku do miejsca docelowego. W ELT najpierw je ładujesz, a później przetwarzasz w środowisku docelowym. Fabric pozwala budować oba podejścia. Nie ma potrzeby ogłaszać jednego z nich jedynym właściwym wzorcem dla całej firmy.
Rozważ, co trzeba zachować do odtworzenia analizy, jakie dane wolno udostępnić i gdzie zespół najłatwiej utrzyma logikę. Przeniesienie surowych danych może ułatwić ponowne przeliczenie, lecz wymaga zasad dostępu i retencji. Wcześniejsze ograniczenie zakresu zmniejsza ilość przesyłanych informacji, ale może utrudnić diagnozę, jeśli odrzucisz materiał potrzebny do wyjaśnienia błędu.
Zapisz tę decyzję przy konkretnym zbiorze. „Wszystko kopiujemy” i „wszystko czyścimy przed zapisem” to zbyt ogólne reguły, żeby rozwiązać każdy przypadek integracji.
Pełne pobranie czy tylko zmiany
Przykład syntetyczny: źródło zawiera 100 000 rekordów, a w danym dniu zmieniło się 2000. Pobranie wyłącznie tych zmian oznacza przetworzenie 2% liczby rekordów pełnego zbioru. Nie dowodzi jednak 98% oszczędności kosztu ani czasu. Trzeba jeszcze wykryć zmiany, zapisać je w celu i obsłużyć błędy.
Szczególnie ważne są usunięcia i korekty. Filtr po dacie utworzenia nie znajdzie późniejszej zmiany starego dokumentu. Sama kolumna daty modyfikacji nie zawsze informuje o rekordzie usuniętym ze źródła. Projekt powinien wyjaśniać, skąd bierze tę informację i jak sprawdza zgodność wyniku.
| Kryterium | Pełne pobranie | Pobranie zmian |
|---|---|---|
| Zakres | Cały uzgodniony zbiór | Zmiany od określonego punktu |
| Główna zaleta do sprawdzenia | Prostsze porównanie kompletnego stanu | Mniejsza ilość przenoszonych danych |
| Ważne ryzyko | Długi czas i obciążenie źródła | Pominięcie korekty lub usunięcia |
| Próba odbioru | Zgodność sum i liczby rekordów | Nowy rekord, aktualizacja, usunięcie i ponowienie |
To kryteria projektowe, a nie obietnica, że każdy konektor realizuje oba warianty. Sprawdź konkretną konfigurację na reprezentatywnej próbce przed zatwierdzeniem architektury.
Kto utrzyma połączenie
Integracja potrzebuje właściciela także po uruchomieniu. Ustal, kto odnawia poświadczenia, reaguje na zmianę schematu i potwierdza brak danych. Konto osoby przygotowującej demonstrację nie powinno być jedyną odpowiedzią na pytanie o ciągłość procesu. Wybierz model dostępu zgodny z możliwościami konektora i zasadami firmy.
Jeżeli źródło znajduje się w sieci lokalnej, uwzględnij sposób połączenia i dostępność wymaganych komponentów. Test na laptopie wykonawcy nie potwierdza jeszcze działania w docelowym środowisku. Sprawdź również godzinę wykonania: pobieranie dużego zbioru podczas pracy użytkowników może mieć inne skutki niż nocna próba.
Zanim zaakceptujesz automatyzację, poproś o opis kosztów utrzymania obok kosztu wykonania. Czas diagnozy, zmiany reguł i obsługi wyjątków jest częścią rozwiązania. Nie wyliczaj zwrotu z inwestycji wyłącznie z liczby ręcznych kliknięć, które znikną z jednego arkusza.
Pierwsza decyzja w poniedziałek
Opisz jeden przepływ: źródło, wynik, termin, reguły zmian i właściciela. Następnie dobierz najmniejszy zestaw mechanizmów, który spełnia wymagania. Przeczytaj poradnik o odbiorze integracji danych w Data Factory, żeby przygotować kryteria odbioru przed wdrożeniem. Szerszą perspektywę przedstawia podejście do systemu firmy. Dobra integracja kończy się użytecznymi danymi, za które ktoś odpowiada.
- Dane i analityka
- Modele i LLM
- Zarządzanie zmianą
- Bezpieczeństwo
