---
title: "Data Factory w Fabric: co to jest i kiedy go użyć"
url: "https://majchrzycki.com/blog/co-to-jest-data-factory-integracja-danych-w-microsoft-fabric"
description: "Czym jest Data Factory w Microsoft Fabric: Copy job, Dataflow Gen2 i potoki, ETL czy ELT, pełne pobranie czy tylko zmiany. Jak dobrać mechanizm do wyniku."
---

# Data Factory w Fabric: co to jest i kiedy go użyć

21 kwietnia 2024· Aktualizacja: 18 września 2026·4 min czytania·Krzysztof Majchrzycki

Temat: [Microsoft AI](https://majchrzycki.com/blog/filar/microsoft-ai)

Dane z CRM są już skopiowane do platformy analitycznej, ale raport nadal wymaga ręcznego łączenia ich z fakturami. **Data Factory w Microsoft Fabric pomaga przenosić dane, przekształcać je i koordynować zadania — to trzy różne potrzeby.** Dobór właściwego mechanizmu zaczyna się od określenia wyniku, a nie od narysowania jak największego potoku.

Jeśli odpowiadasz za wdrożenie w firmie usługowej, zapytaj najpierw: co odbiorca ma otrzymać, o której godzinie i z jaką dokładnością? Lista konektorów nie odpowiada na żadne z tych pytań. Pomaga dopiero wtedy, gdy znasz źródło, cel i zasady przygotowania danych.

Jeżeli integracja już działa i szukasz kryteriów, na których ją odebrać, przejdź do [poradnika o odbiorze integracji danych](https://majchrzycki.com/blog/jak-odebrac-integracje-danych-data-factory-w-microsoft-fabric).

## Co robi Data Factory w Fabric

Data Factory jest obszarem integracji danych w Fabric. Obejmuje mechanizmy przenoszenia informacji, transformacji oraz orkiestracji, czyli sterowania kolejnością i warunkami wykonania zadań. [Przegląd Microsoft](https://learn.microsoft.com/en-us/fabric/data-factory/data-factory-overview) rozróżnia między innymi Copy job, Copy activity, Dataflow Gen2 i potoki.

Nie traktuj tych nazw jako czterech konkurujących produktów do identycznej pracy. Możesz potrzebować prostego przeniesienia tabeli albo procesu, który po pobraniu danych uruchamia kolejne obliczenia. Wybór powinien wynikać ze stopnia złożoności zadania i umiejętności zespołu, który będzie je utrzymywać.

Pierwszy projekt ogranicz do jednego wyniku biznesowego. Na przykład: zestawienia otwartych zamówień z informacją o wystawionych fakturach. Taki zakres pozwala sprawdzić definicje i odpowiedzialność, zanim dołączysz kolejne źródła.

## Kopiowanie, transformacja i kolejność

Copy job służy uproszczonemu przenoszeniu danych; Copy activity jest aktywnością kopiowania używaną w potoku. Pipeline pozwala łączyć aktywności i sterować przepływem pracy. Te role opisuje dokumentacja przeglądowa. Szczegółowe możliwości zależą od źródła, celu i konfiguracji, dlatego nie zakładaj identycznej obsługi wszystkich baz i usług.

Potrzeba

Mechanizm do oceny

Pytanie przed wyborem

Regularne przenoszenie tabel

Copy job

Czy obsługuje wymagany sposób aktualizacji dla tej pary źródło–cel?

Kopiowanie jako krok większego procesu

Copy activity w pipeline

Co musi nastąpić przed i po kopiowaniu?

Przygotowanie danych w edytorze wizualnym

Dataflow Gen2

Czy reguły da się jasno wyrazić i utrzymać?

Uruchomienie kilku zależnych operacji

Pipeline

Jak zachować się po błędzie każdej aktywności?

[Dataflow Gen2](https://learn.microsoft.com/en-us/fabric/data-factory/dataflows-gen2-overview) korzysta z doświadczenia Power Query i umożliwia wizualne przygotowanie danych, między innymi filtrowanie, łączenie i zmianę ich kształtu. Może zapisywać wynik w obsługiwanych miejscach docelowych oraz współpracować z potokami. Znajomość Power Query ułatwia start, ale nie zastępuje kontroli znaczenia transformacji.

Jeśli połączysz zamówienia z fakturami po niewłaściwym kluczu, interfejs może poprawnie wykonać błędnie zaprojektowaną operację. Przed konfiguracją ustal, czy relacja jest jeden do jednego, czy jedno zamówienie może mieć kilka faktur. To decyzja o danych firmy, nie o wyglądzie edytora.

## ETL czy ELT: gdzie przygotować wynik

W ETL przekształcasz dane przed załadowaniem wyniku do miejsca docelowego. W ELT najpierw je ładujesz, a później przetwarzasz w środowisku docelowym. Fabric pozwala budować oba podejścia. Nie ma potrzeby ogłaszać jednego z nich jedynym właściwym wzorcem dla całej firmy.

Rozważ, co trzeba zachować do odtworzenia analizy, jakie dane wolno udostępnić i gdzie zespół najłatwiej utrzyma logikę. Przeniesienie surowych danych może ułatwić ponowne przeliczenie, lecz wymaga zasad dostępu i retencji. Wcześniejsze ograniczenie zakresu zmniejsza ilość przesyłanych informacji, ale może utrudnić diagnozę, jeśli odrzucisz materiał potrzebny do wyjaśnienia błędu.

Zapisz tę decyzję przy konkretnym zbiorze. „Wszystko kopiujemy” i „wszystko czyścimy przed zapisem” to zbyt ogólne reguły, żeby rozwiązać każdy przypadek integracji.

## Pełne pobranie czy tylko zmiany

Przykład syntetyczny: źródło zawiera 100 000 rekordów, a w danym dniu zmieniło się 2000. Pobranie wyłącznie tych zmian oznacza przetworzenie 2% liczby rekordów pełnego zbioru. Nie dowodzi jednak 98% oszczędności kosztu ani czasu. Trzeba jeszcze wykryć zmiany, zapisać je w celu i obsłużyć błędy.

Szczególnie ważne są usunięcia i korekty. Filtr po dacie utworzenia nie znajdzie późniejszej zmiany starego dokumentu. Sama kolumna daty modyfikacji nie zawsze informuje o rekordzie usuniętym ze źródła. Projekt powinien wyjaśniać, skąd bierze tę informację i jak sprawdza zgodność wyniku.

Kryterium

Pełne pobranie

Pobranie zmian

Zakres

Cały uzgodniony zbiór

Zmiany od określonego punktu

Główna zaleta do sprawdzenia

Prostsze porównanie kompletnego stanu

Mniejsza ilość przenoszonych danych

Ważne ryzyko

Długi czas i obciążenie źródła

Pominięcie korekty lub usunięcia

Próba odbioru

Zgodność sum i liczby rekordów

Nowy rekord, aktualizacja, usunięcie i ponowienie

To kryteria projektowe, a nie obietnica, że każdy konektor realizuje oba warianty. Sprawdź konkretną konfigurację na reprezentatywnej próbce przed zatwierdzeniem architektury.

## Kto utrzyma połączenie

Integracja potrzebuje właściciela także po uruchomieniu. Ustal, kto odnawia poświadczenia, reaguje na zmianę schematu i potwierdza brak danych. Konto osoby przygotowującej demonstrację nie powinno być jedyną odpowiedzią na pytanie o ciągłość procesu. Wybierz model dostępu zgodny z możliwościami konektora i zasadami firmy.

Jeżeli źródło znajduje się w sieci lokalnej, uwzględnij sposób połączenia i dostępność wymaganych komponentów. Test na laptopie wykonawcy nie potwierdza jeszcze działania w docelowym środowisku. Sprawdź również godzinę wykonania: pobieranie dużego zbioru podczas pracy użytkowników może mieć inne skutki niż nocna próba.

Zanim zaakceptujesz automatyzację, poproś o opis kosztów utrzymania obok kosztu wykonania. Czas diagnozy, zmiany reguł i obsługi wyjątków jest częścią rozwiązania. Nie wyliczaj zwrotu z inwestycji wyłącznie z liczby ręcznych kliknięć, które znikną z jednego arkusza.

## Pierwsza decyzja w poniedziałek

Opisz jeden przepływ: źródło, wynik, termin, reguły zmian i właściciela. Następnie dobierz najmniejszy zestaw mechanizmów, który spełnia wymagania. Przeczytaj poradnik o [odbiorze integracji danych w Data Factory](https://majchrzycki.com/blog/jak-odebrac-integracje-danych-data-factory-w-microsoft-fabric), żeby przygotować kryteria odbioru przed wdrożeniem. Szerszą perspektywę przedstawia [podejście do systemu firmy](https://majchrzycki.com/system). Dobra integracja kończy się użytecznymi danymi, za które ktoś odpowiada.

-   Dane i analityka
-   Modele i LLM
-   Zarządzanie zmianą
-   Bezpieczeństwo

## Przełóż temat na projekt w Twojej firmie

Zobacz zakres współpracy: od rozpoznania procesu i danych po projekt rozwiązania AI.

[Zobacz współpracę](https://majchrzycki.com/wspolpraca)

## Czytaj dalej

-   [Jak odebrać integrację danych w Fabric Data Factory](https://majchrzycki.com/blog/jak-odebrac-integracje-danych-data-factory-w-microsoft-fabric)
-   [Data Engineering w Fabric: co to jest i od czego zacząć](https://majchrzycki.com/blog/co-to-jest-data-engineering-inzynieria-danych-w-microsoft-fabric)
-   [Architektura danych w Fabric: od źródła do decyzji](https://majchrzycki.com/blog/nowoczesna-architektura-danych-z-platformą-microsoft-fabric)
-   [Microsoft Fabric: kiedy firma potrzebuje platformy danych](https://majchrzycki.com/blog/microsoft-fabric)