Data Science w Fabric: jak ocenić model predykcyjny

Temat: Microsoft AI

Model wskazuje klientów zagrożonych odejściem, ale zespół obsługi nie wie, do kogo zadzwonić najpierw. Data Science w Microsoft Fabric daje narzędzia do przygotowania danych, trenowania modeli i wykorzystania przewidywań. Wartość projektu zależy jednak od decyzji, którą te przewidywania mają poprawić. Zanim zaakceptujesz wynik, porównaj go z obecną metodą oraz kosztem obu rodzajów błędu.

Jeżeli odpowiadasz za obsługę klientów w firmie usługowej, pytanie nie brzmi tylko „jak dokładny jest model?”. Ważniejsze jest, czy ograniczona liczba rozmów pozwoli podjąć właściwe działania. Dobry wynik laboratoryjny może nie pomóc zespołowi, który ma inne priorytety lub nie otrzymuje rekomendacji na czas.

Co obejmuje Data Science w Fabric

Fabric wspiera eksplorację i przygotowanie danych, eksperymentowanie, modelowanie oraz wyliczanie przewidywań. Zespół może pracować w notebookach na danych dostępnych przez lakehouse i korzystać z bibliotek uczenia maszynowego. Przegląd Data Science opisuje cały ten proces. Nie jest to jedna funkcja, która po podłączeniu źródła samodzielnie rozstrzyga problem biznesowy.

Wspólne środowisko ułatwia organizację pracy analityków i specjalistów od modeli. Nadal trzeba jednak uzgodnić definicje. „Odejście klienta” może oznaczać rozwiązanie umowy, brak zakupu przez określony czas albo spadek aktywności. Każda definicja prowadzi do innego zadania i wymaga innych danych.

Zapisz również moment podejmowania decyzji. Jeśli kontakt ma nastąpić przed odnowieniem umowy, model powinien korzystać z informacji dostępnych właśnie wtedy. Dane powstałe po rezygnacji nie mogą pomagać w historycznym teście przewidywania tej rezygnacji.

Najpierw prosty punkt odniesienia

Przed trenowaniem zaawansowanego modelu opisz obecną metodę. Może to być lista klientów z malejącą liczbą zleceń albo reguła oparta na terminie odnowienia. Taki punkt odniesienia pozwala sprawdzić, czy dodatkowa złożoność rzeczywiście pomaga.

Element projektuPytanie do właściciela procesuDowód przed pilotażem
CelJaką decyzję zmienimy?Opis działania po otrzymaniu wyniku
Punkt odniesieniaJak wybieramy przypadki dziś?Wynik obecnej metody na tej samej próbie
OgraniczenieIle spraw możemy obsłużyć?Realny limit pracy zespołu
BłądCo kosztuje nietrafne wskazanie i przeoczenie?Uzgodniony sposób oceny obu sytuacji

Nie porównuj modeli na różnych okresach i różnych grupach bez wyjaśnienia. Łatwiejsza próbka może poprawić wynik bardziej niż zmiana algorytmu. Podział danych zaplanuj tak, aby odpowiadał przyszłemu użyciu; przy prognozowaniu przyszłych zdarzeń uwzględnij kolejność czasu.

Ostateczny zbiór testowy zachowaj do oceny rozwiązania po wyborze ustawień. Jeżeli wielokrotnie dostosowujesz model do tego samego testu, przestaje on być niezależnym sprawdzianem. To zasada projektu analitycznego, nie automatyczna gwarancja narzędzia.

Eksperyment ma być odtwarzalny

Fabric wykorzystuje eksperymenty i uruchomienia MLflow do organizacji pracy nad modelami. Można rejestrować parametry, metryki i pliki wynikowe oraz porównywać uruchomienia. Dokumentacja eksperymentów opisuje te możliwości. Warto wykorzystać je do zachowania dowodów, a nie tylko wybrania najwyższej liczby na wykresie.

Przy każdym kandydacie zapisz wersję danych, definicję celu i sposób podziału próby. Dołącz informację o brakach oraz regułach przygotowania cech. Dzięki temu inna osoba będzie mogła odtworzyć ocenę i sprawdzić, czy poprawa wynika z modelu, czy ze zmiany wejścia.

Sprawdź wyniki w ważnych grupach klientów. Średnia dla całej firmy może ukryć słabe działanie w nowym segmencie lub przy krótkiej historii współpracy. Nie obiecuj jednak wiarygodnych wniosków dla grup, w których masz zbyt mało przypadków. Takie ograniczenie powinno trafić do opisu pilotażu.

Jeden procent nie opisuje jakości

Przykład syntetyczny: spośród 1000 klientów w badanym okresie odchodzi 100. Reguła „nikt nie odejdzie” ma 90% poprawnych odpowiedzi, ale nie wskazuje żadnego klienta wymagającego uwagi. Sam procent poprawności byłby więc mylącą miarą sukcesu.

Drugi model wskazuje 100 osób, z których 60 rzeczywiście odchodzi. Pozostałe 40 wskazań jest nietrafnych, a kolejnych 40 odejść model nie wykrywa. Precyzja wskazań wynosi 60/100, czyli 60%. Wykryto również 60 ze 100 odejść, więc czułość wynosi 60%. To dwie różne miary, choć tutaj mają taką samą wartość.

WynikZnaczenie dla procesuCo sprawdzić
Trafne wskazanieKontakt z osobą rzeczywiście zagrożonąCzy rozmowa może jeszcze pomóc?
Nietrafne wskazaniePraca przy sprawie niewymagającej interwencjiJaki jest koszt kontaktu?
PrzeoczenieBrak reakcji na realne zagrożenieJakie są konsekwencje utraty klienta?
Trafny brak wskazaniaBrak zbędnej pracyCzy nie ukrywa problemu w małej grupie?

Wykrycie ryzyka nie dowodzi, że interwencja zapobiegnie odejściu. To osobne pytanie do pilotażu procesu. Mierz zarówno jakość wskazań, jak i skutki działań, porównując je z odpowiednio zaplanowanym punktem odniesienia.

Jak przewidywanie trafia do pracy

Fabric pozwala wykonywać obliczanie przewidywań dla zbiorów danych, między innymi z wykorzystaniem funkcji PREDICT i modeli przygotowanych w formacie MLflow. Opis scoringu PREDICT przedstawia ten mechanizm. Wyliczenie wyniku nie jest jeszcze wdrożeniem kompletnego procesu obsługi.

Ustal, gdzie pracownik zobaczy rekomendację, jak stary może być wynik i kto rozpatruje wątpliwe przypadki. Zapisuj wersję modelu przy przewidywaniu. Po zmianie modelu umożliwi to wyjaśnienie, dlaczego podobne sprawy otrzymały inne oceny.

Określ też warunki zatrzymania rozwiązania. Brak danych wejściowych, zmiana znaczenia pola lub pogorszenie wyników powinny uruchamiać uzgodnioną reakcję. Właściciel procesu musi wiedzieć, kiedy wrócić do wcześniejszej metody. Monitorowanie nie kończy się w dniu opublikowania modelu.

Pierwszy krok w poniedziałek

Zapisz jedną decyzję, obecną regułę i koszt błędów. Wybierz historyczny okres, dla którego znasz wynik, i sprawdź, jakie dane były dostępne w chwili decyzji. Dopiero wtedy planuj eksperyment.

Jeżeli problemem jest przygotowanie wejścia, przeczytaj o fundamentach danych dla AI w Fabric. Szerszy kontekst opisuje podejście do systemu firmy. Oceniaj model przez działanie, które umożliwia, oraz dowody, że pomaga bardziej niż dotychczasowa metoda.

Przełóż temat na projekt w Twojej firmie

Zobacz zakres współpracy: od rozpoznania procesu i danych po projekt rozwiązania AI.