Data Science w Fabric: jak ocenić model predykcyjny
Temat: Microsoft AI
Model wskazuje klientów zagrożonych odejściem, ale zespół obsługi nie wie, do kogo zadzwonić najpierw. Data Science w Microsoft Fabric daje narzędzia do przygotowania danych, trenowania modeli i wykorzystania przewidywań. Wartość projektu zależy jednak od decyzji, którą te przewidywania mają poprawić. Zanim zaakceptujesz wynik, porównaj go z obecną metodą oraz kosztem obu rodzajów błędu.
Jeżeli odpowiadasz za obsługę klientów w firmie usługowej, pytanie nie brzmi tylko „jak dokładny jest model?”. Ważniejsze jest, czy ograniczona liczba rozmów pozwoli podjąć właściwe działania. Dobry wynik laboratoryjny może nie pomóc zespołowi, który ma inne priorytety lub nie otrzymuje rekomendacji na czas.
Co obejmuje Data Science w Fabric
Fabric wspiera eksplorację i przygotowanie danych, eksperymentowanie, modelowanie oraz wyliczanie przewidywań. Zespół może pracować w notebookach na danych dostępnych przez lakehouse i korzystać z bibliotek uczenia maszynowego. Przegląd Data Science opisuje cały ten proces. Nie jest to jedna funkcja, która po podłączeniu źródła samodzielnie rozstrzyga problem biznesowy.
Wspólne środowisko ułatwia organizację pracy analityków i specjalistów od modeli. Nadal trzeba jednak uzgodnić definicje. „Odejście klienta” może oznaczać rozwiązanie umowy, brak zakupu przez określony czas albo spadek aktywności. Każda definicja prowadzi do innego zadania i wymaga innych danych.
Zapisz również moment podejmowania decyzji. Jeśli kontakt ma nastąpić przed odnowieniem umowy, model powinien korzystać z informacji dostępnych właśnie wtedy. Dane powstałe po rezygnacji nie mogą pomagać w historycznym teście przewidywania tej rezygnacji.
Najpierw prosty punkt odniesienia
Przed trenowaniem zaawansowanego modelu opisz obecną metodę. Może to być lista klientów z malejącą liczbą zleceń albo reguła oparta na terminie odnowienia. Taki punkt odniesienia pozwala sprawdzić, czy dodatkowa złożoność rzeczywiście pomaga.
| Element projektu | Pytanie do właściciela procesu | Dowód przed pilotażem |
|---|---|---|
| Cel | Jaką decyzję zmienimy? | Opis działania po otrzymaniu wyniku |
| Punkt odniesienia | Jak wybieramy przypadki dziś? | Wynik obecnej metody na tej samej próbie |
| Ograniczenie | Ile spraw możemy obsłużyć? | Realny limit pracy zespołu |
| Błąd | Co kosztuje nietrafne wskazanie i przeoczenie? | Uzgodniony sposób oceny obu sytuacji |
Nie porównuj modeli na różnych okresach i różnych grupach bez wyjaśnienia. Łatwiejsza próbka może poprawić wynik bardziej niż zmiana algorytmu. Podział danych zaplanuj tak, aby odpowiadał przyszłemu użyciu; przy prognozowaniu przyszłych zdarzeń uwzględnij kolejność czasu.
Ostateczny zbiór testowy zachowaj do oceny rozwiązania po wyborze ustawień. Jeżeli wielokrotnie dostosowujesz model do tego samego testu, przestaje on być niezależnym sprawdzianem. To zasada projektu analitycznego, nie automatyczna gwarancja narzędzia.
Eksperyment ma być odtwarzalny
Fabric wykorzystuje eksperymenty i uruchomienia MLflow do organizacji pracy nad modelami. Można rejestrować parametry, metryki i pliki wynikowe oraz porównywać uruchomienia. Dokumentacja eksperymentów opisuje te możliwości. Warto wykorzystać je do zachowania dowodów, a nie tylko wybrania najwyższej liczby na wykresie.
Przy każdym kandydacie zapisz wersję danych, definicję celu i sposób podziału próby. Dołącz informację o brakach oraz regułach przygotowania cech. Dzięki temu inna osoba będzie mogła odtworzyć ocenę i sprawdzić, czy poprawa wynika z modelu, czy ze zmiany wejścia.
Sprawdź wyniki w ważnych grupach klientów. Średnia dla całej firmy może ukryć słabe działanie w nowym segmencie lub przy krótkiej historii współpracy. Nie obiecuj jednak wiarygodnych wniosków dla grup, w których masz zbyt mało przypadków. Takie ograniczenie powinno trafić do opisu pilotażu.
Jeden procent nie opisuje jakości
Przykład syntetyczny: spośród 1000 klientów w badanym okresie odchodzi 100. Reguła „nikt nie odejdzie” ma 90% poprawnych odpowiedzi, ale nie wskazuje żadnego klienta wymagającego uwagi. Sam procent poprawności byłby więc mylącą miarą sukcesu.
Drugi model wskazuje 100 osób, z których 60 rzeczywiście odchodzi. Pozostałe 40 wskazań jest nietrafnych, a kolejnych 40 odejść model nie wykrywa. Precyzja wskazań wynosi 60/100, czyli 60%. Wykryto również 60 ze 100 odejść, więc czułość wynosi 60%. To dwie różne miary, choć tutaj mają taką samą wartość.
| Wynik | Znaczenie dla procesu | Co sprawdzić |
|---|---|---|
| Trafne wskazanie | Kontakt z osobą rzeczywiście zagrożoną | Czy rozmowa może jeszcze pomóc? |
| Nietrafne wskazanie | Praca przy sprawie niewymagającej interwencji | Jaki jest koszt kontaktu? |
| Przeoczenie | Brak reakcji na realne zagrożenie | Jakie są konsekwencje utraty klienta? |
| Trafny brak wskazania | Brak zbędnej pracy | Czy nie ukrywa problemu w małej grupie? |
Wykrycie ryzyka nie dowodzi, że interwencja zapobiegnie odejściu. To osobne pytanie do pilotażu procesu. Mierz zarówno jakość wskazań, jak i skutki działań, porównując je z odpowiednio zaplanowanym punktem odniesienia.
Jak przewidywanie trafia do pracy
Fabric pozwala wykonywać obliczanie przewidywań dla zbiorów danych, między innymi z wykorzystaniem funkcji PREDICT i modeli przygotowanych w formacie MLflow. Opis scoringu PREDICT przedstawia ten mechanizm. Wyliczenie wyniku nie jest jeszcze wdrożeniem kompletnego procesu obsługi.
Ustal, gdzie pracownik zobaczy rekomendację, jak stary może być wynik i kto rozpatruje wątpliwe przypadki. Zapisuj wersję modelu przy przewidywaniu. Po zmianie modelu umożliwi to wyjaśnienie, dlaczego podobne sprawy otrzymały inne oceny.
Określ też warunki zatrzymania rozwiązania. Brak danych wejściowych, zmiana znaczenia pola lub pogorszenie wyników powinny uruchamiać uzgodnioną reakcję. Właściciel procesu musi wiedzieć, kiedy wrócić do wcześniejszej metody. Monitorowanie nie kończy się w dniu opublikowania modelu.
Pierwszy krok w poniedziałek
Zapisz jedną decyzję, obecną regułę i koszt błędów. Wybierz historyczny okres, dla którego znasz wynik, i sprawdź, jakie dane były dostępne w chwili decyzji. Dopiero wtedy planuj eksperyment.
Jeżeli problemem jest przygotowanie wejścia, przeczytaj o fundamentach danych dla AI w Fabric. Szerszy kontekst opisuje podejście do systemu firmy. Oceniaj model przez działanie, które umożliwia, oraz dowody, że pomaga bardziej niż dotychczasowa metoda.
- Dane i analityka
- Zarządzanie zmianą
- Strategia
