Cyfrowy pracownik: czego CORPGEN uczy o pracy agentów?

Temat: Automatyzacja i agenci AI

Cyfrowy pracownik nie jest po prostu czatem z dłuższą listą poleceń. W badaniu CORPGEN Microsoft Research agent musi równolegle prowadzić wiele zależnych zadań, pamiętać wcześniejsze kroki i zmieniać priorytety. To bardziej przypomina dzień pracy biurowej niż pojedynczy benchmark „otwórz stronę i znajdź odpowiedź”.

Co dokładnie badano?

Autorzy zbudowali środowiska Multi-Horizon Task Environments. Zadania mają wiele kroków, zależności i konkurują o uwagę agenta. CORPGEN łączy planowanie hierarchiczne, pamięć warstwową, izolowane podzadania i uczenie z wcześniejszych przebiegów. W testach przy 46 zadaniach system osiągnął 15,2% ukończeń wobec 4,3% dla badanych rozwiązań bazowych. To wynik konkretnego eksperymentu, nie prognoza, że cyfrowy pracownik zastąpi człowieka w firmie. Większość zadań wciąż pozostawała nieukończona.

Ważny jest również sposób oceny. Microsoft Research zauważa, że ocena plików będących wynikiem pracy lepiej zgadzała się z oceną człowieka niż analiza samych zrzutów ekranu i logów akcji. Dla firmy płynie z tego zasada: rozliczaj agenta z poprawnego artefaktu i efektu procesu, a nie z liczby kliknięć.

Jak przełożyć to na organizację?

Ustal rolę agenta, właściciela celu, źródła wiedzy i dopuszczalne działania. Wydziel pamięć zadania, żeby poufna informacja z jednego procesu nie wpływała na drugi. Długie działania muszą mieć stan, wznowienie, kontrolę wyjątków i ślad zatwierdzeń. Wysyłka maila lub zmiana danych klienta wymaga odrębnej autoryzacji. Najlepiej zacząć od procesu, w którym człowiek może łatwo sprawdzić wynik.

Alternatywą dla „cyfrowego pracownika” bywa dobrze zaprojektowana automatyzacja regułowa albo asystent, który jedynie przygotowuje materiał do zatwierdzenia. CORPGEN pokazuje wartość architektury pamięci i planowania, ale nie dowodzi opłacalności pełnej autonomii w każdej pracy. Powiązaną perspektywę na dzielenie zadań między mniejsze modele opisuje „Big tasks. Small models”. Dla decyzji o pilocie kluczowe jest pytanie: co agent ma dowieźć i jak człowiek rozpozna poprawny wynik?

Czy „pracownik” to właściwa metafora?

Metafora jest użyteczna, bo zmusza do zadania pytań o rolę, zadania, pamięć i współpracę. Może też mylić. Agent nie ma odpowiedzialności prawnej ani zrozumienia sytuacji organizacyjnej porównywalnego z człowiekiem. Potrafi szybko wykonywać powtarzalne czynności, ale w badaniu CORPGEN daleko mu do niezawodnego ukończenia długiej listy obowiązków. Dlatego „cyfrowy pracownik” powinien oznaczać system z przypisaną funkcją i właścicielem, nie osobę, której można bez nadzoru oddać proces.

Weźmy hipotetyczne zadanie działu zakupów: przygotować zestawienie ofert, sprawdzić dostępność materiału, napisać notatkę i przypomnieć o kończącej się umowie. Agent może wykonywać te kroki równolegle, ale każde źródło ma inną aktualność i uprawnienia. Stan zadania musi pamiętać, że oferta dostawcy czeka na odpowiedź, notatka jest wersją roboczą, a przypomnienie już zostało wysłane. Jeśli pamięć pomyli te stany, agent może wysłać duplikat albo przedstawić wstępny szacunek jako zatwierdzoną cenę.

Jak mierzyć wartość bez liczenia „zastąpionych etatów”?

Ustal jednostkę pracy: kompletna, poprawna odpowiedź na zapytanie; dokument gotowy do przeglądu; zamknięta sprawa klienta. Porównaj czas od zlecenia do akceptacji, liczbę poprawek, przypadki eskalacji i koszt kontroli człowieka. Zliczaj również błędy, których nie widać w końcowym pliku: odczyt niedozwolonych danych, próbę wysłania bez zgody czy utratę kontekstu między zadaniami. Taki pomiar pokazuje, czy agent pomaga zespołowi, zamiast jedynie wykonywać dużo ruchów na ekranie.

W praktyce pierwszy „etat” dla agenta powinien być mały: jedna rola, kilka narzędzi, jasny warunek zakończenia oraz możliwość przerwania i wznowienia. Dopiero gdy organizacja umie odtworzyć wynik i wyjaśnić każdy skutek, warto poszerzać zakres autonomii.

Przełóż temat na projekt w Twojej firmie

Zobacz zakres współpracy: od rozpoznania procesu i danych po projekt rozwiązania AI.