CoE dla Microsoft Copilot Studio: governance agentów
Temat: Bezpieczeństwo i utrzymanie AI
Centrum Doskonałości CoE dla Microsoft Copilot Studio ma pilnować cyklu życia agentów, a nie produkować ich jak najwięcej. Agent może odpowiadać na pytania, korzystać ze źródeł wiedzy i wykonywać działania przez konektory. Każdy z tych elementów zwiększa wartość, lecz również zmienia ryzyko. Dlatego środowisko, dane, narzędzia, testy, publikacja i koszty muszą mieć właścicieli jeszcze przed pierwszym wdrożeniem produkcyjnym.
Agent nie jest kolejnym chatbotem
Klasyczny chatbot prowadzi rozmowę według przewidzianej ścieżki. Agent generatywny interpretuje intencję, wybiera wiedzę i może uruchomić narzędzie. W Copilot Studio zakres działania zależy od instrukcji, tematów, źródeł wiedzy, konektorów, uwierzytelniania i kanału publikacji. CoE musi więc zarządzać całym układem, nie tylko tekstem odpowiedzi.
Microsoft zaleca dziś strefowy model governance: środowiska i reguły różnią się zależnie od przeznaczenia oraz ryzyka agenta. Dokumentacja obejmuje kontrolę dostępu, polityki danych, bezpieczne udostępnianie, testy, ALM, monitoring i zarządzanie pojemnością. To dobry szkielet, ale firma nadal musi ustalić, kto podejmuje decyzje.
| Obszar | Pytanie CoE | Dowód gotowości |
|---|---|---|
| Cel | Jaką decyzję lub czynność wspiera agent? | Właściciel procesu i scenariusze użycia |
| Wiedza | Z jakich treści może odpowiadać? | Rejestr źródeł i właścicieli |
| Działania | Co może wykonać w systemach? | Lista narzędzi, uprawnień i zatwierdzeń |
| Publikacja | Kto uzyska dostęp? | Grupa odbiorców i kanał |
| Eksploatacja | Kto reaguje na błąd? | Monitoring, eskalacja i plan wycofania |
Podziel środowiska na strefy ryzyka
Minimalny układ obejmuje osobiste środowisko rozwojowe, wspólne środowisko testowe oraz produkcję. Organizacja z agentami obsługującymi klientów lub dane wrażliwe potrzebuje dodatkowej strefy kontrolowanej. Microsoft wskazuje, że środowiska są granicami dla danych, ról bezpieczeństwa i polityk. Nie traktuj ich jako folderów porządkowych.
| Strefa | Dopuszczalne zastosowania | Domyślne zabezpieczenia | Publikacja |
|---|---|---|---|
| Eksperyment | Nauka, prototyp na danych sztucznych | Ścisłe polityki danych, brak kanałów publicznych | Tylko autorzy |
| Zespół | Test z ograniczoną grupą | Kontrolowane konektory i źródła | Grupa pilotażowa |
| Produkcja | Proces wewnętrzny | ALM, monitoring, role i właściciel usługi | Zdefiniowana grupa |
| Podwyższone ryzyko | Klienci, dane chronione, działania w systemach | Przegląd bezpieczeństwa, zatwierdzenia, rozdział obowiązków | Jawna zgoda właściciela ryzyka |
Środowiska powinny być przypisane do grup Microsoft Entra ID. Polityki danych mogą blokować określone źródła wiedzy, konektory, kanały, nieuwierzytelniony dostęp oraz inne zdolności tworzenia. Reguła tenantowa działa szeroko, dlatego testuj wpływ przed jej zaostrzeniem. Wyjątki muszą mieć termin ważności i właściciela.
Zbuduj bramkę przed tworzeniem
Formularz inicjatywy powinien zmieścić się na jednej stronie. Zawiera problem, odbiorcę, właściciela, dane, działania i konsekwencję błędu. Na tej podstawie CoE przypisuje klasę ryzyka. Agent informacyjny oparty na zatwierdzonych materiałach może przejść szybką ścieżką. Agent zapisujący dane w CRM wymaga testów uprawnień i operacji. Agent dla klientów potrzebuje również zasad eskalacji i monitoringu.
Nie pytaj tylko, czy agent potrafi wykonać zadanie. Pytaj, co zrobi przy braku danych, konflikcie źródeł, odmowie dostępu, zmianie API i nietypowym poleceniu użytkownika. Te scenariusze trafiają do zestawu testowego zanim powstanie pierwsza wersja.
ALM obejmuje więcej niż eksport rozwiązania
Copilot Studio korzysta z fundamentu Power Platform i wspiera przenoszenie agentów w rozwiązaniach. Microsoft zaznacza jednak, że część elementów wymaga czynności po wdrożeniu w środowisku docelowym. Dlatego checklista wydania musi obejmować nie tylko import, lecz także połączenia, uwierzytelnianie, kanały, zmienne środowiskowe i ponowne sprawdzenie źródeł wiedzy.
Pracuj na wersjach w środowisku rozwojowym. Zmianę promuj do testu przez pipeline. W teście uruchom stały zestaw pytań, testy działań i próbę obciążenia odpowiednią do skali. Produkcja nie służy do edycji. Wydanie powinno mieć osobę zatwierdzającą, zapis zmian i procedurę cofnięcia.
| Etap | Minimalna kontrola | Kryterium decyzji |
|---|---|---|
| Projekt | Cel, granice i konsekwencja błędu | Jest właściciel ryzyka |
| Budowa | Najmniejsze uprawnienia, kontrolowane źródła | Agent nie wykracza poza zakres |
| Test | Zestaw regresyjny, test działań i odmów | Wyniki mieszczą się w progu ustalonym przez właściciela |
| Wydanie | Pipeline, konfiguracja docelowa, akceptacja | Wszystkie zależności są jawne |
| Eksploatacja | Analiza, transkrypty, feedback i koszty | Jest rytm przeglądu i osoba reagująca |
Bezpieczeństwo zaczyna się od tożsamości
Agent nie może mieć szerszych praw niż wymaga scenariusz. Wiele problemów bierze się z połączeń utworzonych przez osobę z wysokimi uprawnieniami. CoE powinno ustalić model tożsamości dla każdego narzędzia: w czyim kontekście działa, które rekordy widzi i czy operacja wymaga zatwierdzenia człowieka.
Źródła wiedzy również wymagają kontroli. Dostępność dokumentu dla autora agenta nie oznacza, że powinien on zasilać odpowiedzi dla wszystkich użytkowników. Właściciel treści odpowiada za aktualność, klasyfikację i termin przeglądu. Usunięcie starego dokumentu jest częścią utrzymania produktu.
Działania o dużym wpływie rozbij na propozycję i zatwierdzenie. Agent może przygotować odpowiedź, zmianę rekordu lub zamówienie, ale człowiek zatwierdza skutek. Pełna autonomia jest decyzją biznesową opartą na dowodach z eksploatacji, a nie domyślnym celem projektu.
Koszt wymaga miernika jednostkowego
Budżet nie powinien być tylko miesięcznym limitem dla całego tenantu. Przypisz koszt do agenta, środowiska i scenariusza. Mierz liczbę aktywnych użytkowników, sesji, użytych zdolności lub Copilot Credits zgodnie z obowiązującym modelem rozliczeń. Cennik i jednostki mogą się zmieniać, dlatego CoE powinno odwoływać się do bieżącej dokumentacji licencyjnej, a nie wpisywać stawek do standardu architektury.
Przykład syntetyczny
Załóżmy, że agent działu zakupów odpowiada na pytania o procedury i przygotowuje szkic wniosku. Przykład jest fikcyjny. W pilotażu może pracować na zatwierdzonych dokumentach i danych testowych. Przejście do produkcji następuje dopiero po wskazaniu właściciela procedur, utworzeniu grupy odbiorców, przetestowaniu pytań spoza zakresu i potwierdzeniu, że zapis wniosku wymaga zatwierdzenia pracownika. CoE mierzy skuteczne ukończenia zadania oraz eskalacje, nie samą liczbę rozmów.
Operacje po publikacji
Microsoft wskazuje wbudowane analizy, przegląd transkryptów i feedback jako element ciągłego nadzoru. Ustal tygodniowy przegląd incydentów oraz miesięczny przegląd jakości i kosztu. Zbieraj pytania bez odpowiedzi, błędne użycia narzędzi, nieudane uwierzytelnienia i sygnały użytkowników. Każda zmiana instrukcji lub źródła wiedzy może powodować regresję, więc uruchamiaj ponownie stały zestaw testów.
Wycofanie jest normalną częścią cyklu życia. Agent bez właściciela, użytkowników lub aktualnej wiedzy powinien zostać zawieszony, a następnie usunięty zgodnie z polityką retencji. CoE musi znać zależności, by nie zostawić aktywnego kanału prowadzącego do nieobsługiwanej usługi.
Copilot Studio jest narzędziem w szerszym systemie operacyjnym firmy, dlatego jego governance musi łączyć dane, procesy i odpowiedzialność ludzi. Jeśli potrzebujesz najpierw ocenić sam produkt i dopasowanie scenariusza, przejdź do przewodnika Microsoft Copilot Studio.
Zestaw testów, który rośnie z agentem
Pierwszy zestaw regresyjny może mieć trzydzieści przypadków. Podziel go na odpowiedzi poprawne, pytania niejednoznaczne, brak wiedzy, próby uzyskania danych bez uprawnień i wywołania narzędzi. Dla każdego przypadku zapisz oczekiwane zachowanie, nie oczekiwane brzmienie. Model może sformułować zdanie inaczej, ale nie może zmienić faktu, ujawnić danych ani wykonać innej operacji.
Po incydencie dodaj przypadek do zestawu. Po zmianie źródła wiedzy uruchom test ponownie. Przy agencie wielojęzycznym utrzymuj próbki w językach używanych przez odbiorców. Ocena człowieka pozostaje potrzebna dla jakości odpowiedzi, a automatyczne testy dobrze wykrywają stałe elementy, takie jak obecność źródła, format wyniku i dozwolone narzędzie.
Test wydajności powinien odzwierciedlać spodziewane obciążenie oraz limity usług zależnych. Sprawdź zachowanie przy opóźnieniu konektora i braku odpowiedzi API. Agent powinien poinformować użytkownika o problemie oraz bezpiecznie zakończyć próbę, zamiast wielokrotnie wykonywać tę samą operację.
Katalog agentów i właścicieli
CoE prowadzi jeden katalog produkcyjnych agentów. Rejestr zawiera środowisko, kanały, odbiorców, właściciela procesu, właściciela technicznego, źródła, narzędzia, klasę danych, model kosztu, wersję i datę przeglądu. Katalog powinien pokazywać także agenty zawieszone oraz przeznaczone do wycofania.
Nowy właściciel musi móc przejąć produkt bez rozmowy z autorem. Jeśli nie potrafi odtworzyć zależności, uruchomić testów i znaleźć pulpitu operacyjnego, agent nie jest gotowy do produkcji. Dokumentacja ma opisywać decyzje oraz procedury, nie kopiować ekranów konfiguracji.
Raz na kwartał właściciel potwierdza potrzebę biznesową, źródła i odbiorców. Brak potwierdzenia uruchamia proces wygaszenia. Taki mechanizm zapobiega gromadzeniu agentów demonstracyjnych, które zachowują dostęp do danych długo po zakończeniu pilotażu.
Kryteria odbioru CoE
Po pierwszym kwartale sprawdź, czy każdy agent ma kartę, klasę ryzyka i właściciela. Następnie wybierz losową wersję produkcyjną i spróbuj odtworzyć drogę od zmiany do publikacji. Sprawdź, czy istnieje wynik testów, akceptacja, konfiguracja docelowa i sposób cofnięcia. Brak jednego elementu jest konkretnym zadaniem naprawczym.
Oceń także czas przejścia przez bramkę. Jeżeli niskie ryzyko czeka tyle samo co agent klientowski, reguły są zbyt ciężkie. Jeżeli produkcja przyjmuje zmiany bez przeglądu, są zbyt lekkie. CoE powinno regularnie upraszczać kontrole, które nie zmieniają decyzji, i wzmacniać te, które wykrywają realne problemy.
Przegląd kosztu łącz z jakością. Tani agent generujący wiele eskalacji może obciążać zespół bardziej niż droższe rozwiązanie o węższym, stabilnym zakresie. Raportuj koszt obsługi jednostki pracy wraz z liczbą poprawek i incydentów. Nie porównuj agentów wyłącznie według zużycia platformy.
Na koniec poproś użytkowników o wskazanie momentów, w których nie wiedzieli, czy ufać wynikowi. To często ujawnia problem interfejsu, źródła lub komunikatu o ograniczeniu, którego test techniczny nie pokaże. CoE przekłada tę obserwację na zmianę produktu oraz przypadek regresyjny.
Gotowość właściciela procesu
Właściciel agenta powinien potrafić wyjaśnić jego granice bez otwierania konfiguracji. Musi znać grupę odbiorców, źródła, działania, miernik jakości i procedurę awarii. Powinien także rozstrzygać, czy nowy pomysł należy do obecnego produktu, czy wymaga osobnego agenta. Bez tej roli backlog rośnie według zgłoszeń użytkowników, a zakres traci spójność.
CoE może przygotować kwartalne potwierdzenie własności. Niech osoba odpowiedzialna zatwierdzi aktualność potrzeby, danych, odbiorców, narzędzi i kosztu. Potwierdzenie nie powinno być pustym kliknięciem. Dołącz ostatnie użycie, najważniejsze eskalacje, zmianę kosztu i termin przeglądu wiedzy. Brak odpowiedzi oznacza ograniczenie albo zawieszenie rozwiązania.
Sprawdź też zastępstwo. Urlop lub odejście właściciela nie może pozbawić organizacji możliwości wyłączenia agenta, zmiany źródła czy reakcji na incydent. Zastępca potrzebuje dostępu, instrukcji oraz kontaktów do właścicieli systemów zależnych.
Co zrobić w poniedziałek
Wybierz jednego istniejącego agenta i sporządź jego kartę: właściciel procesu, środowisko, odbiorcy, źródła wiedzy, narzędzia, tożsamość, koszt, zestaw testów oraz osoba reagująca na incydent. Każde puste pole jest konkretnym zadaniem CoE. Ta karta szybciej pokaże luki niż ogólna polityka odpowiedzialnej AI.
Źródła
- Copilot
- Zarządzanie zmianą
- Strategia
