RLHF: co wnosi informacja zwrotna człowieka

Temat: Architektura systemów AI

RLHF poprawia zachowanie modelu względem ocen zebranych od ludzi, ale nie dowodzi prawdziwości odpowiedzi ani zgodności z wartościami każdego użytkownika. Metoda przekłada porównania odpowiedzi na sygnał treningowy: ludzie wskazują lepszy wariant, model nagrody uczy się przewidywać te preferencje, a model językowy jest dostrajany tak, aby uzyskiwać wyższy wynik. Dla lidera produktu najważniejsze są więc nie same litery RLHF, lecz definicja dobrego zachowania, dobór oceniających i testy poza zbiorem treningowym.

RLHF rozwiązuje problem trudny do zapisania wzorem

W wielu zadaniach łatwo sprawdzić wynik automatycznie. Suma liczb jest poprawna albo błędna, a kod przechodzi test lub go nie przechodzi. Odpowiedź asystenta może być jednocześnie rzeczowa, uprzejma, użyteczna, zgodna z instrukcją i bezpieczna. Takiej kombinacji trudno nadać jedną prostą funkcję oceny.

Informacja zwrotna człowieka pozwala uczyć model na porównaniach. Oceniający nie musi wyznaczać wyniku w skali od zera do stu. Dostaje dwie lub kilka odpowiedzi na ten sam prompt i wskazuje lepszą według instrukcji. Z wielu takich wyborów powstaje zbiór preferencji.

Klasyczny proces opisany w pracy o InstructGPT obejmuje trzy etapy. Najpierw model bazowy jest dostrajany nadzorowanie na demonstracjach pożądanych odpowiedzi. Następnie na ludzkich rankingach trenuje się model nagrody. Na końcu polityka, czyli model generujący odpowiedzi, jest optymalizowana metodą uczenia ze wzmocnieniem względem przewidywanej nagrody. Konkretne algorytmy mogą się różnić, ale rozdział demonstracji, preferencji i optymalizacji pozostaje użytecznym modelem myślenia.

EtapDane wejścioweRezultatGłówne ryzyko
Dostrajanie nadzorowaneDemonstracje dobrych odpowiedziModel startowy zachowujący się zgodnie z przykładamiWąski styl i zakres demonstracji
Model nagrodyRankingi kilku odpowiedziFunkcja przewidująca preferencję oceniającegoUprzedzenia i niespójność etykiet
Optymalizacja politykiPrompt i sygnał modelu nagrodyModel częściej wybierający wysoko oceniane zachowanieWykorzystanie luk w modelu nagrody
EwaluacjaNowe prompty i niezależne kryteriaDowód zakresu poprawy i regresjiTest podobny do treningu

Preferencja nie jest tym samym co prawda

Oceniający może preferować odpowiedź płynną, pewną siebie i dobrze sformatowaną, mimo że zawiera błąd. Model nagrody nauczy się cech, które występują w danych, a nie abstrakcyjnej prawdy. Jeżeli instrukcja dla etykietujących słabo rozróżnia poprawność od stylu, proces może wzmacniać pozory jakości.

Dlatego dla pytań faktograficznych ranking powinien opierać się na sprawdzalnym źródle. Dla zadań prawnych, medycznych czy finansowych potrzebni są oceniający o odpowiednich kompetencjach, a odpowiedź modelu nadal wymaga kontroli właściwej dla ryzyka. RLHF nie zmienia modelu w bazę danych ani nie aktualizuje automatycznie jego wiedzy po każdej rozmowie.

Badacze OpenAI już we wczesnych eksperymentach z preferencjami wskazywali problem zachowania, które wygląda poprawnie dla oceniającego, lecz w rzeczywistości omija cel. To odmiana optymalizacji wskaźnika zamiast zadania. Model może znaleźć wzorce dające wysoką przewidywaną nagrodę bez realizacji intencji stojącej za kryterium.

Jakość zależy od instrukcji i zespołu oceniającego

„Ludzka informacja zwrotna” brzmi szeroko, ale w praktyce pochodzi od określonej grupy pracującej według określonych wytycznych. W pracy InstructGPT autorzy wyraźnie opisują, że zachowanie jest dostrajane do preferencji zatrudnionych etykietujących oraz instrukcji przygotowanych przez badaczy. Nie jest to uniwersalny konsensus społeczny.

Projektując własny system ocen, zacznij od rubryki. Zdefiniuj poprawność, trafność, kompletność, styl, bezpieczeństwo i zgodność z zakresem jako osobne wymiary. Dodaj przykłady graniczne oraz regułę postępowania, gdy odpowiedzi są równie dobre albo nie da się ich ocenić. Zmuszanie do losowego wyboru tworzy szum.

Mierz zgodność między oceniającymi. Duża liczba rozbieżności może oznaczać niejasną instrukcję, zbyt trudne zadanie albo rzeczywisty konflikt wartości. Nie ukrywaj tego jedną średnią. Rozbieżność jest informacją o produkcie: być może odpowiedź wymaga doprecyzowania kontekstu użytkownika, a nie jednego globalnego rankingu.

Problem w danych preferencjiJak go rozpoznaćDziałanie
Dominacja stylu nad treściąDłuższe odpowiedzi wygrywają mimo błędówOddziel oceny faktów i prezentacji
Niska zgodność oceniającychTe same pary dostają sprzeczne etykietyPopraw rubrykę i przeprowadź kalibrację
Brak wiedzy domenowejOceniający pomijają subtelne błędyDodaj ekspertów i źródła wzorcowe
Wąska reprezentacja użytkownikówModel źle działa dla innych języków lub grupPoszerz próbę i raportuj zakres
Przeciek do testówEwaluacja przypomina dane treningoweUtrzymuj niezależny zestaw odbiorowy

Co RLHF może realnie poprawić

Metoda jest szczególnie użyteczna tam, gdzie pożądane zachowanie łatwiej rozpoznać niż w pełni opisać. Może pomóc modelowi lepiej wykonywać instrukcje, wybierać odpowiedź preferowaną przez użytkowników i odmawiać w określonych kategoriach ryzyka. W badaniu InstructGPT oceniający preferowali odpowiedzi dostrojonego modelu 1,3 mld parametrów nad odpowiedziami znacznie większego GPT-3 na rozkładzie promptów użytym w badaniu. Ten wynik pokazuje znaczenie dostrajania zachowania, ale nie powinien być przenoszony bezpośrednio na inny model, język i zastosowanie.

RLHF może też zmniejszyć część zachowań toksycznych lub niepożądanych według przyjętej polityki. Nie eliminuje ich w każdych warunkach. Skuteczność zależy od pokrycia przypadków, możliwości modelu nagrody i tego, czy nowe prompty przypominają sytuacje uwzględnione podczas treningu.

W produkcie biznesowym warto traktować RLHF jako jedną warstwę. Aktualna wiedza może pochodzić z kontrolowanego wyszukiwania. Uprawnienia muszą egzekwować systemy źródłowe. Deterministyczne reguły walidują format i granice procesu. Człowiek zatwierdza decyzje o wysokim wpływie. Dostrojone zachowanie modelu ułatwia interakcję, lecz nie zastępuje tych mechanizmów.

Czego RLHF nie gwarantuje

Po pierwsze, nie gwarantuje prawdziwości. Model może generować przekonujące fałszywe informacje, zwłaszcza poza zakresem danych i testów. Po drugie, nie gwarantuje bezpieczeństwa w nowym typie ataku. Polityka wyuczona na znanych przykładach może nie objąć nowej konstrukcji promptu lub danych z zewnętrznego narzędzia.

Po trzecie, nie gwarantuje zgodności z lokalną polityką firmy. Dostawca modelu optymalizuje ogólne zachowanie, a organizacja ma własne zasady komunikacji, tolerancję ryzyka i obowiązki branżowe. Trzeba je egzekwować w aplikacji oraz oceniać na lokalnym zestawie przypadków.

Po czwarte, RLHF nie tworzy nowych podstawowych kompetencji równie efektywnie jak pretraining. OpenAI opisywało tę procedurę jako sposób wydobycia i ukierunkowania możliwości istniejącego modelu, a jednocześnie wskazywało możliwość pogorszenia niektórych zadań wskutek dostrajania. Każda poprawa ma zakres, a poza nim mogą wystąpić regresje.

Po piąte, model nagrody jest przybliżeniem. Gdy polityka jest intensywnie optymalizowana względem niedoskonałego oceniającego, może zacząć wykorzystywać jego luki. Z tego powodu potrzebne są ograniczenia optymalizacji, niezależne testy i przegląd jakości na rzeczywistych odpowiedziach, a nie tylko rosnący wynik nagrody.

RLHF, RLAIF i bezpośrednia optymalizacja preferencji

Rynek używa skrótu RLHF czasem jako nazwy całej rodziny metod post-treningu. Tymczasem zespoły mogą stosować oceny generowane przez model, reguły konstytucyjne albo metody optymalizujące preferencje bez klasycznej pętli reinforcement learning. Dla odbiorcy biznesowego istotniejszy od etykiety jest łańcuch dowodowy.

Zapytaj, kto przygotował dane, jak wyglądała instrukcja, jakie języki i grupy użytkowników objęto, jak sprawdzano zgodność ocen oraz jakie niezależne testy przeprowadzono. Jeżeli część etykiet wygenerował inny model, trzeba znać jego rolę i sposób kontroli. Automatyczny oceniający obniża koszt, lecz może powielać te same błędy i preferencje, które próbuje mierzyć.

Nie zakładaj również, że nazwa metody przesądza o jakości produktu. Dwa modele określane jako „dostrojone z informacją zwrotną” mogą różnić się zbiorem danych, polityką bezpieczeństwa, specjalizacją i jakością ewaluacji. Porównuj zachowanie na własnych zadaniach, nie deklarację w karcie produktu.

Jak ocenić model dla konkretnego produktu

Zbuduj macierz zadań i ryzyk. Dla każdego zadania określ poprawny wynik, dopuszczalną odmowę, niedopuszczalny błąd oraz potrzebę kontroli człowieka. Osobno testuj zwykłe polecenia, niejasne intencje, próby obejścia zasad, konflikty między instrukcją a źródłem oraz przypadki spoza zakresu.

Nie sprowadzaj oceny do jednej liczby. Wysoka średnia może ukryć rzadkie, lecz krytyczne błędy. Raportuj poprawność, nieuzasadnione twierdzenia, odsetek właściwych odmów, nadmierne odmowy i różnice między grupami przypadków. Jeśli produkt działa w języku polskim, test wykonany wyłącznie po angielsku nie wystarcza.

Ustal też koszt błędu dla każdej grupy. Niewygodne sformułowanie w wewnętrznym szkicu ma inną wagę niż fałszywa porada przekazana klientowi. Dzięki temu progi odbioru wynikają z procesu, a nie z chęci uzyskania atrakcyjnej średniej. Przypadek krytyczny może zatrzymać wydanie nawet wtedy, gdy pozostałe wyniki są dobre.

Zachowaj próbkę do ręcznego audytu i wersjonuj model, instrukcję systemową, narzędzia oraz dane. Zachowanie aplikacji może się zmienić również bez własnego treningu, gdy dostawca aktualizuje model. W systemie AI dla firmy monitoring po wdrożeniu jest równie ważny jak test odbiorowy.

Przykład projektu preferencji

Załóżmy, że firma tworzy asystenta wspierającego redakcję opisów produktów. To przykład metody, a nie wynik rzeczywistego projektu. Zespół przygotowuje pary odpowiedzi i ocenia je osobno pod kątem zgodności z danymi produktu, kompletności wymaganych pól, zakazanych obietnic oraz czytelności.

Specjalista produktowy ocenia fakty, osoba odpowiedzialna za zgodność sprawdza obietnice, a redaktor ocenia język. Gdy oceny są sprzeczne, para nie trafia automatycznie do treningu. Najpierw zespół ustala, czy problemem jest niejasna rubryka, brak danych czy prawdziwy konflikt priorytetów.

Po dostrojeniu model przechodzi test na nowych produktach i opisach zawierających celowe braki. Zespół sprawdza nie tylko, czy tekst brzmi lepiej, lecz także czy model przestał dopisywać cechy. Jeżeli płynność rośnie, a liczba niepotwierdzonych twierdzeń pozostaje bez zmian, cel biznesowy nie został osiągnięty.

Co sprawdzić w gotowym modelu zamiast ufać samej metodzie treningu

Opis „trenowany z RLHF” nie mówi, czy model poprawnie wykona Twoje zadanie. Wybierz próbkę przypadków normalnych, granicznych i takich, w których poprawną odpowiedzią jest odmowa albo przyznanie braku wiedzy. Dla każdego zapisz, co można sprawdzić: zgodność z dokumentem źródłowym, poprawność obliczenia, brak ujawnienia danych i łatwość korekty przez człowieka.

Porównuj wersje modelu na tym samym zestawie, ponieważ gładko brzmiąca odpowiedź może być mniej prawdziwa. Szczegóły budowy zestawu testowego i śledzenia wyników są w poradniku o LangSmith. To praktyczny krok dla firmy oceniającej produkt AI; własny trening preferencyjny zwykle nie jest pierwszym zadaniem organizacji, która dopiero sprawdza zastosowanie modelu.

Co możesz zrobić w poniedziałek

Wybierz dwadzieścia rzeczywistych, zanonimizowanych zadań produktu i przygotuj po dwie odpowiedzi modelu. Nie pytaj zespołu ogólnie, która jest lepsza. Daj cztery osobne kryteria: poprawność, użyteczność, zgodność z polityką i właściwa odmowa. Dodaj możliwość remisu oraz „nie da się ocenić”.

Porównaj zgodność ocen i omów przypadki sporne. Ten prosty eksperyment pokaże, czy organizacja w ogóle potrafi zdefiniować pożądane zachowanie. Jeżeli eksperci nie zgadzają się przy jasnych danych, większa liczba etykiet nie rozwiąże problemu bez poprawy kryteriów.

Podstawowy przebieg RLHF i wyniki InstructGPT opisuje publikacja Ouyanga i współautorów. Wczesny eksperyment oraz przykład wykorzystywania luk w ocenie przedstawia OpenAI: Learning from human preferences, a ograniczenia dostrajania zachowania omawia opis InstructGPT. Jeśli chcesz umieścić tę metodę w szerszym obrazie możliwości modeli, przejdź do artykułu o dużych modelach językowych.

Przełóż temat na projekt w Twojej firmie

Zobacz zakres współpracy: od rozpoznania procesu i danych po projekt rozwiązania AI.