To jest wersja do trzymania obok, gdy projektujesz albo przeglądasz proces prowadzony przez agenta AI. Bierzesz go krok po kroku i przy każdym ustalasz, kto ma ten krok wykonać. Kandydatów jest trzech.
- Zwykły kod: obliczenia, reguły, warunki. Dla tych samych danych zawsze daje ten sam wynik.
- Model decyzyjny: wybiera jedną opcję z zamkniętej listy i zwraca ją w ustalonym formacie razem z prawdopodobieństwem.
- LLM (duży model językowy): pisze nowy tekst.
1. Diagnoza: pięć pytań do każdego kroku
Zadaj je po kolei i zatrzymaj się na pierwszym, które rozstrzyga.
- Czy wynikiem ma być nowy tekst, który ktoś przeczyta? Tak → LLM. Nie → pytanie 2.
- Czy da się to policzyć albo zapisać regułą „jeśli… to…”? Tak → kod. Nie → pytanie 3.
- Czy umiesz spisać wszystkie dopuszczalne odpowiedzi, zanim krok się wykona? Tak → kandydat na model decyzyjny, sprawdź pytania 4 i 5. Nie → LLM albo człowiek.
- Czy coś czeka na tę odpowiedź: klient, następny krok agenta, człowiek przy ekranie? Tak → liczy się szybkość i model decyzyjny zyskuje przewagę.
- Czy krok powtarza się wiele razy dziennie? Tak → koszt i opóźnienie się sumują, model decyzyjny zyskuje przewagę. Rzadko → zostań przy tym, co już działa.
Skrót do zapamiętania:
Kod liczy, model decyzyjny wybiera, LLM pisze tylko tam, gdzie trzeba napisać tekst.
Jeśli krok robi dziś dwie rzeczy naraz (decyduje i pisze), rozdziel go na dwa: najpierw wybór z listy, potem tekst.
2. Tabela: kto robi który krok
| Typ zadania | Kto | Dlaczego |
|---|---|---|
| Obliczenia: fizyka, czas, kwoty, daty, limity | Kod | Dokładny wynik bez interpretacji |
| Reguła biznesowa zapisana jednym warunkiem | Kod | Taniej i przewidywalnie |
| Przygotowanie listy dozwolonych opcji i faktów o każdej z nich | Kod | Model ma ważyć opcje, nie wymyślać nowych |
| Kierowanie zapytania, wybór narzędzia lub umiejętności agenta | Model decyzyjny | Znany zbiór odpowiedzi, a wszystko inne czeka na wynik |
| Klasyfikacja w dużej skali: zgłoszenia, dokumenty, tagi | Model decyzyjny + ręczna próbka | Szybko i tanio, ale przed wdrożeniem patrzy na to człowiek |
| Ocena przebiegu agenta: zaliczone / niezaliczone | Model decyzyjny sprawdzony na ocenach ludzi | Werdykt z krótkiej listy, powtarzany wiele razy |
| Kontrola bezpieczeństwa komendy przed wykonaniem | Model decyzyjny + próg pewności + człowiek przy wątpliwych | Każda komenda czeka na werdykt |
| Co zachować z długiej historii rozmowy agenta | Model decyzyjny: zachowaj / przytnij / usuń | Selekcja nie przekręca ścieżek plików i komend, bo ich nie przepisuje |
| Sterowanie w pętli czasu rzeczywistego | Kod (fizyka, limity) + model decyzyjny (wybór ruchu) | Odpowiedź musi przyjść, zanim sytuacja się zmieni |
| Odpowiedź dla klienta, streszczenie, szkic dokumentu | LLM | Wynikiem jest nowy tekst |
| Pojedyncze pole tekstowe w środku procesu, np. nazwa miasta do wpisania | Mniejszy LLM, wywołany tylko w tym miejscu | Tekst tylko tam, gdzie jest potrzebny |
| Zadanie otwarte, bez listy możliwych odpowiedzi | LLM albo człowiek | Nie ma z czego wybierać |
3. Projekt decyzji: lista opcji, próg, wyjście awaryjne
Odhacz, zanim oddasz krok modelowi decyzyjnemu.
- Spisz wszystkie dopuszczalne odpowiedzi, zanim krok ruszy. Jeśli lista się nie zamyka, to nie jest zadanie dla modelu decyzyjnego.
- Dodaj opcję „żadna / nie wiem / do człowieka”. Wybór narzędzia zaczyna się od pytania, czy narzędzie jest w ogóle potrzebne.
- Niech kod przygotuje fakty do każdej opcji: odległości, kwoty, terminy, stan. Model ma ważyć, nie liczyć.
- Przekazuj dane zamiast obrazów, jeśli kod umie je wyciągnąć. Uporządkowany opis sytuacji jest krótszy i pewniejszy niż zrzut ekranu.
- Ustal format wyniku z góry: opcja z listy, liczba albo tak/nie, zawsze z pewnością. Kilka takich pól w jednym zapytaniu jest w porządku.
- Ustal próg pewności. Poniżej progu wynik nie wykonuje się automatycznie.
- Nazwij, kto odbiera przypadki poniżej progu i te oznaczone „do człowieka”: konkretna osoba, kolejka albo drugi model.
- Przy krokach nieodwracalnych (usuń, wyślij, zapłać) podnieś próg albo zostaw decyzję zawsze człowiekowi.
- Ustal, jak często decyzja ma zapadać. Nie każdy element procesu musi decydować równie często.
- Decyzje przypadające na tę samą chwilę łącz w jedno zapytanie.
4. Walidacja: zanim zaufasz
- Zbuduj własny zestaw testowy z przypadków z twojego procesu, a nie z cudzego benchmarku.
- Niech te przypadki ocenią ludzie. Ich werdykt jest punktem odniesienia.
- Porównaj wyniki modelu z ludzkimi i zapisz, gdzie się rozjeżdżają.
- Każ modelowi ocenić te same przypadki kilka razy, żeby sprawdzić, czy werdykt się nie chwieje.
- Pamiętaj, że spójność to nie trafność. Model, który zawsze odpowiada tak samo, może się zawsze mylić.
- Przy klasyfikacji hurtowej przejrzyj ręcznie próbkę niezgodności ze starymi etykietami, zanim zmiany trafią do produkcji.
- Porównaj z tym, co masz dziś (LLM, reguła albo człowiek): szybkość, koszt i trafność na tym samym zestawie.
- Zysk sprawdzaj z tym modelem głównym, z którym faktycznie pracujesz. Ten sam mechanizm wyboru potrafi dać duży efekt przy jednym modelu i mały przy innym.
- Po wdrożeniu mierz dalej: co jakiś czas bierz próbkę decyzji z produkcji i dopisuj ją do zestawu testowego.
Kiedy nie używać modelu decyzyjnego
Zostań przy LLM, przy kodzie albo przy człowieku, gdy:
- wynikiem ma być tekst,
- nie da się zamknąć listy odpowiedzi,
- wystarczy jedna reguła w kodzie,
- decyzja zapada rzadko, a obecne rozwiązanie działa,
- błąd jest nieodwracalny, a nikt nie sprawdza przypadków wątpliwych,
- nie masz przykładów ocenionych przez ludzi, na których możesz model sprawdzić.
Przy każdym przeglądzie procesu wystarczy jedno pytanie do każdego kroku: czy on musi pisać, czy wystarczy, że wybierze?