Automatyzacja AI Zasób

Karta decyzji: LLM, model decyzyjny czy zwykły kod?

Karta do trzymania pod ręką przy projektowaniu agenta AI: kto ma wykonać dany krok, jak zamknąć listę opcji i jak sprawdzić model, zanim mu zaufasz.

To jest wersja do trzymania obok, gdy projektujesz albo przeglądasz proces prowadzony przez agenta AI. Bierzesz go krok po kroku i przy każdym ustalasz, kto ma ten krok wykonać. Kandydatów jest trzech.

  • Zwykły kod: obliczenia, reguły, warunki. Dla tych samych danych zawsze daje ten sam wynik.
  • Model decyzyjny: wybiera jedną opcję z zamkniętej listy i zwraca ją w ustalonym formacie razem z prawdopodobieństwem.
  • LLM (duży model językowy): pisze nowy tekst.

1. Diagnoza: pięć pytań do każdego kroku

Zadaj je po kolei i zatrzymaj się na pierwszym, które rozstrzyga.

  1. Czy wynikiem ma być nowy tekst, który ktoś przeczyta? Tak → LLM. Nie → pytanie 2.
  2. Czy da się to policzyć albo zapisać regułą „jeśli… to…”? Tak → kod. Nie → pytanie 3.
  3. Czy umiesz spisać wszystkie dopuszczalne odpowiedzi, zanim krok się wykona? Tak → kandydat na model decyzyjny, sprawdź pytania 4 i 5. Nie → LLM albo człowiek.
  4. Czy coś czeka na tę odpowiedź: klient, następny krok agenta, człowiek przy ekranie? Tak → liczy się szybkość i model decyzyjny zyskuje przewagę.
  5. Czy krok powtarza się wiele razy dziennie? Tak → koszt i opóźnienie się sumują, model decyzyjny zyskuje przewagę. Rzadko → zostań przy tym, co już działa.

Skrót do zapamiętania:

Kod liczy, model decyzyjny wybiera, LLM pisze tylko tam, gdzie trzeba napisać tekst.

Jeśli krok robi dziś dwie rzeczy naraz (decyduje i pisze), rozdziel go na dwa: najpierw wybór z listy, potem tekst.

2. Tabela: kto robi który krok

Typ zadaniaKtoDlaczego
Obliczenia: fizyka, czas, kwoty, daty, limityKodDokładny wynik bez interpretacji
Reguła biznesowa zapisana jednym warunkiemKodTaniej i przewidywalnie
Przygotowanie listy dozwolonych opcji i faktów o każdej z nichKodModel ma ważyć opcje, nie wymyślać nowych
Kierowanie zapytania, wybór narzędzia lub umiejętności agentaModel decyzyjnyZnany zbiór odpowiedzi, a wszystko inne czeka na wynik
Klasyfikacja w dużej skali: zgłoszenia, dokumenty, tagiModel decyzyjny + ręczna próbkaSzybko i tanio, ale przed wdrożeniem patrzy na to człowiek
Ocena przebiegu agenta: zaliczone / niezaliczoneModel decyzyjny sprawdzony na ocenach ludziWerdykt z krótkiej listy, powtarzany wiele razy
Kontrola bezpieczeństwa komendy przed wykonaniemModel decyzyjny + próg pewności + człowiek przy wątpliwychKażda komenda czeka na werdykt
Co zachować z długiej historii rozmowy agentaModel decyzyjny: zachowaj / przytnij / usuńSelekcja nie przekręca ścieżek plików i komend, bo ich nie przepisuje
Sterowanie w pętli czasu rzeczywistegoKod (fizyka, limity) + model decyzyjny (wybór ruchu)Odpowiedź musi przyjść, zanim sytuacja się zmieni
Odpowiedź dla klienta, streszczenie, szkic dokumentuLLMWynikiem jest nowy tekst
Pojedyncze pole tekstowe w środku procesu, np. nazwa miasta do wpisaniaMniejszy LLM, wywołany tylko w tym miejscuTekst tylko tam, gdzie jest potrzebny
Zadanie otwarte, bez listy możliwych odpowiedziLLM albo człowiekNie ma z czego wybierać

3. Projekt decyzji: lista opcji, próg, wyjście awaryjne

Odhacz, zanim oddasz krok modelowi decyzyjnemu.

  • Spisz wszystkie dopuszczalne odpowiedzi, zanim krok ruszy. Jeśli lista się nie zamyka, to nie jest zadanie dla modelu decyzyjnego.
  • Dodaj opcję „żadna / nie wiem / do człowieka”. Wybór narzędzia zaczyna się od pytania, czy narzędzie jest w ogóle potrzebne.
  • Niech kod przygotuje fakty do każdej opcji: odległości, kwoty, terminy, stan. Model ma ważyć, nie liczyć.
  • Przekazuj dane zamiast obrazów, jeśli kod umie je wyciągnąć. Uporządkowany opis sytuacji jest krótszy i pewniejszy niż zrzut ekranu.
  • Ustal format wyniku z góry: opcja z listy, liczba albo tak/nie, zawsze z pewnością. Kilka takich pól w jednym zapytaniu jest w porządku.
  • Ustal próg pewności. Poniżej progu wynik nie wykonuje się automatycznie.
  • Nazwij, kto odbiera przypadki poniżej progu i te oznaczone „do człowieka”: konkretna osoba, kolejka albo drugi model.
  • Przy krokach nieodwracalnych (usuń, wyślij, zapłać) podnieś próg albo zostaw decyzję zawsze człowiekowi.
  • Ustal, jak często decyzja ma zapadać. Nie każdy element procesu musi decydować równie często.
  • Decyzje przypadające na tę samą chwilę łącz w jedno zapytanie.

4. Walidacja: zanim zaufasz

  • Zbuduj własny zestaw testowy z przypadków z twojego procesu, a nie z cudzego benchmarku.
  • Niech te przypadki ocenią ludzie. Ich werdykt jest punktem odniesienia.
  • Porównaj wyniki modelu z ludzkimi i zapisz, gdzie się rozjeżdżają.
  • Każ modelowi ocenić te same przypadki kilka razy, żeby sprawdzić, czy werdykt się nie chwieje.
  • Pamiętaj, że spójność to nie trafność. Model, który zawsze odpowiada tak samo, może się zawsze mylić.
  • Przy klasyfikacji hurtowej przejrzyj ręcznie próbkę niezgodności ze starymi etykietami, zanim zmiany trafią do produkcji.
  • Porównaj z tym, co masz dziś (LLM, reguła albo człowiek): szybkość, koszt i trafność na tym samym zestawie.
  • Zysk sprawdzaj z tym modelem głównym, z którym faktycznie pracujesz. Ten sam mechanizm wyboru potrafi dać duży efekt przy jednym modelu i mały przy innym.
  • Po wdrożeniu mierz dalej: co jakiś czas bierz próbkę decyzji z produkcji i dopisuj ją do zestawu testowego.

Kiedy nie używać modelu decyzyjnego

Zostań przy LLM, przy kodzie albo przy człowieku, gdy:

  • wynikiem ma być tekst,
  • nie da się zamknąć listy odpowiedzi,
  • wystarczy jedna reguła w kodzie,
  • decyzja zapada rzadko, a obecne rozwiązanie działa,
  • błąd jest nieodwracalny, a nikt nie sprawdza przypadków wątpliwych,
  • nie masz przykładów ocenionych przez ludzi, na których możesz model sprawdzić.

Przy każdym przeglądzie procesu wystarczy jedno pytanie do każdego kroku: czy on musi pisać, czy wystarczy, że wybierze?