Tę kartę trzymaj otwartą w drugim oknie, przy zadaniu, które właśnie chcesz zautomatyzować. Siedem bloków idzie w kolejności realnej pracy: najpierw schodzisz po drabinie i wybierasz stopień, potem ustawiasz dostępy, na końcu sprawdzasz agenta, zanim zostawisz go bez nadzoru. Przy każdym bloku masz pola do odhaczenia i jedno zdanie do zapamiętania.
Reguła zatrzymania obowiązuje w blokach od drugiego do czwartego: stopień niżej schodzisz tylko wtedy, gdy poprzedni odpowiedział „nie”. Pierwsze „tak” kończy schodzenie i właśnie tam budujesz.
Karta jest napisana pod agenta, który steruje przeglądarką. Przykładem jest aplikacja Codex od OpenAI: panel przeglądarki obok okna rozmowy i osobna wtyczka do sterowania całym komputerem. Nazwy ekranów będą się różnić między narzędziami. Pytania z tej karty zostają te same.
1. Nazwij zadanie, zanim wybierzesz narzędzie
Wybór stopnia zaczyna się od opisu zadania, nie od listy narzędzi. Dopóki nie wiesz, co dokładnie zmienia się między jednym przebiegiem a drugim, każdy stopień wygląda tak samo sensownie.
- [ ] Zapisz zadanie w jednym zdaniu: co otwierasz, w co klikasz i co ma z tego zostać na dysku.
- [ ] Dopisz, ile razy w miesiącu to zadanie wraca; jeśli rzadziej niż raz w miesiącu, zamknij kartę i zrób je ręcznie.
- [ ] Wypisz, co między przebiegami bywa inne: układ strony, kolejność kroków, liczba pozycji do pobrania.
- [ ] Zaznacz miejsca, w których musisz spojrzeć i ocenić, zanim klikniesz.
- [ ] Wskaż folder, w którym ma wylądować wynik, i zapisz jego nazwę dokładnie tak, jak wpiszesz ją później w instrukcji.
- [ ] Odnotuj, czy zadanie dotyka pieniędzy, dokumentów albo czegokolwiek, co wychodzi na zewnątrz firmy; wrócisz do tej notatki w bloku 6.
Zadanie opisane jednym zdaniem da się zautomatyzować. Zadanie opisane machnięciem ręki trafia od razu na najdroższy stopień.
2. Stopień pierwszy: czy da się to zrobić bez patrzenia na ekran?
API to serwisowe wejście do programu, przez które inny program rozmawia z nim wprost, z pominięciem interfejsu zrobionego dla człowieka. Nikt tu w nic nie klika, więc nic nie rozjedzie się wizualnie. Zaczynasz zawsze na tym stopniu i większość zadań właśnie tu się kończy.
- [ ] Sprawdź w dokumentacji narzędzia, czy ma API; szukaj hasła „API”, „integracje” albo „dla deweloperów”.
- [ ] Sprawdź, czy nie ma gotowej wtyczki albo połączenia, które obsłuży API za ciebie; wtedy nie piszesz ani jednej linijki.
- [ ] Zapytaj asystenta kodu, czy twoje zadanie da się wykonać przez to API, i poproś o listę potrzebnych uprawnień.
- [ ] Sprawdź, czy wywołania są płatne i od czego zależy koszt jednego przebiegu.
- [ ] Jeśli API pokrywa całe zadanie, zatrzymaj się na tym stopniu i zbuduj automatyzację tutaj.
- [ ] Jeśli pokrywa je w połowie, wypisz osobno tę połowę, której nie obejmuje; niżej schodzi tylko ona.
Stopień, na którym nikt nie patrzy na ekran, jest jedynym, który jutro przebiegnie dokładnie tak samo jak dziś.
3. Stopień drugi: czy przepływ jest za każdym razem identyczny?
Makro to zapisana sekwencja ruchów: kliknij w ten punkt, potem w ten, potem wpisz to. Żadnego patrzenia, żadnego decydowania. Dlatego jest tanie, bezpieczne i powtarza się co do piksela, ale stawia jeden twardy warunek: układ ekranu musi być stały.
- [ ] Przejdź zadanie ręcznie dwa razy, w odstępie kilku dni, i porównaj, czy kliknięcia padły w te same miejsca.
- [ ] Sprawdź, czy między krokami nic nie wyskakuje: zgoda na ciasteczka, komunikat o nowej wersji, ankieta.
- [ ] Sprawdź, czy liczba kroków jest stała, czy zależy od tego, ile pozycji akurat jest na liście.
- [ ] Wypisz kroki po kolei, jednym zdaniem każdy; to gotowa treść zamówienia dla asystenta kodu.
- [ ] Poproś dowolnego asystenta kodu o skrypt albo makro na podstawie tej listy; dostaniesz je w kilka minut.
- [ ] Uruchom gotowy skrypt dwa razy z rzędu, patrząc na przebieg; jeśli przeszedł bez poprawki, zatrzymaj się na tym stopniu.
Stały układ ekranu jest warunkiem, nie życzeniem. Gdy przycisk wędruje, makro klika tam, gdzie był wczoraj.
4. Stopień trzeci: agent w przeglądarce i wyjątek od drabiny
Schodzisz tu dopiero wtedy, gdy dwa wyższe stopnie odpadły. Agent patrzy na obraz ekranu, rozpoznaje pola i przyciski, decyduje, gdzie kliknąć, a po kliknięciu patrzy jeszcze raz, bo strona mogła się zmienić. Stąd bierze się jego siła i dokładnie ta sama słabość: dwa identyczne uruchomienia mogą przebiec inaczej.
- [ ] Potwierdź, że oba wyższe stopnie odpadły z powodu, który umiesz nazwać, a nie dlatego, że ich sprawdzenie zajęłoby popołudnie.
- [ ] Opisz zadanie zwykłym zdaniem po polsku; nie podajesz współrzędnych ani układu strony, tylko to, co ma się wydarzyć.
- [ ] Pierwsze przebiegi ustaw z oknem, żeby widzieć każde kliknięcie; tryb bez okna zostaw na późniejszą pracę w tle.
- [ ] Sprawdź wyjątek na jednym prawdziwym przebiegu: bywa, że API jest, a agent i tak wygrywa, bo przez API formatowanie wychodzi krzywo, dołożenie grafiki sprawia kłopot, a każde wywołanie jest płatne, podczas gdy agent pracuje w abonamencie, który i tak opłacasz.
- [ ] Porównaj oba warianty w dwóch kolumnach: koszt jednego przebiegu i to, ile przebiegów z rzędu kończy się bez twojej poprawki.
- [ ] Zapisz decyzję razem z powodem; za pół roku narzędzia się zmienią, a powód sprawdzisz w jednej linijce zamiast przechodzić drabinę od nowa.
Drabina jest kolejnością, w której sprawdzasz, a nie regułą stosowaną w ciemno. Najtańsze i najbardziej niezawodne nie zawsze wskazują ten sam stopień.
5. Dostępy: hasła nie mieszkają w rozmowie
Logujesz się ręcznie raz, w oknie agenta, a sesja zostaje zapamiętana na kolejne uruchomienia. Kusi wtedy skrót: wkleić login i hasło prosto w rozmowę. Wszystko, co wpiszesz w czacie, zostaje w historii, a historia rozmowy to plik na dysku, kopia zapasowa i kontekst, który może zostać wysłany dalej.
- [ ] Przygotuj plik CSV z pięcioma kolumnami: nazwa, adres strony, login, hasło, notatki.
- [ ] Zaimportuj go raz w ustawieniach menedżera haseł wbudowanego w aplikację; od tej pory agent wyciąga dane logowania stamtąd.
- [ ] Przejrzyj historię rozmów i skasuj wątki z wklejonym hasłem, a potem zmień to hasło; skasowany wątek nie cofa tego, co już poszło do kopii zapasowej.
- [ ] Wypisz konta, na których agent zostaje zalogowany, i ustal, kto kończy te sesje i kiedy.
- [ ] Zaznacz konta, z których serwis sam cię wylogowuje; przy nich planuj ręczne logowanie przed każdym przebiegiem.
- [ ] Zanim wpuścisz agenta na konto, sprawdź, co jeszcze widać po zalogowaniu; sesja daje mu cały panel, nie jedną zakładkę.
Hasła mieszkają w menedżerze haseł, nie w treści wiadomości. Agent niczego tu nie zmienia, daje tylko miejsce, z którego może je wziąć.
6. Protokół zaufania przed przebiegiem bez nadzoru
Agent, który raz poprawnie pobrał zestawienia, nie jest agentem, któremu można ufać. Pod spodem nie ma zapisanej sekwencji, tylko rozpoznawanie obrazu i decyzja podejmowana od nowa przy każdym kroku, więc jedno udane przejście niczego nie dowodzi.
Seria z oknem
- [ ] Uruchom zapisany przepływ kilkanaście razy z rzędu, z oknem, i siedź przy tym, patrząc na każdy krok.
- [ ] Zapisz każde miejsce, w którym agent się zawahał albo kliknął nie tam, i dopisz do instrukcji zdanie, które usuwa tę wątpliwość.
- [ ] Powtórz serię po każdej zmianie instrukcji; poprawka jest zmianą, a nie potwierdzeniem.
- [ ] Przy pieniądzach, dokumentach i wszystkim, co wychodzi na zewnątrz firmy, wydłuż serię; przy koncie bankowym powinna być naprawdę długa.
Instrukcja
- [ ] Przeczytaj instrukcję i wykreśl każde słowo, które zostawia wybór: „odpowiedni”, „właściwy”, „w razie potrzeby”.
- [ ] Nazwij wprost zakładkę, pozycje, zakres dat, format pliku i folder docelowy.
- [ ] Dopisz zdanie o tym, czego agent nie otwiera i w co nie klika poza opisaną ścieżką.
- [ ] Sprawdź instrukcję testem obcej osoby: czy ktoś, kto nie zna tego panelu, wykonałby dokładnie to jedno zadanie i nic poza nim?
Im mniej miejsca na interpretację, tym mniej niespodzianek. Ale żadne lepiej napisane zdanie nie zastąpi serii przebiegów, przy której siedzisz i patrzysz.
7. Twarde stopy, których nie naprawi żadna liczba przebiegów
Część przeszkód nie jest usterką do wypatrzenia w serii. To decyzje serwisu albo samej aplikacji i zostaną z tobą niezależnie od tego, jak długo patrzysz.
- [ ] Sprawdź, czy serwis prosi o kod z SMS-a albo z aplikacji uwierzytelniającej; ten kod wpisujesz ty i tam automatyzacja się zatrzymuje.
- [ ] Sprawdź, po jakim czasie serwis kończy sesję; gdy robi to szybko, agent stanie na ekranie logowania przy każdym przebiegu.
- [ ] Zaplanuj, co ma się stać, gdy agent zatrzyma się w połowie: czy niedokończony przebieg jest do czegoś przydatny, czy do wyrzucenia.
- [ ] Rozpisz z góry momenty, w których agent odmówi albo przerwie: prośba o uprawnienia dotyczące prywatności, a przy sterowaniu całym komputerem żądanie hasła administratora.
- [ ] Zanim oddasz mu ekran, sprawdź, po czym poznasz przejęcie kontroli: krawędzie ekranu podświetlają się na niebiesko.
Zadanie z kodem jednorazowym w środku nie jest zadaniem dla agenta. Rozbij je na część przed kodem i część po nim albo zostaw sobie w całości.
Gdy już chodzi bez ciebie
Po zakończonej serii zapisujesz cały przebieg jako umiejętność, czyli nazwany przepis wywoływany jednym zdaniem, i podpinasz ją pod harmonogram. Wtedy zostaje drugie pytanie, łatwe do pominięcia w euforii z działającej automatyzacji: czy to naprawdę coś daje.
- [ ] Policz, co ta umiejętność oddaje w minutach; jeden przebieg oszczędza minuty, nie godziny.
- [ ] Sprawdź zysk, który liczy się bardziej: czy przestajesz przerywać własną pracę, żeby przeklikać cudzy panel.
- [ ] Ustaw harmonogram na moment, w którym faktycznie patrzysz na wynik, a nie na okrągłą godzinę.
- [ ] Po pierwszym automatycznym uruchomieniu przeczytaj, co agent zrobił po drodze, a nie tylko to, co przyniósł.
- [ ] Mając kilka umiejętności, połącz je w ciąg: jedna pobiera dane, druga je porządkuje, trzecia wstawia wynik tam, gdzie ma trafić.
- [ ] Wyłącz umiejętność, która przez miesiąc nie zmieniła żadnej twojej decyzji.
Pusta kratka w tej karcie rzadko zatrzymuje pracę dzisiaj. Wraca za dwa tygodnie: jako agent, który stanął na ekranie logowania, jako plik zapisany nie w tym folderze albo jako przebieg, który zrobił coś, czego nikt nie widział. Wróć do bloku, z którego pochodzi ta kratka, i uzupełnij brakującą odpowiedź. A jeśli drabina zatrzymała cię na pierwszym stopniu, to jest dobra wiadomość, nie porażka.