Aurora AIOpisz swój przypadek

Oferta

UsługiProduktyRealizacje

Dla kogo

Private EquityEnterpriseMŚP
UsługiProduktyRealizacjeO nasBlogKontakt

Baza wiedzy

Start tutajWikiSłownikPrzewodniki

Automatyzacja AI Baza wiedzy

Delegowanie głosem — jak mówić do agentów, żeby robili właściwą pracę

Tryb głosowy to cienka warstwa nad agentem. Wyjaśniam, co musi być na miejscu i jak mówić, żeby wątek uruchomiony głosem zrobił właściwą pracę.

Pojedyncza zielona fala głosu z lewej strony rozdziela się w kilka równoległych, świecących na niebiesko wątków biegnących w prawo, na ciemnym grafitowym tle.
Pojedyncza zielona fala głosu z lewej strony rozdziela się w kilka równoległych, świecących na niebiesko wątków biegnących w prawo, na ciemnym grafitowym tle.
Automatyzacja AI#tryb-glosowy #agenci-ai #codex #delegowanie #automatyzacja-ai #przestrzen-robocza

Ktoś mówi do słuchawek: „Weź wczorajsze wideo i zrób z niego artykuł ze zrzutami ekranu”. Chwilę później: „Zajrzyj do struktury kursu i zbuduj na jej podstawie prostą stronę”. I jeszcze: „Dodaj w moim panelu zakładkę ze spotkaniami”. Między tymi zdaniami nie ma klawiatury. Każde zadanie rusza jako osobny wątek, a ta osoba wstaje od biurka, bierze telefon i kolejne zadania zleca już z niego. Tak wygląda sesja, w której pracę deleguje się głosem. Pokażę ci, co musi być na miejscu, żeby to działało, jak formułować polecenia i gdzie głos nie zwalnia z uwagi.

Najpierw jedno sprostowanie, bo od niego zależy cała reszta. Tryb głosowy nie jest nowym rodzajem asystenta. To cienka warstwa nad tym samym agentem kodującym, którego znasz z terminala. W opisywanej konfiguracji tym agentem jest Codex, a głosem steruje tryb GPT-6 Astra. Głos może zrobić dokładnie to, co potrafi agent, ani trochę więcej. Zmienia się tylko sposób sterowania: bez rąk, kilka wątków jednocześnie, od biurka albo z telefonu. Dlatego jakość tego, co wraca, nie zależy od głosu. Zależy od tego, na co ten głos wskazuje.

Zanim powiesz pierwsze zdanie

Kilka pojęć, bez których reszta nie ma sensu. Wątek to jedna osobna rozmowa agenta z jednym zadaniem. Projekt to miejsce, w którym agent pracuje: pliki, opis tego, czym się zajmujesz, podłączone narzędzia i zestaw umiejętności. Umiejętność, czyli skill, to zapisana instrukcja, jak wykonać konkretny typ pracy, na przykład jak zbudować stronę w twoim stylu albo jak przygotować zrzuty ekranu do artykułu. Tryb głosowy to sposób, w jaki wydajesz agentowi polecenia i słuchasz jego odpowiedzi zamiast je czytać.

Głos nie tworzy żadnej z tych rzeczy. Głos tylko po nie sięga. Kiedy prosisz o artykuł z wczorajszego wideo, agent musi wiedzieć, gdzie są twoje nagrania, którą miniaturę uznajesz za właściwą i w jakim formacie publikujesz. Kiedy prosisz o zakładkę ze spotkaniami, musi mieć dostęp do kalendarza i do narzędzia z notatkami ze spotkań. W sesji, którą opisuję, agent sam znalazł wśród istniejących miniatur tę właściwą i dopasował nową stronę do stylu już działającej witryny, choć nikt go o to nie prosił. To nie jest sztuczka trybu głosowego. To efekt tego, że przed rozpoczęciem pracy agent przeszukał przestrzeń roboczą i miał w niej co znaleźć.

Jeśli więc chcesz delegować głosem, najpierw zbuduj to, do czego głos ma sięgać: opis kontekstu, podłączone narzędzia (kalendarz, komunikator zespołu, tablicę zadań, notatki ze spotkań) i umiejętności pod powtarzalne prace. Jak to poskładać, opisuję w tekście o systemach operacyjnych na Claude Code. Tu wystarczy jedna zasada: agent uruchomiony głosem widzi tyle, ile mu wcześniej przygotowano.

Wskaż projekt, zanim delegujesz

Tu pojawia się błąd, który w opisywanej sesji wydarzył się naprawdę i który zobaczysz u siebie. Pierwsze dwa polecenia, artykuł i miniatura, poszły w świat jako zwykłe rozmowy. Bez projektu, czyli bez jego kontekstu, umiejętności i podłączonych narzędzi. Agent potwierdził i zaczął pracować, tylko że w pustym pokoju. Dopiero zdanie „pracuj wewnątrz mojego projektu przy wszystkich dzisiejszych zadaniach” zmieniło bieg. Oba wątki zostały zatrzymane, przekazały dalej to, co już ustaliły, i ruszyły od nowa we właściwym miejscu.

Głos jest tu bardziej zdradliwy niż klawiatura. W terminalu widzisz, w którym folderze stoisz. W rozmowie głosowej nie widzisz nic, a agent nie zapyta, czy na pewno chcesz pracować bez kontekstu. Zrobi to, co usłyszał.

Diagram: taka sama zielona strzałka wskazuje z jednej strony pełny, oznaczony ikonami kontener projektu, a z drugiej pusty, przygaszony kontener.
Diagram: taka sama zielona strzałka wskazuje z jednej strony pełny, oznaczony ikonami kontener projektu, a z drugiej pusty, przygaszony kontener.

Stąd dwie zasady, których się trzymam:

  • Nazwij projekt w pierwszym zdaniu każdego polecenia. Nie „zrób artykuł”, ale „w projekcie X uruchom wątek, który zrobi artykuł”. Kontekst musi zostać wypowiedziany, zanim padnie zadanie.
  • Sprawdź, gdzie wątek wylądował. Po każdym zleceniu zajrzyj do listy wątków i zobacz, czy nowy działa w projekcie, czy jako luźna rozmowa. To zajmuje chwilę i oszczędza ci pracy wykonanej w złym miejscu.

Jeśli agent już ruszył bez kontekstu, nie poprawiaj go w biegu. Każ mu się zatrzymać, przekazać ustalenia i zacząć od nowa we właściwym projekcie. Tak właśnie zadziałał tryb głosowy po korekcie: nie dopisał kontekstu do złej rozmowy, tylko ją wymienił na nową.

Kilka wątków naraz i jak się dogadują

Prawdziwa przewaga głosu nad klawiaturą to nie szybkość mówienia. To fakt, że nie musisz czekać. Mówisz „zrób artykuł”, a chwilę później „a w osobnym wątku zacznij miniaturę” i oba zadania biegną równolegle, podczas gdy ty już opisujesz trzecie.

Ciekawsze jest to, co dzieje się między wątkami. Kiedy miniatura była gotowa i padło zwykłe „wygląda świetnie, dokładnie o to chodziło”, to zdanie trafiło do wątku piszącego artykuł. Ten wątek dostał więc zatwierdzoną okładkę bez osobnego polecenia. Rozmowa głosowa działa tu jak łącznik: przekazuje ustalenia z jednego wątku do drugiego, a ty cały czas mówisz do jednego rozmówcy. To ten sam wzorzec, który opisuję przy sub-agentach w Claude Code: jeden koordynator i wielu wykonawców, a informacja idzie przez środek, nie na boki.

Centralny zielony węzeł z ikoną telefonu łączy się z trzema równoległymi wątkami zadań; jasny punkt wiadomości przechodzi między wątkami przez środek.
Centralny zielony węzeł z ikoną telefonu łączy się z trzema równoległymi wątkami zadań; jasny punkt wiadomości przechodzi między wątkami przez środek.

Dwie rzeczy, które warto wiedzieć w praktyce:

  • Rozmowę głosową można wstrzymać i wrócić do niej później. Wątki pracują dalej. Nie musisz siedzieć przy biurku, żeby robota szła.
  • Z telefonu rozmawiasz tak samo jak od biurka. Zlecasz research, agent odpowiada dalej, a w tle osobny wątek przeszukuje sieć. Wątki i ich stan są te same na biurku i w kieszeni.

Rada, która z tego wynika: dziel zadania tak, żeby wątki były od siebie niezależne, a punkty styku między nimi, choćby zatwierdzenie okładki, nazywaj głośno. Agent przekaże je dalej, ale tylko te, które usłyszy.

Głos nie zwalnia z oglądania wyniku

Najłatwiej dać się uwieść temu, że praca poszła bez klawiatury, i uznać, że skoro poszła, to jest dobra. Nie jest. Każdy z opisanych wątków skończył się tak samo: otwarciem wyniku i sprawdzeniem go.

Artykuł: agent sam pobrał wideo, spisał, co w nim powiedziano, zrobił zrzuty ekranu i rozmieścił je w artykule tam, gdzie pasowały do treści. Część przyciął do fragmentu, o który chodziło. Umiejętność odpowiedzialna za zrzuty rozmazuje też dane wrażliwe, takie jak klucze API czy prywatne adresy e-mail. To jest wbudowane i to jest dobre, ale nie znaczy, że możesz kliknąć „publikuj” bez zajrzenia. Rozmazanie wykonał model, a za publikację odpowiadasz ty.

Zakładka ze spotkaniami: pojawiły się w niej prawdziwe wpisy z kalendarza, streszczenia minionych spotkań i punkty do zrobienia. Wygląda przekonująco. Właśnie dlatego wymaga sprawdzenia: czy streszczenie nie zgubiło ważnego ustalenia i czy link prowadzi tam, gdzie powinien.

Strona zbudowana na podstawie struktury kursu: układ zgadzał się z prawdziwym programem, a styl pasował do istniejącej witryny. To wynik przeszukania przestrzeni roboczej, nie zgadywania. I to też trzeba otworzyć i przeklikać, zanim wyślesz komuś link.

Głos usuwa pisanie. Nie usuwa przeglądu. Jeśli masz mniej czasu na pisanie poleceń, przeznacz go na oglądanie wyników, bo to tam rozstrzyga się, czy delegowanie się opłaciło.

Moje przekonanie: głos jest tylko wskaźnikiem. Wskazuje na projekt i na to, co w nim wcześniej przygotowano, a pracę wykonuje właśnie to, nie sam głos. Jeśli wskaźnik celuje w pustkę, wraca pustka, tylko wypowiedziana miłym głosem. Zacznij od jednego polecenia. Wskaż w nim jeden projekt, zleć jedno zadanie i zobacz, gdzie wylądował wątek. Dopiero potem dodaj drugi.

Delegowanie głosem: pięć kroków sesjiKolejność kroków sesji głosowej z agentem: od przygotowanej przestrzeni roboczej, przez wskazanie projektu i uruchomienie wątków, do przeglądu wyniku.Delegowanie głosem: pięć kroków sesjiPrzygotuj przestrzeńprojekt, podłączone narzędzia i umiejętności istnieją, zanim powiesz słowoWskaż projektnazwa projektu pada w pierwszym zdaniu każdego poleceniaUruchom wątkiniezależne zadania biegną równolegle, punkty styku nazywasz głośnoSprawdź, gdzie wylądowaływątek w projekcie czy luźna rozmowa; jeśli źle, zatrzymaj i zacznij od nowaOtwórz wynikzrzuty, dane wrażliwe, streszczenia i linki sprawdzasz sam
Delegowanie głosem: pięć kroków sesjiKolejność kroków sesji głosowej z agentem: od przygotowanej przestrzeni roboczej, przez wskazanie projektu i uruchomienie wątków, do przeglądu wyniku.Delegowanie głosem: pięć krokówsesjiPrzygotuj przestrzeńprojekt, podłączone narzędzia i umiejętnościistnieją, zanim powiesz słowoWskaż projektnazwa projektu pada w pierwszym zdaniukażdego poleceniaUruchom wątkiniezależne zadania biegną równolegle, punktystyku nazywasz głośnoSprawdź, gdzie wylądowaływątek w projekcie czy luźna rozmowa; jeśliźle, zatrzymaj i zacznij od nowaOtwórz wynikzrzuty, dane wrażliwe, streszczenia i linkisprawdzasz sam
Kolejność kroków sesji głosowej z agentem: od przygotowanej przestrzeni roboczej, przez wskazanie projektu i uruchomienie wątków, do przeglądu wyniku.

Sprawdź się

Pięć pytań o to, co naprawdę decyduje, gdy zlecasz pracę agentom głosem.

  1. Od czego przede wszystkim zależy jakość pracy, którą agent wykona po poleceniu głosowym?

  2. Dwa wątki ruszyły jako luźne rozmowy, bez kontekstu projektu. Co jest właściwą reakcją?

  3. Dlaczego przy wskazywaniu kontekstu głos bywa bardziej zdradliwy niż klawiatura?

  4. Miniatura została zatwierdzona głosem, a wątek piszący artykuł od razu jej użył. Jak to ustalenie do niego trafiło?

  5. Co tryb głosowy usuwa z pracy z agentem, a czego nie usuwa?