Ktoś mówi do słuchawek: „Weź wczorajsze wideo i zrób z niego artykuł ze zrzutami ekranu”. Chwilę później: „Zajrzyj do struktury kursu i zbuduj na jej podstawie prostą stronę”. I jeszcze: „Dodaj w moim panelu zakładkę ze spotkaniami”. Między tymi zdaniami nie ma klawiatury. Każde zadanie rusza jako osobny wątek, a ta osoba wstaje od biurka, bierze telefon i kolejne zadania zleca już z niego. Tak wygląda sesja, w której pracę deleguje się głosem. Pokażę ci, co musi być na miejscu, żeby to działało, jak formułować polecenia i gdzie głos nie zwalnia z uwagi.
Najpierw jedno sprostowanie, bo od niego zależy cała reszta. Tryb głosowy nie jest nowym rodzajem asystenta. To cienka warstwa nad tym samym agentem kodującym, którego znasz z terminala. W opisywanej konfiguracji tym agentem jest Codex, a głosem steruje tryb GPT-6 Astra. Głos może zrobić dokładnie to, co potrafi agent, ani trochę więcej. Zmienia się tylko sposób sterowania: bez rąk, kilka wątków jednocześnie, od biurka albo z telefonu. Dlatego jakość tego, co wraca, nie zależy od głosu. Zależy od tego, na co ten głos wskazuje.
Zanim powiesz pierwsze zdanie
Kilka pojęć, bez których reszta nie ma sensu. Wątek to jedna osobna rozmowa agenta z jednym zadaniem. Projekt to miejsce, w którym agent pracuje: pliki, opis tego, czym się zajmujesz, podłączone narzędzia i zestaw umiejętności. Umiejętność, czyli skill, to zapisana instrukcja, jak wykonać konkretny typ pracy, na przykład jak zbudować stronę w twoim stylu albo jak przygotować zrzuty ekranu do artykułu. Tryb głosowy to sposób, w jaki wydajesz agentowi polecenia i słuchasz jego odpowiedzi zamiast je czytać.
Głos nie tworzy żadnej z tych rzeczy. Głos tylko po nie sięga. Kiedy prosisz o artykuł z wczorajszego wideo, agent musi wiedzieć, gdzie są twoje nagrania, którą miniaturę uznajesz za właściwą i w jakim formacie publikujesz. Kiedy prosisz o zakładkę ze spotkaniami, musi mieć dostęp do kalendarza i do narzędzia z notatkami ze spotkań. W sesji, którą opisuję, agent sam znalazł wśród istniejących miniatur tę właściwą i dopasował nową stronę do stylu już działającej witryny, choć nikt go o to nie prosił. To nie jest sztuczka trybu głosowego. To efekt tego, że przed rozpoczęciem pracy agent przeszukał przestrzeń roboczą i miał w niej co znaleźć.
Jeśli więc chcesz delegować głosem, najpierw zbuduj to, do czego głos ma sięgać: opis kontekstu, podłączone narzędzia (kalendarz, komunikator zespołu, tablicę zadań, notatki ze spotkań) i umiejętności pod powtarzalne prace. Jak to poskładać, opisuję w tekście o systemach operacyjnych na Claude Code. Tu wystarczy jedna zasada: agent uruchomiony głosem widzi tyle, ile mu wcześniej przygotowano.
Wskaż projekt, zanim delegujesz
Tu pojawia się błąd, który w opisywanej sesji wydarzył się naprawdę i który zobaczysz u siebie. Pierwsze dwa polecenia, artykuł i miniatura, poszły w świat jako zwykłe rozmowy. Bez projektu, czyli bez jego kontekstu, umiejętności i podłączonych narzędzi. Agent potwierdził i zaczął pracować, tylko że w pustym pokoju. Dopiero zdanie „pracuj wewnątrz mojego projektu przy wszystkich dzisiejszych zadaniach” zmieniło bieg. Oba wątki zostały zatrzymane, przekazały dalej to, co już ustaliły, i ruszyły od nowa we właściwym miejscu.
Głos jest tu bardziej zdradliwy niż klawiatura. W terminalu widzisz, w którym folderze stoisz. W rozmowie głosowej nie widzisz nic, a agent nie zapyta, czy na pewno chcesz pracować bez kontekstu. Zrobi to, co usłyszał.
Stąd dwie zasady, których się trzymam:
- Nazwij projekt w pierwszym zdaniu każdego polecenia. Nie „zrób artykuł”, ale „w projekcie X uruchom wątek, który zrobi artykuł”. Kontekst musi zostać wypowiedziany, zanim padnie zadanie.
- Sprawdź, gdzie wątek wylądował. Po każdym zleceniu zajrzyj do listy wątków i zobacz, czy nowy działa w projekcie, czy jako luźna rozmowa. To zajmuje chwilę i oszczędza ci pracy wykonanej w złym miejscu.
Jeśli agent już ruszył bez kontekstu, nie poprawiaj go w biegu. Każ mu się zatrzymać, przekazać ustalenia i zacząć od nowa we właściwym projekcie. Tak właśnie zadziałał tryb głosowy po korekcie: nie dopisał kontekstu do złej rozmowy, tylko ją wymienił na nową.
Kilka wątków naraz i jak się dogadują
Prawdziwa przewaga głosu nad klawiaturą to nie szybkość mówienia. To fakt, że nie musisz czekać. Mówisz „zrób artykuł”, a chwilę później „a w osobnym wątku zacznij miniaturę” i oba zadania biegną równolegle, podczas gdy ty już opisujesz trzecie.
Ciekawsze jest to, co dzieje się między wątkami. Kiedy miniatura była gotowa i padło zwykłe „wygląda świetnie, dokładnie o to chodziło”, to zdanie trafiło do wątku piszącego artykuł. Ten wątek dostał więc zatwierdzoną okładkę bez osobnego polecenia. Rozmowa głosowa działa tu jak łącznik: przekazuje ustalenia z jednego wątku do drugiego, a ty cały czas mówisz do jednego rozmówcy. To ten sam wzorzec, który opisuję przy sub-agentach w Claude Code: jeden koordynator i wielu wykonawców, a informacja idzie przez środek, nie na boki.
Dwie rzeczy, które warto wiedzieć w praktyce:
- Rozmowę głosową można wstrzymać i wrócić do niej później. Wątki pracują dalej. Nie musisz siedzieć przy biurku, żeby robota szła.
- Z telefonu rozmawiasz tak samo jak od biurka. Zlecasz research, agent odpowiada dalej, a w tle osobny wątek przeszukuje sieć. Wątki i ich stan są te same na biurku i w kieszeni.
Rada, która z tego wynika: dziel zadania tak, żeby wątki były od siebie niezależne, a punkty styku między nimi, choćby zatwierdzenie okładki, nazywaj głośno. Agent przekaże je dalej, ale tylko te, które usłyszy.
Głos nie zwalnia z oglądania wyniku
Najłatwiej dać się uwieść temu, że praca poszła bez klawiatury, i uznać, że skoro poszła, to jest dobra. Nie jest. Każdy z opisanych wątków skończył się tak samo: otwarciem wyniku i sprawdzeniem go.
Artykuł: agent sam pobrał wideo, spisał, co w nim powiedziano, zrobił zrzuty ekranu i rozmieścił je w artykule tam, gdzie pasowały do treści. Część przyciął do fragmentu, o który chodziło. Umiejętność odpowiedzialna za zrzuty rozmazuje też dane wrażliwe, takie jak klucze API czy prywatne adresy e-mail. To jest wbudowane i to jest dobre, ale nie znaczy, że możesz kliknąć „publikuj” bez zajrzenia. Rozmazanie wykonał model, a za publikację odpowiadasz ty.
Zakładka ze spotkaniami: pojawiły się w niej prawdziwe wpisy z kalendarza, streszczenia minionych spotkań i punkty do zrobienia. Wygląda przekonująco. Właśnie dlatego wymaga sprawdzenia: czy streszczenie nie zgubiło ważnego ustalenia i czy link prowadzi tam, gdzie powinien.
Strona zbudowana na podstawie struktury kursu: układ zgadzał się z prawdziwym programem, a styl pasował do istniejącej witryny. To wynik przeszukania przestrzeni roboczej, nie zgadywania. I to też trzeba otworzyć i przeklikać, zanim wyślesz komuś link.
Głos usuwa pisanie. Nie usuwa przeglądu. Jeśli masz mniej czasu na pisanie poleceń, przeznacz go na oglądanie wyników, bo to tam rozstrzyga się, czy delegowanie się opłaciło.
Moje przekonanie: głos jest tylko wskaźnikiem. Wskazuje na projekt i na to, co w nim wcześniej przygotowano, a pracę wykonuje właśnie to, nie sam głos. Jeśli wskaźnik celuje w pustkę, wraca pustka, tylko wypowiedziana miłym głosem. Zacznij od jednego polecenia. Wskaż w nim jeden projekt, zleć jedno zadanie i zobacz, gdzie wylądował wątek. Dopiero potem dodaj drugi.