Co się stało
7 sierpnia OpenAI opublikowało notę o nadchodzącym modelu Astra i zrobiło coś, czego wcześniej nie zrobiło ani razu: zaklasyfikowało własny, jeszcze niewydany model jako pierwszy „krytyczny" w kategorii cyberbezpieczeństwa w ramach swojej ramy gotowości.
Uzasadnienie warto przeczytać dosłownie, bo jest ostrożniejsze niż nagłówki, które za nim poszły. Firma nie napisała, że model przekroczył próg. Napisała, że wstępne oceny pokazują wynik na tyle mocny, że poziomu krytycznego nie da się w tej chwili wykluczyć. To klasyfikacja zapobiegawcza, nie pomiar.
Sam próg jest zdefiniowany wąsko. Model jest krytyczny wtedy, gdy potrafi bez udziału człowieka znajdować i budować działające exploity typu zero-day na utwardzonych, rzeczywistych systemach krytycznych — albo obmyślić i przeprowadzić od początku do końca nową kampanię ataku na utwardzony cel, mając wyłącznie ogólnie postawiony cel.
Odpowiedzią nie był komunikat, tylko zestaw ograniczeń. OpenAI wstrzymało te prace wewnętrzne nad Astrą, które nie spełniają zaostrzonych wymogów, i wymienia, co dołożyło: odizolowane środowiska testowe, ograniczony dostęp do sieci i narzędzi, mocniejszą ochronę i szyfrowanie wag modelu oraz monitorowanie obejmujące wszystkie zastosowania agentowe, które zatrzymuje działanie o wysokim ryzyku. Testy zewnętrzne mają przeprowadzić agencje rządowe i wybrane organizacje zajmujące się bezpieczeństwem AI; brytyjski AI Safety Institute jest wymieniony z nazwy.
Jedno zastrzeżenie z tej samej noty łatwo przeoczyć, a zmienia lekturę: Astra nie brała udziału w lipcowym incydencie z Hugging Face, o którym pisaliśmy przy okazji promienia rażenia. To osobna sprawa i osobny model.
Nasza teza
Każda z ostatnich historii tego typu była relacją z czegoś, co już się wydarzyło. Ta dotyczy czegoś, co się nie wydarzyło — i właśnie dlatego jest poważniejsza.
Dostawca wykonał ruch operacyjny na podstawie oceny, której nie rozstrzygnął. Nie „potwierdziliśmy zagrożenie, więc reagujemy", tylko „nie umiemy go wykluczyć, więc do czasu wyjaśnienia obowiązują ostrzejsze zasady". To jest dokładnie ta decyzja, której w firmach się nie podejmuje, bo na komitecie ryzyka wygrywa zdanie „nie ma dowodu". Warto zauważyć, kto tym razem stanął po drugiej stronie tego zdania: nie regulator, tylko sam producent, i to na własny koszt harmonogramu.
Druga rzecz jest praktyczniejsza. Lista zabezpieczeń, które OpenAI nałożyło na siebie, jest publiczna i czyta się jak specyfikacja. Cztery pozycje zna każdy, kto uruchamiał agentów: izolacja, ograniczony dostęp do sieci i narzędzi, ochrona sekretów, monitoring. Piąta jest inna i to na nią patrzymy — monitorowanie, które zatrzymuje działanie o wysokim ryzyku, a nie tylko je odnotowuje.
Ta różnica, między alertem a zatrzymaniem, jest miejscem, w którym w praktyce kończy się większość wdrożeń agentowych. Alert trafia do człowieka, który przeczyta go rano. Agent działa w nocy. Laboratorium z największą ekspozycją na tym rynku właśnie zdecydowało, że samo odnotowanie mu nie wystarcza — i to jest sygnał czytelniejszy niż jakikolwiek benchmark.
Jest jeszcze wniosek, który wykracza poza to, co potwierdzone, więc oznaczamy go wprost: poniższe jest spekulacją, nie ustaleniem. Zdolność, którą jedno laboratorium opisało u siebie, rzadko zostaje u jednego laboratorium na długo, a my nie wiemy, ile czasu dzieli tę notę od momentu, w którym coś o zbliżonej sile pracuje po drugiej stronie. Wiadomo natomiast, że okno między „dostawca mówi, że to potrafi" a „to jest szeroko dostępne" bywa jedynym czasem na przygotowanie, jaki obrońca dostaje. Jeśli traktujesz ryzyko cyberbezpieczeństwa AI jako pozycję w rejestrze ryzyk, to jest tydzień, w którym warto ją odświeżyć — nie dlatego, że coś się stało, tylko dlatego, że przestało być hipotezą.
Czego z tej historii nie należy wyciągać: że trzeba coś kupić. Nie ma tu produktu do wdrożenia ani nikogo, kto sprzedaje rozwiązanie tego problemu.
Dlaczego to ma znaczenie
Private Equity
Dla funduszu to jedna dodatkowa linijka w przeglądzie portfela, i to tania. Jeśli koszt znalezienia luki po stronie atakującego faktycznie spadnie, najbardziej wystawione będą spółki z dużą powierzchnią i cienką obsadą bezpieczeństwa — czyli typowa spółka po dwóch przejęciach add-on, z odziedziczonymi środowiskami, o których w zespole nie pamięta już nikt. Pytanie na najbliższy przegląd nie brzmi „czy jesteśmy bezpieczni", bo odpowiedź zawsze brzmi „tak". Brzmi: kto u nas odpowiada za to, że poprawka bezpieczeństwa trafia na systemy widoczne z zewnątrz w określonym czasie, i skąd wiemy, że tak się dzieje. Spółka, która ma na to nazwisko i liczbę dni, jest w innym miejscu niż spółka, która ma politykę. Jak porządkujemy taki przegląd po stronie funduszu: najpierw właściciel i tempo, potem narzędzia.
Enterprise
Duża organizacja ma i monitoring, i inwentarz. Nowe jest przeniesienie rozróżnienia „odnotuj kontra zatrzymaj" na własne wdrożenia agentowe. Jeśli agent u Ciebie sięga po narzędzia zmieniające stan systemów, a nie tylko czytające, to warto wiedzieć, co się stanie, gdy zachowa się nietypowo o drugiej w nocy. Odpowiedź „zapisze się w logu" jest odpowiedzią — tylko nie tą, którą dla siebie wybrał dostawca modelu.
Drugi wątek to zaopatrzenie. Przy najbliższej rozmowie z dostawcą warto zapytać o coś, o co dotąd się nie pytało: jakie progi zdolności ma zdefiniowane, kto je mierzy i co dzieje się z Twoim dostępem, gdy próg zostanie przekroczony. Astra pokazuje, że to nie jest pytanie teoretyczne — harmonogram modelu może się przesunąć z powodu, który nie ma nic wspólnego z produktem ani z rynkiem.
MŚP / średni rynek
Firma średniej wielkości nie zbuduje zespołu bezpieczeństwa i nie musi. Ma za to do przestawienia jedną rzecz, która nie wymaga budżetu: kalendarz. Przy inwentarzu tego, co wystawione do internetu, byliśmy pod koniec lipca — jeśli ta lista u Ciebie powstała, druga połowa roboty to tempo. Ile dni mija od publikacji poprawki do jej wgrania na to, co widać z zewnątrz? Jeśli odpowiedź brzmi „jak się przypomni", to jest właśnie ta zmienna, w którą tańszy przeciwnik uderza najpierw, bo nie musi wybierać celu — wystarczy, że skanuje. Nie potrzeba na to narzędzia, tylko daty w kalendarzu i jednej osoby, która jej pilnuje.
Jeden ruch na ten tydzień
Weź jednego agenta, który pracuje u Ciebie w produkcji i ma dostęp do narzędzi zmieniających stan — wysyła, zapisuje, wywołuje cudze API. Odpowiedz na jedno pytanie: co konkretnie zatrzyma go w połowie działania, jeśli zacznie robić coś, czego nie przewidziałeś. Nie co to odnotuje — co to zatrzyma. Jeśli odpowiedzią jest człowiek, dopisz drugą część: w jakich godzinach ten człowiek patrzy. Cała diagnostyka zajmuje kwadrans i najczęściej kończy się jedną linijką w konfiguracji, a nie projektem. Opisz swój przypadek: mailto:[email protected]?subject=Rozmowa%20z%20Aurora%20AI.