Spis treści
Ktoś pyta chatbota, jak ukryć swoją lokalizację przed agresywnym byłym partnerem. Sztuczna inteligencja udziela porady dotyczącej bezpieczeństwa, sugerując, by udać się do sklepu w przebraniu, ponieważ “osoby stosujące przemoc rzadko odwiedzają sklepy w południe”. Odpowiedź ta pochodzi z najnowocześniejszego modelu i została opisana w nowym artykule naukowym opracowanym przez University College London oraz Google.
To właśnie to zdanie zapadło mi w pamięć po przeczytaniu 36 stron.
Artykuł nosi tytuł „HelpBench”, a jego zakres autorzy określają skrótem PSS – kategorią obejmującą wszystko, od zhakowanego konta po przypadki prześladowania. Artykuł stawia pytanie, jak trafna jest odpowiedź, gdy zwykła osoba zgłasza jeden z tych problemów do modelu LLM. Innymi słowy, bada on, na ile wiarygodne są porady dotyczące bezpieczeństwa udzielane przez sztuczną inteligencję w sytuacjach, w których stawka jest naprawdę wysoka.
Ogólny wynik dotyczący porad w zakresie bezpieczeństwa AI wygląda dobrze – średnia dla 18 modeli wyniosła 82%. Jednak gdy przejdziemy o jeden poziom niżej, sytuacja już nie wygląda tak dobrze.
Co mierzy HelpBench
Zespół wyodrębnił 450 pytań z zbioru danych obejmującego trzy miliony postów na Reddicie. Wszystkie te wpisy powstały w latach 2021–2024. Żadne z nich nie jest generowane komputerowo. Są to prawdziwi ludzie borykający się z prawdziwym problemem, którzy zwracają się z pytaniami do nieznajomych w internecie.
Dziewięć tematów, z których każdy zawiera 50 pytań, dotyczących kont, naruszeń bezpieczeństwa, narzędzi do moderacji, oszustw, narzędzi zabezpieczających, nękania, narzędzi ochrony prywatności, działań platformy oraz kwestii związanych z danymi.
Każde pytanie zostało przeredagowane tak, aby nie można było zidentyfikować autora oryginalnego wpisu, a następnie sprawdzone ręcznie. Współczynnik podobieństwa cosinusowego między tekstem oryginalnym a przeredagowanym wyniósł 0,56, przy pokryciu 3-gramowym wynoszącym 0,04. Żaden model nie jest w stanie odtworzyć wątku na Reddicie na podstawie dopasowania wzorców.

Pięć przebiegów na każde pytanie w 18 modelach dało łącznie 40 500 odpowiedzi, co stanowi największą dotychczas opublikowaną próbę oceniającą jakość porad dotyczących bezpieczeństwa generowanych przez sztuczną inteligencję.
Średnia to błędna wartość
82% wydaje się być solidną oceną „B” w zakresie porad dotyczących bezpieczeństwa sztucznej inteligencji. Tak jednak nie jest, ponieważ punktacja nie jest rozłożona równomiernie.
W 14% wszystkich odpowiedzi uzyskano wynik poniżej 65%, a w przypadku 7% pytań każdy z 18 modeli uzyskał wynik poniżej 65%. Każdy model z tego zestawu ma tę samą lukę.
Sama średnia wyników porównawczych praktycznie nic nie mówi. Automatyczne mapowanie ATT&CK osiąga współczynnik mikro F1 na poziomie 0,22 i zawodzi na całej linii, podczas gdy HelpBench zawodzi w sposób, którego nie widać na podstawie liczby podanej w nagłówku.
W tym miejscu wkracza myślenie o bezpieczeństwie, ponieważ ryzyko to iloczyn skutku i prawdopodobieństwa, a nigdy samo prawdopodobieństwo. Wskaźnik niepowodzeń na poziomie 14% w przypadku zapytania “jak włączyć uwierzytelnianie dwuskładnikowe” jest irytujący. Ten sam wskaźnik w przypadku zapytania “czy mój były śledzi mój telefon” to zupełnie inna sprawa.
Olejnik podkreśla to w książce „Filozofia cyberbezpieczeństwa”. Model zagrożeń zależy od tego, kim jesteś. Zwykły użytkownik narażony jest na phishing i kradzież danych uwierzytelniających, podczas gdy dziennikarz lub osoba uciekająca z toksycznego związku ma do czynienia z ukierunkowanym przeciwnikiem, który ma już fizyczny dostęp.
Oboje wpisują tekst w to samo pole, a model odpowiada obojgu w ten sam sposób.
W artykule stwierdzono właśnie to w odniesieniu do usuwania oprogramowania szpiegującego – większość modeli podawała jasne instrukcje techniczne, nie wspominając jednak, że nagłe usunięcie programu może stać się czynnikiem wywołującym eskalację przemocy fizycznej. Narzędzie zniknęło, a sprawca tego zauważa. Osoba ta znajduje się teraz z nim w jednym pomieszczeniu. Istnieje cała koalicja dostawców rozwiązań z zakresu bezpieczeństwa oraz organizacji wspierających ofiary oparte na właśnie tej sekwencji, a żaden z jej kontekstów nie doprowadził do odpowiedzi.
To nie jest teoria. “Mężczyźni kupują narzędzia hakerskie, by wykorzystać je przeciwko swoim żonom i przyjaciółkom” – to prawdziwy nagłówek opisujący rzeczywisty rynek.
Sześć sytuacji, w których porada okazuje się nieudana
Naukowcy sklasyfikowali sytuacje, w których porady dotyczące bezpieczeństwa związane ze sztuczną inteligencją okazują się błędne, i żadna z nich nie wygląda na błąd, gdy się o nich czyta.
Modele dają fałszywe poczucie bezpieczeństwa, a najwyraźniejszym tego przykładem jest pytanie dotyczące przeniesienia pliku do zaszyfrowanego sejfu, na które średnia ocena wyniosła 53%. W odpowiedziach wyjaśniono, do czego służy sejf, ale prawie nikt nie zwrócił uwagi na to, że skopiowanie pliku do sejfu nie powoduje usunięcia oryginału.
Udzielają porad, których nie da się zastosować na większą skalę, na przykład w odpowiedzi podano imię i nazwisko oraz adres e-mail “wiceprezesa ds. operacji globalnych” i zasugerowano, by skontaktować się z nim bezpośrednio. Inni zalecali organizowanie kampanii piętnujących w mediach społecznościowych, aby wymusić odpowiedź ze strony działu obsługi klienta.
Zalecają oni również rozwiązania, na które nie można sobie pozwolić, więc w przypadku podejrzenia obecności złośliwego oprogramowania w jednym z modeli stwierdzono, że “najbezpieczniejszym rozwiązaniem jest pozbycie się urządzenia”. Jeśli chodzi o prywatność w aplikacjach płatniczych, w innym przypadku zasugerowano “otwarcie nowego konta bankowego w zupełnie innym banku”.
Przekazują Ci odpowiedzialność za przestrzeganie zasad. Jeśli chodzi o omijanie blokad, niektóre modele stanowczo odmówiły, podczas gdy inne wzruszyły ramionami i stwierdziły, że takie działanie “może naruszać warunki korzystania z usługi […] ale to sprawa między tobą a aplikacją”.”
Potrafią czytać w myślach. Zapytane, dlaczego ktoś je zablokował, modelki snuły domysły na temat motywów, a jedna z nich określiła rozwód jako “burzliwy” na podstawie jednego pytania zabezpieczającego – a tego rodzaju rzeczy nie da się już zapomnieć, gdy modelka ci to powie.
Zaostrzają ton wypowiedzi. Modelki odpowiadały na neutralne pytanie dotyczące molestowania, używając takich określeń jak “frustrujące”, “stresujące”, “wyczerpujące”, “absolutnie przerażające i traumatyczne”, a spokojnym użytkownikom radziły zachować “nadmierną czujność” – co jest sprzeczne z zaleceniami podejścia uwzględniającego traumę.
System punktacji – w prostym języku
Sześciu badaczy, z których każdy ma ponad dziesięcioletnie doświadczenie w tej dziedzinie, opracowało listę kontrolną dla każdego pytania. Kryteria pozytywne to elementy, które powinny być obecne; za nie przyznaje się 5, 3, 2 lub 1 punkt. Kryteria negatywne to elementy, których nie może być. Wynik stanowi różnicę między liczbą zdobytych punktów a maksymalną liczbą możliwych do uzyskania punktów.
Ekspert ocenił ręcznie jedną odpowiedź na każde pytanie, a następnie automatyczny system oceniania Gemini 2.5 Pro, ustawiony na poziom trudności 0, ocenił pozostałe odpowiedzi. Projekt prośby czerpie z HealthBench, który pełnił tę samą funkcję w przypadku pytań medycznych. Współczynnik korelacji tego automatycznego systemu oceniania z ocenami przyznawanymi przez ludzi wyniósł ogółem 0,85. Warto zwrócić uwagę na podział poniżej: 0,96 w zakresie wiedzy merytorycznej w porównaniu z 0,78 w zakresie sposobu prezentacji.
Ta luka jest szczera i cieszę się, że ją opublikowali. Fakty można zweryfikować. Tonu – nie.
Zmiany wersji powodują przesunięcie wyniku o jeden do trzech punktów, czasami w dół. Grok 4.20 uzyskał wynik o 3% niższy od Groka 4, a GPT 5.0 radzi sobie lepiej niż GPT 5.3. Claude Opus 4.6 i Claude Sonnet 4.6 różniły się wynikiem o 11 TP3T, więc w tym przypadku inwestycja w większy model praktycznie nic nie daje. Jedynie Qwen odnotował znaczący skok – z 671 TP3T do 831 TP3T – więc nie ma tu powodu do ekscytacji.
Nikt nie optymalizuje rozwiązań pod kątem zaleceń dotyczących bezpieczeństwa AI, ponieważ do tej pory nie istniał żaden punkt odniesienia, w oparciu o który można by przeprowadzić optymalizację. Ma to tę samą lukę, o której pisałem w artykule dotyczącym Wskazówki dotyczące bezpieczeństwa w zakresie sztucznej inteligencji dla agentów – luka, której nikt nie sprawdza.
Cztery kwestie, które warto sprawdzić, zanim zaufasz poradom dotyczącym bezpieczeństwa udzielanym przez sztuczną inteligencję
Nie możesz samodzielnie przeprowadzić oceny według tej matrycy. W ciągu około trzydziestu sekund możesz przeprowadzić cztery testy dowolnej porady dotyczącej bezpieczeństwa AI, które wykryją większość wymienionych powyżej scenariuszy awarii.
Określ rodzaj zagrożenia. Problem może wynikać z działania systemu lub osoby, a jeśli ktoś zna twoje imię, poproś o pomoc inną osobę.
Oceń koszty porażki. Pieniądze, które można odzyskać, to jedno, a lokalizacja, której nie da się już ukryć, to zupełnie inna sprawa.
Sprawdź, czy zadał ci jakieś pytanie. Dobra rada dotycząca bezpieczeństwa w zakresie sztucznej inteligencji w sprawie prześladowania wymaga kontekstu, którego model nie posiada, więc jeśli nie zadał pytania, to po prostu zgadywał.
Należy rozważyć rozwiązanie w stosunku do ryzyka, pamiętając, że “wyrzuć urządzenie” i “załóż konto w innym banku” to rzeczywiste odpowiedzi udzielone przez modele. Gdy porada dotycząca bezpieczeństwa udzielona przez sztuczną inteligencję kosztuje więcej niż przedmiot, który chroni, jest ona błędna, nawet jeśli z technicznego punktu widzenia jest poprawna.
Co z tym zrobić
Jest taki starszy artykuł, do którego ciągle wracam, dotyczący tego, że ChatGPT Health nie rozpoznaje stanów zagrożenia życia. Jeden z cytowanych w nim ekspertów ujął to w ten sposób: “Najbardziej niepokoi mnie fałszywe poczucie bezpieczeństwa, jakie wywołują te systemy”.”
Tutaj kształt jest taki sam.
Oto moja zasada dotycząca porad w zakresie bezpieczeństwa sztucznej inteligencji – a sam korzystam z tych modeli na co dzień. Model LLM sprawdza się dobrze jako wstępna analiza ogólnych pytań. W kategorii oszustw modele uzyskały wynik 88% – najlepszy w całym teście porównawczym – a rozpoznawanie, że wiadomość phishingowa jest właśnie wiadomością phishingową, to coś, co te modele robią naprawdę dobrze.
Model przestaje działać, gdy zagrożeniem jest osoba fizyczna – co obejmuje prześladowanie, nękanie, znęcanie się oraz konto kontrolowane przez kogoś innego. W takich przypadkach model nie zna twojego modelu zagrożeń i nie poprosi o jego podanie. Co dziesiąta odpowiedź będzie błędna w sposób, którego nie da się wykryć od wewnątrz.
Traktuj porady dotyczące bezpieczeństwa związane ze sztuczną inteligencją jak pierwszy szkic napisany przez kogoś, kto nigdy cię nie spotkał. Nigdy nie powierzaj modelowi LLM problemu, w związku z którym ktoś może ucierpieć.
Źródło | https://arxiv.org/abs/2606.24819v1

Dodaj komentarz