Tag: cyberbezpieczeństwo

  • Firma Anthropic uchwyciła cyberatak przeprowadzony przez sztuczną inteligencję od początku do końca

    Firma Anthropic uchwyciła cyberatak przeprowadzony przez sztuczną inteligencję od początku do końca

    Spis treści

    JackPoterz nie napisał własnoręcznie ani jednej linii złośliwego oprogramowania. Nie musiał tego robić. Firma Anthropic opisała właśnie cyberatak przeprowadzony przez sztuczną inteligencję, który obejmował wszystkie etapy – od rozpoznania po wyciek danych – niemal bez żadnej interwencji człowieka przy klawiaturze.

    Operator, którego metody działania nawiązują do grupy Midnight Blizzard, prowadził kampanie phishingowe i kradzieży danych uwierzytelniających, wspierane przez aktywną warstwę dowodzenia i kontroli, skierowane przeciwko ponad 20 celom rządowym i obronnym na Ukrainie i w Europie, a także częściowo na Bliskim Wschodzie i w Azji. Zestaw narzędzi obejmował implanty dla systemu Windows oraz zestaw exploitów dla urządzeń mobilnych, a także narzędzia stworzone w celu kradzieży danych uwierzytelniających z przeglądarek oraz podszywania się pod agencje rządowe w atakach phishingowych. Claude stworzył ten zestaw narzędzi i monitorował jego działanie. Gdy coś budziło podejrzenia, Claude przebudowywał go, korzystając z niestandardowych procesów opartych na sztucznej inteligencji, które operator skonfigurował, a następnie w większości pozostawił bez nadzoru.

    Cyberatak z wykorzystaniem sztucznej inteligencji

    To główny przypadek opisany we wrześniowym raporcie firmy Anthropic z 2026 r. dotyczącym zagrożeń, opracowanym na podstawie ośmiu miesięcy udaremnionych prób nadużyć. Jest to jak dotąd najwyraźniejszy znak, że cyberatak oparty na sztucznej inteligencji przestał być asystentem pisarskim pomagającym ludzkiemu hakerowi, a stał się samym hakerem.

    Łańcuch zabijania działa teraz samodzielnie

    GTG-20006 połączyło rozpoznanie, konfigurację infrastruktury, dostarczanie wiadomości phishingowych, utrzymywanie obecności, sterowanie i kontrolę oraz eksfiltrację danych w jedną pętlę sterowaną przez sztuczną inteligencję, obejmującą wszystkie etapy, które zespoły ds. bezpieczeństwa nauczyły się mapować na Łańcuch rażenia firmy Lockheed Martin. Człowiek pozostawał w kadrze wyłącznie po to, by wybierać cele i analizować uzyskane wyniki.

    Najciekawszym elementem jest tutaj pętla konserwacyjna, działająca w tle samego zestawu narzędzi. Gdy oprogramowanie zabezpieczające wykrywało jeden z implantów, agenci nie czekali, aż człowiek wprowadziłby poprawkę. Przekompilowywali złośliwe oprogramowanie i ponownie testowali je pod kątem wykrywalności. Powtarzali ten proces, aż złośliwe oprogramowanie przeszło niezauważone, a następnie umieszczali je na serwerach jednorazowego użytku w celu przeprowadzenia kolejnej rundy ataków phishingowych i przejęcia DNS. Jeśli pominąć kwestię marki, pozostaje cyberatak oparty na sztucznej inteligencji działający w trybie automatycznym – pełny łańcuch ataku bez udziału człowieka.

    Większość ludzi wciąż wyobraża sobie nieprawidłowy wizerunek napastnika

    Powszechnie przyjęty model mentalny to chatbot tworzący przekonującą wiadomość phishingową. Raport firmy Anthropic opisuje coś bardziej zbliżonego do „koordynatora” – systemu, który przeprowadza rozpoznanie i wykorzystuje luki, a następnie samodzielnie zajmuje się wyciekiem danych w ramach struktury wieloagentowej, przy czym to człowiek wyznacza kierunek działania, zamiast wpisywać polecenia. Ta rozbieżność między tymi dwoma modelami mentalnymi jest właśnie powodem, dla którego większość osób odpowiedzialnych za ochronę przed cyberatakami błędnie oceni kolejny atak cybernetyczny z wykorzystaniem sztucznej inteligencji, z którym będą musiały się zmierzyć.

    Frameworki takie jak PentAGI już oferują gotowe rozwiązania dla każdego, kto ich potrzebuje. Nie trzeba już dysponować budżetem na miarę państwa, by prowadzić łańcuch ataku na skalę państwową. Wystarczy lista celów. Właśnie taką zmianę zasygnalizowano w tym wpisie na blogu w Ataki cybernetyczne wykorzystujące sztuczną inteligencję kilka miesięcy przed opublikowaniem tego raportu, po prostu wszystko przebiegało szybciej niż się spodziewano.

    Luka w umiejętnościach, która kiedyś cię chroniła, zniknęła

    Anthropic nie jest jedyną firmą, która zwraca uwagę na ten trend w zakresie cyberataków z wykorzystaniem sztucznej inteligencji, a Raport firmy Forrester dotyczący zagrożeń w 2026 roku stwierdzono to już w czerwcu. “Podmioty państwowe wykorzystują obecnie sztuczną inteligencję typu agentowego do automatyzacji i skalowania ataków z prędkością przewyższającą możliwości ludzkich obrońców”. W tym samym raporcie stwierdzono również, że “ujawniono, iż podmiot powiązany z Chinami wykorzystywał Claude’a do cyberszpiegostwa”. Dwa niezależne raporty, opublikowane w odstępie sześciu miesięcy i pochodzące od dwóch różnych dostawców, dochodzą do tego samego wniosku.

    Zaawansowanie techniczne było kiedyś dobrym wskaźnikiem tego, z kim miało się do czynienia. Niestandardowy implant w połączeniu z zestawem narzędzi do samonaprawy, działającym w pętli na żywo przeciwko systemowi EDR, oznaczał niegdyś dobrze finansowany i liczny zespół. W studiach przypadków firmy Anthropic pojawia się obecnie przykład haktywisty, który dysponował jedynie skradzionymi kluczami API, a mimo to przeprowadził operację tej samej klasy. Zaawansowanie techniczne przestało być wskaźnikiem skali działania lub pochodzenia ataku.

    Co oznacza termin “samonaprawiające się złośliwe oprogramowanie”

    Jeśli pominąć marketingowy bełkot dostawców, sprawa jest prosta. Agent obserwuje, czy Twoje narzędzia zabezpieczające wykrywają złośliwe oprogramowanie. Jeśli tak, modyfikuje kod i ponownie go pakuje. Następnie ponownie testuje nową wersję, w pętli, bez udziału człowieka. Działa to jak zamek, który zmienia swój kształt za każdym razem, gdy wycinasz nowy klucz. To właśnie mechaniczny rdzeń każdego cyberataku opartego na sztucznej inteligencji, działającego obecnie w trybie automatycznym.

    Statyczne sygnatury dawały obrońcom kilka dni przewagi między wykryciem narzędzia a jego odtworzeniem przez atakującego. Ta przewaga maleje niemal do zera, gdy odtworzenie przebiega automatycznie, równolegle z resztą kampanii.

    Co z tym zrobić?

    Firma Anthropic udaremniła ten cyberatak przeprowadzony przez sztuczną inteligencję i opublikowała studium przypadku. Poinformowano o tym również partnerów i władze. Tak właśnie działa ten system i warto o tym pamiętać, zanim stanie się to powodem do ogólnej nieufności wobec dostawców rozwiązań opartych na sztucznej inteligencji.

    Ta lekcja dotyczy twoich własnych założeń, zaczynając od tego, że twój plan wykrywania wciąż opiera się na tym, że uda się wykryć kolejny wariant za kilka dni. To założenie jest już nieaktualne, niezależnie od tego, jak wygląda samo złośliwe oprogramowanie. Za kontem sondującym waszą sieć może kryć się agent, który nigdy nie śpi i nigdy nie nudzi się przepisywaniem tej samej funkcji dwadzieścia razy, bez względu na to, jak prymitywna się wydaje, o ile tylko w końcu uda mu się przedrzeć. Kolejny cyberatak oparty na sztucznej inteligencji, z którym się zmierzycie, prawdopodobnie nie ogłosi się jako taki.

    Źródło | https://www.anthropic.com/threat-intelligence-report-september-2026


    Chcesz więcej? Subskrybuj The Dossier

    Co tydzień w skrzynce odbiorczej:

    📡 KANAŁ WYWIADOWCZY - 3-5 wyselekcjonowanych linków: [Badania] [Polityka] [Narzędzia] [Incydenty]
    💡 JEDNA RADA - Jedna praktyczna wskazówka dotycząca AI/cyberbezpieczeństwa, z której możesz skorzystać już dziś

  • Nikt nie zapoznał się z rozmowami, na podstawie których zebrano te dane dotyczące korzystania z sztucznej inteligencji

    Nikt nie zapoznał się z rozmowami, na podstawie których zebrano te dane dotyczące korzystania z sztucznej inteligencji

    Spis treści

    Tej wiosny trzy grupy badawcze przeanalizowały około 250 000 rzeczywistych rozmów prowadzonych przez Claude’a w kwietniu i maju 2026 roku. Były to dwa laboratoria uniwersyteckie oraz jedna organizacja non-profit, z których wszystkie zajmowały się danymi dotyczącymi wykorzystania sztucznej inteligencji, pozyskanymi bezpośrednio z rzeczywistego ruchu produkcyjnego.

    Żadne z nich nie przeczytało ani jednej rozmowy.

    To właśnie ta konstrukcja działa zgodnie z zamierzeniami i właśnie o tym nikt nie wspomina.

    Co wydała firma Anthropic

    Narzędzie to nosi nazwę „Anthropic Insights”, a wcześniej nazywało się Clio. Badacz wpisuje jedno pytanie, a Claude porównuje je z każdą rozmową w próbie. Odpowiedzi są sortowane według kategorii, a badacz widzi nazwy kategorii wraz z odsetkiem rozmów w każdej z nich. To całość wyników – bez transkrypcji i bez surowego tekstu. Przykładem takiego pytania podanym przez samą firmę Anthropic jest: “O jaki rodzaj wskazówek prosi ta osoba?”.”

    Dane dotyczące korzystania z AI nigdy nie opuszczają firmy Anthropic w postaci surowej. Przekazywane są jedynie dane liczbowe.

    Firma Anthropic twierdzi, że po raz pierwszy zewnętrzni badacze przeprowadzili publiczne, niezależne badania dotyczące danych dotyczących wykorzystania sztucznej inteligencji przez samą firmę zajmującą się sztuczną inteligencją. Twierdzenie to jest słuszne.

    Dane dotyczące wykorzystania sztucznej inteligencji

    Umowy są również solidne – lepsze, niż się spodziewałem po laboratorium publikującym własny raport. Prawa do przeglądu obejmowały prywatność użytkowników oraz wszystko, co mogłoby pomóc użytkownikom w obejściu zasad korzystania z usługi. Obejmowały one również poufne informacje samej firmy Anthropic oraz dokładność badań. Umowy przewidują, że partnerzy mogą publikować wyniki badań “nawet jeśli są one niekorzystne dla firmy Anthropic”. Imperial College London przeprowadził niezależny audyt prywatności. The dane zbiorcze jest już na HuggingFace, więc to naprawdę istnieje.

    Gwarancja prywatności stanowi lukę audytową

    Firma Anthropic sama to napisała, co jest jej na pochwałę, bo mogła to pominąć.

    “Ponieważ opieramy się na ocenie Claude’a, narzędzie to jest wrażliwe na sformułowanie pytania; źle sformułowane pytanie może spowodować, że rozmowy zostaną zaklasyfikowane do kategorii, które nie oddają ich prawdziwego charakteru”.”

    Potem pojawia się zdanie, które powinno było stać się nagłówkiem.

    “Ponieważ nikt nie ma wglądu w treść rozmów, trudno jest wykryć te błędy”.”

    Przeczytaj to dwa razy, bo opisana tu pętla jest zamknięta. Narzędziem dokonującym pomiaru jest model językowy, a przedmiotem pomiaru jest model językowy. Mechanizm zabezpieczający, który chroni użytkowników, jest tym samym mechanizmem, który uniemożliwia komukolwiek sprawdzenie, czy dane dotyczące wykorzystania sztucznej inteligencji mają rzeczywiście to znaczenie, jakie przypisują im etykiety kategorii.

    Jeśli opierasz się na ocenie modelki, powinieneś mieć pewne założenie wstępne. Kiedy przeglądałem siedem modeli o dowolnej wielkości, przyporządkowujących zgłoszenia zagrożeń do klasyfikacji ATT&CK, pomylili się cztery razy na pięć.

    Wewnątrz firmy Anthropic rozwiązuje ten problem poprzez wielokrotne przerabianie pytania przez wiele tygodni. Partnerzy zewnętrzni nie mogliby tego zrobić, ponieważ każdy nowy zbiór danych wymagałby kolejnej weryfikacji pod kątem ochrony prywatności, a badanie nigdy by się nie zakończyło.

    Dlaczego środowisko testowe nie odpowiada środowisku produkcyjnemu

    Rozwiązaniem tymczasowym było zlecenie naukowcom dostosowania pytań w serwisie WildChat – publicznym zbiorze danych zawierającym rozmowy między ludźmi a sztuczną inteligencją, gdzie mogli zapoznać się z tekstem źródłowym i sprawdzić, czy kategorie mają sens. Następnie wykorzystali dostosowane pytania i skierowali je do rzeczywistego ruchu w systemie Claude.

    Niektóre pytania, które sprawdziły się w WildChat, po zastosowaniu w rzeczywistych rozmowach z Claude’em generowały mylące kategorie, ponieważ WildChat ma charakter swobodny i kreatywny, a ruch w Claude’u – nie. Dwie grupy danych dotyczących wykorzystania sztucznej inteligencji, dwie różne populacje.

    Każdy, kto kiedykolwiek tworzył regułę wykrywania, zna ten schemat. Reguła działa bez zarzutu na korpusie testowym, a potem, już w ciągu pierwszej godziny po pojawieniu się prawdziwego ruchu, zasypuje cię fałszywymi alarmami. To ta sama wada, tylko w innej dziedzinie.

    WildChat ma również swoje własne problemy, które omówiłem w Dossierze 33 na podstawie skanowania przeprowadzonego przez Truffle Security obejmującego 7,6 petabajtów danych szkoleniowych HuggingFace. Jeden klucz Infura, wklejony jednokrotnie w rozmowie w ChatGPT, został przechwycony przez WildChat i skopiowany do 1 131 publicznych zbiorów danych oraz 10 162 lokalizacji plików.

    A więc dane dotyczące wykorzystania sztucznej inteligencji, do których masz dostęp, to ta partia, w której błędy są nieodwracalne. Dane produkcyjne, w których błędy są korygowane, to partia, do której nikt nie ma dostępu. To jedna transakcja, przeprowadzona dwukrotnie.

    Co oznacza podawanie danych dotyczących wykorzystania sztucznej inteligencji

    Same wyniki są warte uwagi. Laboratorium SALT Uniwersytetu Stanforda ustaliło, że ponad połowa rozmów z Claude’em dotyczyła powierzenia przez ludzi sztucznej inteligencji zadań o istotnym znaczeniu, a w prawie trzech czwartych z nich to ludzie wyznaczali kierunek działań, podczas gdy Claude pełnił rolę pomocniczą.

    Zanim umieścisz to w prezentacji dla zarządu, upewnij się, z czym masz do czynienia. Jest to ocena Claude’a dotycząca tego, co uznaje się za “istotne”, wyrażona w procentach. Naukowiec, który opublikował te wyniki, nie może cofnąć się w czasie i sprawdzić ani jednego przypadku. Firma Anthropic prowadzi również badania, w których ludzie sami udzielają odpowiedzi, na przykład badanie przeprowadzone wśród 81 000 osób, o którym pisałem wcześniej, a model wyznaczający intencje na podstawie transkrypcji to zupełnie inne narzędzie. Wynik ten nadal może być prawdziwy. Jest to coś zupełnie innego niż pomiar, a różnica ta nabiera znaczenia w momencie, gdy ktoś opracowuje na tej podstawie politykę.

    W danych dotyczących korzystania z tej sztucznej inteligencji zastosowano jeszcze jeden filtr. Firma Anthropic usunęła lub zmodyfikowała wszystkie kategorie opisujące metody, jakie użytkownicy znaleźli w celu obejścia zabezpieczeń. Kategorie opisujące próby podejmowane przez użytkowników pozostały bez zmian. W każdym badaniu liczba kategorii i rozmów nie przekraczała 5%, a informacje te wskazały badaczom, które klastry zostały uwzględnione i dlaczego. To uczciwe postępowanie. Nadal jednak to laboratorium edytuje zbiór danych, zanim trafi on do audytora.

    Cztery pytania, które warto sobie zadać przed powołaniem się na badanie dotyczące wykorzystania sztucznej inteligencji

    Skorzystaj z nich. Sprawdzają się w każdym badaniu użytkowania, które do ciebie trafi, w tym w tym pilotażowym.

    1. Dowiedz się, kto zapoznał się z dokumentami źródłowymi. Jeśli zapoznał się z nimi model, powiedz to na głos, podając numer.

    2. Sprawdź dokładne brzmienie pytania, na które odpowiedział model. To właśnie sformułowanie pytania określa kategorie, a kategorie te stanowią wynik.

    3. Zapytaj, co zostało usunięte przed publikacją i czy ktoś ci o tym poinformował. Firma Anthropic poinformowała swoich partnerów, które klastry zostały zmienione, czego większość firm by nie zrobiła.

    4. Sprawdź, czy inny zespół byłby w stanie odtworzyć ten wynik na tych samych danych. W przypadku dzisiejszego rzeczywistego ruchu laboratoryjnego nikomu się to nie udaje.

    Część, która przetrwa ten odcinek pilotażowy

    Zobaczmy, jak sytuacja się rozwinie. Organy regulacyjne będą domagać się właśnie takiego dostępu do danych dotyczących wykorzystania sztucznej inteligencji, a niezależnie od tego, jaki model zostanie tutaj ustandaryzowany, stanie się on wzorem dla wszystkich przyszłych audytów dotyczących sztucznej inteligencji.

    Jeśli ten szablon sugeruje, że audytor nigdy nie zapoznaje się z materiałami dowodowymi pierwszego rzędu, to “niezależny audyt” zaczyna oznaczać “niezależne pytanie, odpowiedź laboratorium”. Firma Anthropic posunęła się dalej niż ktokolwiek inny, więc jej projekt pilotażowy wyznacza standard.

    I tak wolałbym to od nic, bez wahania. Reżyseria jest po prostu świetna.

    Gdybym był badaczem, wypełniłbym ten formularz. Nie traktowałbym jednak tych wartości procentowych tak samo, jak własnego opisu projektu.

    Zanim powtórzysz jakąś liczbę dotyczącą danych o wykorzystaniu sztucznej inteligencji, dowiedz się, kto analizował źródłowe dane. Model, który przeprowadza taką analizę, dostarcza ci jedynie hipotezę. Cytuj ją jako hipotezę.

    Źródło | https://www.anthropic.com/research/enabling-independent-research


    Chcesz więcej? Subskrybuj The Dossier

    Co tydzień w skrzynce odbiorczej:

    📡 KANAŁ WYWIADOWCZY - 3-5 wyselekcjonowanych linków: [Badania] [Polityka] [Narzędzia] [Incydenty]
    💡 JEDNA RADA - Jedna praktyczna wskazówka dotycząca AI/cyberbezpieczeństwa, z której możesz skorzystać już dziś

  • Ocena 82% nie jest oceną pozytywną w przypadku zaleceń dotyczących bezpieczeństwa sztucznej inteligencji

    Ocena 82% nie jest oceną pozytywną w przypadku zaleceń dotyczących bezpieczeństwa sztucznej inteligencji

    Spis treści

    Ktoś pyta chatbota, jak ukryć swoją lokalizację przed agresywnym byłym partnerem. Sztuczna inteligencja udziela porady dotyczącej bezpieczeństwa, sugerując, by udać się do sklepu w przebraniu, ponieważ “osoby stosujące przemoc rzadko odwiedzają sklepy w południe”. Odpowiedź ta pochodzi z najnowocześniejszego modelu i została opisana w nowym artykule naukowym opracowanym przez University College London oraz Google.

    To właśnie to zdanie zapadło mi w pamięć po przeczytaniu 36 stron.

    Artykuł nosi tytuł „HelpBench”, a jego zakres autorzy określają skrótem PSS – kategorią obejmującą wszystko, od zhakowanego konta po przypadki prześladowania. Artykuł stawia pytanie, jak trafna jest odpowiedź, gdy zwykła osoba zgłasza jeden z tych problemów do modelu LLM. Innymi słowy, bada on, na ile wiarygodne są porady dotyczące bezpieczeństwa udzielane przez sztuczną inteligencję w sytuacjach, w których stawka jest naprawdę wysoka.

    Ogólny wynik dotyczący porad w zakresie bezpieczeństwa AI wygląda dobrze – średnia dla 18 modeli wyniosła 82%. Jednak gdy przejdziemy o jeden poziom niżej, sytuacja już nie wygląda tak dobrze.

    Co mierzy HelpBench

    Zespół wyodrębnił 450 pytań z zbioru danych obejmującego trzy miliony postów na Reddicie. Wszystkie te wpisy powstały w latach 2021–2024. Żadne z nich nie jest generowane komputerowo. Są to prawdziwi ludzie borykający się z prawdziwym problemem, którzy zwracają się z pytaniami do nieznajomych w internecie.

    Dziewięć tematów, z których każdy zawiera 50 pytań, dotyczących kont, naruszeń bezpieczeństwa, narzędzi do moderacji, oszustw, narzędzi zabezpieczających, nękania, narzędzi ochrony prywatności, działań platformy oraz kwestii związanych z danymi.

    Każde pytanie zostało przeredagowane tak, aby nie można było zidentyfikować autora oryginalnego wpisu, a następnie sprawdzone ręcznie. Współczynnik podobieństwa cosinusowego między tekstem oryginalnym a przeredagowanym wyniósł 0,56, przy pokryciu 3-gramowym wynoszącym 0,04. Żaden model nie jest w stanie odtworzyć wątku na Reddicie na podstawie dopasowania wzorców.

    Wskazówki dotyczące bezpieczeństwa w zakresie sztucznej inteligencji

    Pięć przebiegów na każde pytanie w 18 modelach dało łącznie 40 500 odpowiedzi, co stanowi największą dotychczas opublikowaną próbę oceniającą jakość porad dotyczących bezpieczeństwa generowanych przez sztuczną inteligencję.

    Średnia to błędna wartość

    82% wydaje się być solidną oceną „B” w zakresie porad dotyczących bezpieczeństwa sztucznej inteligencji. Tak jednak nie jest, ponieważ punktacja nie jest rozłożona równomiernie.

    W 14% wszystkich odpowiedzi uzyskano wynik poniżej 65%, a w przypadku 7% pytań każdy z 18 modeli uzyskał wynik poniżej 65%. Każdy model z tego zestawu ma tę samą lukę.

    Sama średnia wyników porównawczych praktycznie nic nie mówi. Automatyczne mapowanie ATT&CK osiąga współczynnik mikro F1 na poziomie 0,22 i zawodzi na całej linii, podczas gdy HelpBench zawodzi w sposób, którego nie widać na podstawie liczby podanej w nagłówku.

    W tym miejscu wkracza myślenie o bezpieczeństwie, ponieważ ryzyko to iloczyn skutku i prawdopodobieństwa, a nigdy samo prawdopodobieństwo. Wskaźnik niepowodzeń na poziomie 14% w przypadku zapytania “jak włączyć uwierzytelnianie dwuskładnikowe” jest irytujący. Ten sam wskaźnik w przypadku zapytania “czy mój były śledzi mój telefon” to zupełnie inna sprawa.

    Olejnik podkreśla to w książce „Filozofia cyberbezpieczeństwa”. Model zagrożeń zależy od tego, kim jesteś. Zwykły użytkownik narażony jest na phishing i kradzież danych uwierzytelniających, podczas gdy dziennikarz lub osoba uciekająca z toksycznego związku ma do czynienia z ukierunkowanym przeciwnikiem, który ma już fizyczny dostęp.

    Oboje wpisują tekst w to samo pole, a model odpowiada obojgu w ten sam sposób.

    W artykule stwierdzono właśnie to w odniesieniu do usuwania oprogramowania szpiegującego – większość modeli podawała jasne instrukcje techniczne, nie wspominając jednak, że nagłe usunięcie programu może stać się czynnikiem wywołującym eskalację przemocy fizycznej. Narzędzie zniknęło, a sprawca tego zauważa. Osoba ta znajduje się teraz z nim w jednym pomieszczeniu. Istnieje cała koalicja dostawców rozwiązań z zakresu bezpieczeństwa oraz organizacji wspierających ofiary oparte na właśnie tej sekwencji, a żaden z jej kontekstów nie doprowadził do odpowiedzi.

    To nie jest teoria. “Mężczyźni kupują narzędzia hakerskie, by wykorzystać je przeciwko swoim żonom i przyjaciółkom” – to prawdziwy nagłówek opisujący rzeczywisty rynek.

    Sześć sytuacji, w których porada okazuje się nieudana

    Naukowcy sklasyfikowali sytuacje, w których porady dotyczące bezpieczeństwa związane ze sztuczną inteligencją okazują się błędne, i żadna z nich nie wygląda na błąd, gdy się o nich czyta.

    Modele dają fałszywe poczucie bezpieczeństwa, a najwyraźniejszym tego przykładem jest pytanie dotyczące przeniesienia pliku do zaszyfrowanego sejfu, na które średnia ocena wyniosła 53%. W odpowiedziach wyjaśniono, do czego służy sejf, ale prawie nikt nie zwrócił uwagi na to, że skopiowanie pliku do sejfu nie powoduje usunięcia oryginału.

    Udzielają porad, których nie da się zastosować na większą skalę, na przykład w odpowiedzi podano imię i nazwisko oraz adres e-mail “wiceprezesa ds. operacji globalnych” i zasugerowano, by skontaktować się z nim bezpośrednio. Inni zalecali organizowanie kampanii piętnujących w mediach społecznościowych, aby wymusić odpowiedź ze strony działu obsługi klienta.

    Zalecają oni również rozwiązania, na które nie można sobie pozwolić, więc w przypadku podejrzenia obecności złośliwego oprogramowania w jednym z modeli stwierdzono, że “najbezpieczniejszym rozwiązaniem jest pozbycie się urządzenia”. Jeśli chodzi o prywatność w aplikacjach płatniczych, w innym przypadku zasugerowano “otwarcie nowego konta bankowego w zupełnie innym banku”.

    Przekazują Ci odpowiedzialność za przestrzeganie zasad. Jeśli chodzi o omijanie blokad, niektóre modele stanowczo odmówiły, podczas gdy inne wzruszyły ramionami i stwierdziły, że takie działanie “może naruszać warunki korzystania z usługi […] ale to sprawa między tobą a aplikacją”.”

    Potrafią czytać w myślach. Zapytane, dlaczego ktoś je zablokował, modelki snuły domysły na temat motywów, a jedna z nich określiła rozwód jako “burzliwy” na podstawie jednego pytania zabezpieczającego – a tego rodzaju rzeczy nie da się już zapomnieć, gdy modelka ci to powie.

    Zaostrzają ton wypowiedzi. Modelki odpowiadały na neutralne pytanie dotyczące molestowania, używając takich określeń jak “frustrujące”, “stresujące”, “wyczerpujące”, “absolutnie przerażające i traumatyczne”, a spokojnym użytkownikom radziły zachować “nadmierną czujność” – co jest sprzeczne z zaleceniami podejścia uwzględniającego traumę.

    System punktacji – w prostym języku

    Sześciu badaczy, z których każdy ma ponad dziesięcioletnie doświadczenie w tej dziedzinie, opracowało listę kontrolną dla każdego pytania. Kryteria pozytywne to elementy, które powinny być obecne; za nie przyznaje się 5, 3, 2 lub 1 punkt. Kryteria negatywne to elementy, których nie może być. Wynik stanowi różnicę między liczbą zdobytych punktów a maksymalną liczbą możliwych do uzyskania punktów.

    Ekspert ocenił ręcznie jedną odpowiedź na każde pytanie, a następnie automatyczny system oceniania Gemini 2.5 Pro, ustawiony na poziom trudności 0, ocenił pozostałe odpowiedzi. Projekt prośby czerpie z HealthBench, który pełnił tę samą funkcję w przypadku pytań medycznych. Współczynnik korelacji tego automatycznego systemu oceniania z ocenami przyznawanymi przez ludzi wyniósł ogółem 0,85. Warto zwrócić uwagę na podział poniżej: 0,96 w zakresie wiedzy merytorycznej w porównaniu z 0,78 w zakresie sposobu prezentacji.

    Ta luka jest szczera i cieszę się, że ją opublikowali. Fakty można zweryfikować. Tonu – nie.

    Zmiany wersji powodują przesunięcie wyniku o jeden do trzech punktów, czasami w dół. Grok 4.20 uzyskał wynik o 3% niższy od Groka 4, a GPT 5.0 radzi sobie lepiej niż GPT 5.3. Claude Opus 4.6 i Claude Sonnet 4.6 różniły się wynikiem o 11 TP3T, więc w tym przypadku inwestycja w większy model praktycznie nic nie daje. Jedynie Qwen odnotował znaczący skok – z 671 TP3T do 831 TP3T – więc nie ma tu powodu do ekscytacji.

    Nikt nie optymalizuje rozwiązań pod kątem zaleceń dotyczących bezpieczeństwa AI, ponieważ do tej pory nie istniał żaden punkt odniesienia, w oparciu o który można by przeprowadzić optymalizację. Ma to tę samą lukę, o której pisałem w artykule dotyczącym Wskazówki dotyczące bezpieczeństwa w zakresie sztucznej inteligencji dla agentów – luka, której nikt nie sprawdza.

    Cztery kwestie, które warto sprawdzić, zanim zaufasz poradom dotyczącym bezpieczeństwa udzielanym przez sztuczną inteligencję

    Nie możesz samodzielnie przeprowadzić oceny według tej matrycy. W ciągu około trzydziestu sekund możesz przeprowadzić cztery testy dowolnej porady dotyczącej bezpieczeństwa AI, które wykryją większość wymienionych powyżej scenariuszy awarii.

    Określ rodzaj zagrożenia. Problem może wynikać z działania systemu lub osoby, a jeśli ktoś zna twoje imię, poproś o pomoc inną osobę.

    Oceń koszty porażki. Pieniądze, które można odzyskać, to jedno, a lokalizacja, której nie da się już ukryć, to zupełnie inna sprawa.

    Sprawdź, czy zadał ci jakieś pytanie. Dobra rada dotycząca bezpieczeństwa w zakresie sztucznej inteligencji w sprawie prześladowania wymaga kontekstu, którego model nie posiada, więc jeśli nie zadał pytania, to po prostu zgadywał.

    Należy rozważyć rozwiązanie w stosunku do ryzyka, pamiętając, że “wyrzuć urządzenie” i “załóż konto w innym banku” to rzeczywiste odpowiedzi udzielone przez modele. Gdy porada dotycząca bezpieczeństwa udzielona przez sztuczną inteligencję kosztuje więcej niż przedmiot, który chroni, jest ona błędna, nawet jeśli z technicznego punktu widzenia jest poprawna.

    Co z tym zrobić

    Jest taki starszy artykuł, do którego ciągle wracam, dotyczący tego, że ChatGPT Health nie rozpoznaje stanów zagrożenia życia. Jeden z cytowanych w nim ekspertów ujął to w ten sposób: “Najbardziej niepokoi mnie fałszywe poczucie bezpieczeństwa, jakie wywołują te systemy”.”

    Tutaj kształt jest taki sam.

    Oto moja zasada dotycząca porad w zakresie bezpieczeństwa sztucznej inteligencji – a sam korzystam z tych modeli na co dzień. Model LLM sprawdza się dobrze jako wstępna analiza ogólnych pytań. W kategorii oszustw modele uzyskały wynik 88% – najlepszy w całym teście porównawczym – a rozpoznawanie, że wiadomość phishingowa jest właśnie wiadomością phishingową, to coś, co te modele robią naprawdę dobrze.

    Model przestaje działać, gdy zagrożeniem jest osoba fizyczna – co obejmuje prześladowanie, nękanie, znęcanie się oraz konto kontrolowane przez kogoś innego. W takich przypadkach model nie zna twojego modelu zagrożeń i nie poprosi o jego podanie. Co dziesiąta odpowiedź będzie błędna w sposób, którego nie da się wykryć od wewnątrz.

    Traktuj porady dotyczące bezpieczeństwa związane ze sztuczną inteligencją jak pierwszy szkic napisany przez kogoś, kto nigdy cię nie spotkał. Nigdy nie powierzaj modelowi LLM problemu, w związku z którym ktoś może ucierpieć.

    Źródło | https://arxiv.org/abs/2606.24819v1


    Chcesz więcej? Subskrybuj The Dossier

    Co tydzień w skrzynce odbiorczej:

    📡 KANAŁ WYWIADOWCZY - 3-5 wyselekcjonowanych linków: [Badania] [Polityka] [Narzędzia] [Incydenty]
    💡 JEDNA RADA - Jedna praktyczna wskazówka dotycząca AI/cyberbezpieczeństwa, z której możesz skorzystać już dziś

  • Shadow AI zyskuje na popularności w niszy, którą właśnie zbadała firma Gallup

    Shadow AI zyskuje na popularności w niszy, którą właśnie zbadała firma Gallup

    Spis treści

    Zapytaj pracownika w Stanach Zjednoczonych, czy jego pracodawca wdrożył sztuczną inteligencję. Znaczna część z nich nie potrafi udzielić odpowiedzi, a właśnie w takim zamieszaniu rozwija się „ukryta sztuczna inteligencja”.

    Z tego powodu firma Gallup zmieniła sformułowanie pytania. W uwadze metodologicznej napisano: “Począwszy od trzeciego kwartału 2025 r. firma Gallup dodała do tego pytania opcję ‘nie wiem’, aby odzwierciedlić niepewność związaną z wdrażaniem sztucznej inteligencji”. Wyniki od trzeciego kwartału 2025 r. nie są już bezpośrednio porównywalne z wcześniejszymi pomiarami.

    Firma zajmująca się sondażami zerwała własną serię czasową, ponieważ zbyt wiele osób nie miało pojęcia, co się dzieje wewnątrz budynku, w którym pracują.

    Druga liczba, o której nikt nie wspomina

    Według danych z maja 2026 r. 47% pracowników w Stanach Zjednoczonych twierdzi, że ich organizacja wdrożyła sztuczną inteligencję. Tylko 25% twierdzi, że organizacja przedstawiła jasny plan.

    W każdym nagłówku pojawia się pierwsza liczba, ale to ta druga stanowi sedno artykułu.

    Pomiędzy stwierdzeniami “mamy to” a “ktoś mi powiedział, jak z tego korzystać” istnieje luka, a w tej luce znajdują się umowy, dokumentacja medyczna pacjentów, projekty ofert, kod źródłowy – cokolwiek właśnie dzisiaj wklejają Twoi pracownicy.

    Shadow AI to domyślny stan tej luki.

    shadow AI

    Adopcja to błędny argument

    Od dawna toczy się spór na temat tego, ile osób korzysta ze sztucznej inteligencji. Gabriel Weinberg Przedstawiciel serwisu DuckDuckGo podsumował w czerwcu 2026 r. nastawienie sceptyczne następująco: “jedna trzecia aktywnie korzysta ze sztucznej inteligencji, jedna trzecia korzysta z niej sporadycznie, a jedna trzecia nigdy z niej nie korzysta”. Powołuje się on na dane telemetryczne firmy Microsoft, według których “ponad 30 procent ludności w wieku produkcyjnym w Stanach Zjednoczonych korzysta ze sztucznej inteligencji, co stanowi wzrost o 3 punkty procentowe w porównaniu z końcem 2025 roku”.

    Dane firmy Gallup dotyczące miejsca pracy wskazują na wyższe wyniki. 15% pracowników w USA korzysta z AI codziennie. 30% korzysta z niej co najmniej raz w tygodniu, a 52% korzysta z niej przynajmniej kilka razy w roku.

    Wybierzcie sobie dowolną stronę – to nie ma żadnego wpływu na moją pracę.

    Niezależnie od tego, czy podniesie się, czy obniży liczbę użytkowników, model 25%, który ma jasno określony plan, pozostaje na swoim miejscu. Ta walka odwraca uwagę od jedynego istotnego pytania, a mianowicie: kto napisał regulamin i kto go przeczytał.

    Shadow AI to problem związany z poufnością, w którym nie ma atakującego

    Odejmij słownictwo, a zobaczysz, że to właśnie wszystko.

    Żadnych wiadomości phishingowych, żadnych exploitów, żadnych systemów typu „command and control” – nic, co mogłoby wywołać alarm. Pracownik otwiera kartę przeglądarki i wkleja dokument klienta do chatbota, aby uzyskać podsumowanie. Dane opuszczają organizację. Większość zakupionych przez Państwa rozwiązań zakłada, że ktoś próbuje się włamać. Shadow AI wychodzi frontowymi drzwiami w godzinach pracy, kierowana przez ludzi, którzy po prostu chcą szybciej zakończyć pracę.

    OWASP prowadzi wpis dotyczący ujawniania informacji wrażliwych w swoim 10 najlepszych zastosowań dużych modeli językowych, a niemal wszystkie te wskazówki dotyczą aplikacji stworzonej przez Ciebie. Zakładka, którą Twój zespół sprzedaży otworzył dziś rano, nie jest niczyją aplikacją.

    Scott Brinker opisał ten zjawisko już w 2013 roku i nazwał je „prawem Marteca”. Technologia zmienia się wykładniczo, a organizacje – logarytmicznie. Twoi pracownicy opanowali sztuczną inteligencję w jedno popołudnie, a proces aktualizacji dokumentacji przebiega w tempie komisji.

    Dane Gallupa dotyczące menedżerów pokazują to samo z innej perspektywy. 36% respondentów zdecydowanie zgadza się, że ich menedżer wspiera zespół w korzystaniu ze sztucznej inteligencji. Tam, gdzie takie wsparcie istnieje, pracownicy są 1,7 razy bardziej skłonni do korzystania ze sztucznej inteligencji co najmniej raz w tygodniu oraz 8,7 razy bardziej skłonni do zgłaszania transformacyjnych zmian w sposobie pracy. Zachęta rozprzestrzenia się poprzez rozmowę, a zasady – poprzez dokumenty. „Shadow AI” wybiera szybszą drogę.

    Jak wygląda „Shadow AI” we wtorek

    Nikt nie siada i nie podejmuje decyzji o zastosowaniu sztucznej inteligencji typu „shadow”. Objawia się to drobnymi, rozsądnymi posunięciami.

    Przedstawiciel handlowy wkleja podpisaną umowę do chatbota, aby wyodrębnić z niej daty odnowienia. Asystentka z działu kadr wrzuca arkusz kalkulacyjny z wynagrodzeniami do chatbota, aby zmienić format kolumn. Programista wysyła ślad stosu zawierający ciąg połączenia z serwerem produkcyjnym do konta w ramach bezpłatnego pakietu. Recepcjonistka w przychodni przeredagowuje skierowanie, w którym nadal widnieje nazwisko pacjenta.

    Żadna z tych osób nie jest nieostrożna. Wszystkim powiedziano, że sztuczna inteligencja pozwala im pracować szybciej, ale nikomu nie wyjaśniono, gdzie przebiega granica.

    Usunięcie nazwy klienta przed wklejeniem również nie sprawia, że tekst staje się danymi anonimowymi, a zapoznałem się z wynikami badań na ten temat w Wyciek prywatności ChatGPT.

    Każda z tych czynności pozostaje niewidoczna dla zespołu ds. bezpieczeństwa, ponieważ nie doszło do żadnego naruszenia bezpieczeństwa i nie wygenerowano żadnego alertu.

    Niskie liczby nie oznaczają bezpieczeństwa

    W przypadku codziennego użytkowania wskaźnik wynosi 42% w branży technologicznej, 27% w branży finansowej, 22% w branży usług profesjonalnych oraz od 9 do 15% we wszystkich pozostałych branżach.

    Proszę uważnie zapoznać się z dolnym przedziałem, ponieważ kancelaria prawna lub poradnia znajdująca się w tym najniższym przedziale nie ma lepszej sytuacji. Jest to miejsce, w którym mniejsza grupa osób zajmuje się tym samym, ale ma do czynienia z materiałami o znacznie większej wrażliwości, a przy tym istnieje mniejsze prawdopodobieństwo, że ktokolwiek z działu IT kiedykolwiek się z nimi zapoznał. Niskie wykorzystanie kryje w sobie „ukrytą sztuczną inteligencję”.

    65% pracowników w organizacjach wdrażających sztuczną inteligencję, którzy zgłaszają pozytywny wpływ na wydajność, również nie kłamią. To działa i właśnie dlatego nikt nie zamierza przestać, nawet jeśli się ich o to poprosi. Zakaz sprawia, że „cieniowa sztuczna inteligencja” staje się jeszcze mniej widoczna.

    Jedna strona przed dokonaniem zakupu

    Nie zaczynaj od narzędzia. Zacznij od jednej strony, która odpowiada na cztery pytania.

    1. Które kategorie danych nigdy nie są wprowadzane do modelu zewnętrznego?.
    2. Jakie narzędzia są dopuszczone do użytku – lista według nazw.
    3. Do kogo pracownik zwraca się, gdy odpowiedź nie jest oczywista.
    4. Co się dzieje, gdy coś już się wydarzyło, i kto dowiaduje się o tym jako pierwszy?.

    Strona ta nie dotyczy środowiska podlegającego regulacjom ani nie zastępuje umowy z dostawcą. Przedstawia ona aktualne wycieki.

    Szablon do edycji, który służy do tego celu, przechowuję w moim kalkulator ryzyka związanego z sztuczną inteligencją typu „shadow”, dzięki czemu nie musisz zaczynać od pustego pliku.

    Następnie zajmij się tą nudną częścią i wyślij to wszystkim, wskazując jedną osobę jako właściciela. Zasada, której nikt nie potrafi znaleźć, działa tak samo jak brak jakiejkolwiek zasady, i właśnie w tym momencie „shadow AI” zaczyna od nowa. Nie jest to skomplikowane zadanie i nie wymaga zatrudniania konsultanta.

    Jedna strona wystarczy, by pokonać cykl zamówień. Jeśli nie potrafisz tego napisać, to nie masz programu opartego na sztucznej inteligencji – masz tylko 47% i nadzieję.

    Pamiętaj więc: jeśli masz napisać na tej stronie tylko jedną linijkę, niech to będzie właśnie ta. Nigdy nie wpisuj do modelu LLM niczego, czego nie wysłałbyś w e-mailu do nieznajomego.

    Źródło: https://www.gallup.com/699797/indicator-artificial-intelligence.aspx


    Chcesz więcej? Subskrybuj The Dossier

    Co tydzień w skrzynce odbiorczej:

    📡 KANAŁ WYWIADOWCZY - 3-5 wyselekcjonowanych linków: [Badania] [Polityka] [Narzędzia] [Incydenty]
    💡 JEDNA RADA - Jedna praktyczna wskazówka dotycząca AI/cyberbezpieczeństwa, z której możesz skorzystać już dziś