Spis treści
Wyciek prywatności ChatGPT nie potrzebuje Twojego imienia i nazwiska, adresu e-mail ani numeru telefonu. Nowe badania pokazują, że usunięte dzienniki rozmów ujawniają wiek, płeć i kraj pochodzenia użytkownika z dokładnością ponad 84%, używając wyłącznie słów, które już wpisał.
Brak specjalnych narzędzi. Brak dostępu do informacji poufnych. Po prostu standardowy model językowy zastosowany do danych, które zakładałeś, że są bezpieczne.
Badacze przeanalizowali ponad tysiąc kont ChatGPT z Brazylii, Indii, Nigerii i Pakistanu. Przeprowadzili anonimowe dzienniki rozmów za pomocą gotowego modelu.
Wyniki: płeć zidentyfikowana na poziomie F1 = 0,90, wiek na poziomie 0,84, kraj pochodzenia na poziomie 0,88. Mediana użytkowników została zidentyfikowana po tym, jak model odczytał zaledwie 5% ich historii konwersacji.
Pięć procent.
Mit “Po prostu usuń dane osobowe”
Standardowe dane anonimizacja działa na poziomie wiadomości. Zgodność nazw, adresów i numerów telefonów jest spełniona, zgłoszenie zostaje zamknięte.
Problem: wyciek prywatności ChatGPT nie pochodzi z pojedynczej wiadomości. Pochodzi on z pełnego wzorca w całej historii użytkownika.
Zapytaj o zarządzanie chorobą przewlekłą. Opisz swój harmonogram pracy. Wspomnij o sytuacji szkolnej swojego dziecka. Narzekać na kursy wymiany walut. Żadne z tych zdań nie zawiera danych osobowych w tradycyjnym sensie. Razem tworzą profil bardziej szczegółowy niż większość baz danych reklamowych.
The badania porównał logi ChatGPT z historią wyszukiwania Google i danymi oglądania YouTube, a także benchmarkami profilowania behawioralnego budowanymi przez dziesięciolecia. Rozmowy ChatGPT były konkurencyjne. W niektórych wymiarach bardziej odkrywcze. Pełna historia wyszukiwania użytkownika może obejmować setki niepowiązanych ze sobą zapytań. Konwersacja ChatGPT rozwija się jako spójna narracja z kontekstem, który użytkownik dostarcza dobrowolnie, ponieważ chce uzyskać lepsze odpowiedzi.
Jak dochodzi do wycieku prywatności ChatGPT bez żadnego naruszenia?
34,5% wiadomości użytkowników zawierało jawne dane osobowe. Większość z nich pojawiła się w ciągu pierwszych 14% konwersacji.
Użytkownicy ładują kontekst z wyprzedzeniem. To racjonalne, że więcej kontekstu daje lepsze odpowiedzi. Jest to również powód, dla którego dane są tak gęste od pierwszych kilku wymian.
Jest jeszcze jeden wymiar, który warto przeanalizować: jak model zawodzi. Kobiety na stanowiskach technicznych były często błędnie klasyfikowane jako mężczyźni. Starsi użytkownicy z aktualnymi umiejętnościami byli przypisywani do młodszych kohort. Specjaliści techniczni z Globalnego Południa byli mapowani na profile o niskich dochodach.
Nie są to błędy losowe. Są to stereotypy zakodowane w danych szkoleniowych, pojawiające się, gdy model opiera się na niekompletnych sygnałach. Ujawniają one, w jaki sposób systemy sztucznej inteligencji przetwarzają użytkowników, którzy nie pasują do zakładanych wartości domyślnych, co ma znaczenie, jeśli profil użytkownika zostanie później wykorzystany przez ubezpieczyciela lub agencję rządową.
Co to oznacza w praktyce
Jeśli korzystasz z ChatGPT z włączoną historią konwersacji, masz plik w chmurze OpenAI, który odzwierciedla twoje obawy zdrowotne, sytuację finansową, kontekst zawodowy i strukturę rodziny, niezależnie od tego, czy kiedykolwiek wpisałeś swoje imię.

Wykonaj następujący test: wyobraź sobie, że ktoś czyta tydzień Twojej historii na ChatGPT, nie widząc Twojego imienia i nazwiska. Jak myślisz, jaką masz pracę? Jaki jest twój przedział dochodów? Czy masz dzieci? Jaka jest twoja sytuacja zdrowotna? Jeśli te odpowiedzi wydają się oczywiste z waszych rozmów, wyciek prywatności ChatGPT już nastąpił w praktyce, nawet przed wystąpieniem jakiegokolwiek naruszenia.
W przypadku naruszenia, a naruszenia się zdarzają, dane te mogą być sprzedawane brokerom danych, wykorzystywane przez ubezpieczycieli lub udostępniane rządom w jurysdykcjach bez silnego egzekwowania prywatności.
Dostępne opcje i ich rzeczywiste koszty
Wyłącz historię konwersacji. Dostępne w Ustawieniach ChatGPT → Kontrola danych. Każda sesja rozpoczyna się od zera. Tracisz ciągłość kontekstu między rozmowami, co jest prawdziwym kosztem dla zaawansowanych użytkowników, którzy polegają na długotrwałych wątkach.
Przełącz na modele lokalne. Ollama i LM Studio działają w całości na Twoim komputerze. Dane nigdy nie opuszczają sprzętu. Kompromis: niższa wydajność w większości zadań, bardziej stroma krzywa konfiguracji, wymaga wiedzy technicznej do utrzymania.
Segmentuj konwersacje według tematów na oddzielnych kontach. Zachowaj pytania zdrowotne na jednym koncie, pracuj na innym. Kompromis: tarcia, które większość użytkowników porzuca w ciągu kilku dni.
Żadne z tych rozwiązań nie jest wolne od tarć. Prywatność i wygoda zawsze były w konflikcie. To badanie pokazuje, że konflikt jest głębszy niż większość użytkowników zakłada, nie na poziomie “przypadkowo udostępniłem swoje imię”, ale na poziomie “opisałem swoje życie, jedno rozsądne pytanie na raz”.”
Pytanie przestało brzmieć “czy udostępniasz dane osobowe?” w momencie, gdy zacząłeś pisać naturalnie.
Teraz jest: “Czy rozumiesz, jak wiele ujawniasz, nie mając tego na myśli?”.”
Dodaj komentarz