Spis treści
Tej wiosny trzy grupy badawcze przeanalizowały około 250 000 rzeczywistych rozmów prowadzonych przez Claude’a w kwietniu i maju 2026 roku. Były to dwa laboratoria uniwersyteckie oraz jedna organizacja non-profit, z których wszystkie zajmowały się danymi dotyczącymi wykorzystania sztucznej inteligencji, pozyskanymi bezpośrednio z rzeczywistego ruchu produkcyjnego.
Żadne z nich nie przeczytało ani jednej rozmowy.
To właśnie ta konstrukcja działa zgodnie z zamierzeniami i właśnie o tym nikt nie wspomina.
Co wydała firma Anthropic
Narzędzie to nosi nazwę „Anthropic Insights”, a wcześniej nazywało się Clio. Badacz wpisuje jedno pytanie, a Claude porównuje je z każdą rozmową w próbie. Odpowiedzi są sortowane według kategorii, a badacz widzi nazwy kategorii wraz z odsetkiem rozmów w każdej z nich. To całość wyników – bez transkrypcji i bez surowego tekstu. Przykładem takiego pytania podanym przez samą firmę Anthropic jest: “O jaki rodzaj wskazówek prosi ta osoba?”.”
Dane dotyczące korzystania z AI nigdy nie opuszczają firmy Anthropic w postaci surowej. Przekazywane są jedynie dane liczbowe.
Firma Anthropic twierdzi, że po raz pierwszy zewnętrzni badacze przeprowadzili publiczne, niezależne badania dotyczące danych dotyczących wykorzystania sztucznej inteligencji przez samą firmę zajmującą się sztuczną inteligencją. Twierdzenie to jest słuszne.

Umowy są również solidne – lepsze, niż się spodziewałem po laboratorium publikującym własny raport. Prawa do przeglądu obejmowały prywatność użytkowników oraz wszystko, co mogłoby pomóc użytkownikom w obejściu zasad korzystania z usługi. Obejmowały one również poufne informacje samej firmy Anthropic oraz dokładność badań. Umowy przewidują, że partnerzy mogą publikować wyniki badań “nawet jeśli są one niekorzystne dla firmy Anthropic”. Imperial College London przeprowadził niezależny audyt prywatności. The dane zbiorcze jest już na HuggingFace, więc to naprawdę istnieje.
Gwarancja prywatności stanowi lukę audytową
Firma Anthropic sama to napisała, co jest jej na pochwałę, bo mogła to pominąć.
“Ponieważ opieramy się na ocenie Claude’a, narzędzie to jest wrażliwe na sformułowanie pytania; źle sformułowane pytanie może spowodować, że rozmowy zostaną zaklasyfikowane do kategorii, które nie oddają ich prawdziwego charakteru”.”
Potem pojawia się zdanie, które powinno było stać się nagłówkiem.
“Ponieważ nikt nie ma wglądu w treść rozmów, trudno jest wykryć te błędy”.”
Przeczytaj to dwa razy, bo opisana tu pętla jest zamknięta. Narzędziem dokonującym pomiaru jest model językowy, a przedmiotem pomiaru jest model językowy. Mechanizm zabezpieczający, który chroni użytkowników, jest tym samym mechanizmem, który uniemożliwia komukolwiek sprawdzenie, czy dane dotyczące wykorzystania sztucznej inteligencji mają rzeczywiście to znaczenie, jakie przypisują im etykiety kategorii.
Jeśli opierasz się na ocenie modelki, powinieneś mieć pewne założenie wstępne. Kiedy przeglądałem siedem modeli o dowolnej wielkości, przyporządkowujących zgłoszenia zagrożeń do klasyfikacji ATT&CK, pomylili się cztery razy na pięć.
Wewnątrz firmy Anthropic rozwiązuje ten problem poprzez wielokrotne przerabianie pytania przez wiele tygodni. Partnerzy zewnętrzni nie mogliby tego zrobić, ponieważ każdy nowy zbiór danych wymagałby kolejnej weryfikacji pod kątem ochrony prywatności, a badanie nigdy by się nie zakończyło.
Dlaczego środowisko testowe nie odpowiada środowisku produkcyjnemu
Rozwiązaniem tymczasowym było zlecenie naukowcom dostosowania pytań w serwisie WildChat – publicznym zbiorze danych zawierającym rozmowy między ludźmi a sztuczną inteligencją, gdzie mogli zapoznać się z tekstem źródłowym i sprawdzić, czy kategorie mają sens. Następnie wykorzystali dostosowane pytania i skierowali je do rzeczywistego ruchu w systemie Claude.
Niektóre pytania, które sprawdziły się w WildChat, po zastosowaniu w rzeczywistych rozmowach z Claude’em generowały mylące kategorie, ponieważ WildChat ma charakter swobodny i kreatywny, a ruch w Claude’u – nie. Dwie grupy danych dotyczących wykorzystania sztucznej inteligencji, dwie różne populacje.
Każdy, kto kiedykolwiek tworzył regułę wykrywania, zna ten schemat. Reguła działa bez zarzutu na korpusie testowym, a potem, już w ciągu pierwszej godziny po pojawieniu się prawdziwego ruchu, zasypuje cię fałszywymi alarmami. To ta sama wada, tylko w innej dziedzinie.
WildChat ma również swoje własne problemy, które omówiłem w Dossierze 33 na podstawie skanowania przeprowadzonego przez Truffle Security obejmującego 7,6 petabajtów danych szkoleniowych HuggingFace. Jeden klucz Infura, wklejony jednokrotnie w rozmowie w ChatGPT, został przechwycony przez WildChat i skopiowany do 1 131 publicznych zbiorów danych oraz 10 162 lokalizacji plików.
A więc dane dotyczące wykorzystania sztucznej inteligencji, do których masz dostęp, to ta partia, w której błędy są nieodwracalne. Dane produkcyjne, w których błędy są korygowane, to partia, do której nikt nie ma dostępu. To jedna transakcja, przeprowadzona dwukrotnie.
Co oznacza podawanie danych dotyczących wykorzystania sztucznej inteligencji
Same wyniki są warte uwagi. Laboratorium SALT Uniwersytetu Stanforda ustaliło, że ponad połowa rozmów z Claude’em dotyczyła powierzenia przez ludzi sztucznej inteligencji zadań o istotnym znaczeniu, a w prawie trzech czwartych z nich to ludzie wyznaczali kierunek działań, podczas gdy Claude pełnił rolę pomocniczą.
Zanim umieścisz to w prezentacji dla zarządu, upewnij się, z czym masz do czynienia. Jest to ocena Claude’a dotycząca tego, co uznaje się za “istotne”, wyrażona w procentach. Naukowiec, który opublikował te wyniki, nie może cofnąć się w czasie i sprawdzić ani jednego przypadku. Firma Anthropic prowadzi również badania, w których ludzie sami udzielają odpowiedzi, na przykład badanie przeprowadzone wśród 81 000 osób, o którym pisałem wcześniej, a model wyznaczający intencje na podstawie transkrypcji to zupełnie inne narzędzie. Wynik ten nadal może być prawdziwy. Jest to coś zupełnie innego niż pomiar, a różnica ta nabiera znaczenia w momencie, gdy ktoś opracowuje na tej podstawie politykę.
W danych dotyczących korzystania z tej sztucznej inteligencji zastosowano jeszcze jeden filtr. Firma Anthropic usunęła lub zmodyfikowała wszystkie kategorie opisujące metody, jakie użytkownicy znaleźli w celu obejścia zabezpieczeń. Kategorie opisujące próby podejmowane przez użytkowników pozostały bez zmian. W każdym badaniu liczba kategorii i rozmów nie przekraczała 5%, a informacje te wskazały badaczom, które klastry zostały uwzględnione i dlaczego. To uczciwe postępowanie. Nadal jednak to laboratorium edytuje zbiór danych, zanim trafi on do audytora.
Cztery pytania, które warto sobie zadać przed powołaniem się na badanie dotyczące wykorzystania sztucznej inteligencji
Skorzystaj z nich. Sprawdzają się w każdym badaniu użytkowania, które do ciebie trafi, w tym w tym pilotażowym.
1. Dowiedz się, kto zapoznał się z dokumentami źródłowymi. Jeśli zapoznał się z nimi model, powiedz to na głos, podając numer.
2. Sprawdź dokładne brzmienie pytania, na które odpowiedział model. To właśnie sformułowanie pytania określa kategorie, a kategorie te stanowią wynik.
3. Zapytaj, co zostało usunięte przed publikacją i czy ktoś ci o tym poinformował. Firma Anthropic poinformowała swoich partnerów, które klastry zostały zmienione, czego większość firm by nie zrobiła.
4. Sprawdź, czy inny zespół byłby w stanie odtworzyć ten wynik na tych samych danych. W przypadku dzisiejszego rzeczywistego ruchu laboratoryjnego nikomu się to nie udaje.
Część, która przetrwa ten odcinek pilotażowy
Zobaczmy, jak sytuacja się rozwinie. Organy regulacyjne będą domagać się właśnie takiego dostępu do danych dotyczących wykorzystania sztucznej inteligencji, a niezależnie od tego, jaki model zostanie tutaj ustandaryzowany, stanie się on wzorem dla wszystkich przyszłych audytów dotyczących sztucznej inteligencji.
Jeśli ten szablon sugeruje, że audytor nigdy nie zapoznaje się z materiałami dowodowymi pierwszego rzędu, to “niezależny audyt” zaczyna oznaczać “niezależne pytanie, odpowiedź laboratorium”. Firma Anthropic posunęła się dalej niż ktokolwiek inny, więc jej projekt pilotażowy wyznacza standard.
I tak wolałbym to od nic, bez wahania. Reżyseria jest po prostu świetna.
Gdybym był badaczem, wypełniłbym ten formularz. Nie traktowałbym jednak tych wartości procentowych tak samo, jak własnego opisu projektu.
Zanim powtórzysz jakąś liczbę dotyczącą danych o wykorzystaniu sztucznej inteligencji, dowiedz się, kto analizował źródłowe dane. Model, który przeprowadza taką analizę, dostarcza ci jedynie hipotezę. Cytuj ją jako hipotezę.
Źródło | https://www.anthropic.com/research/enabling-independent-research

















