Modele bez ograniczeń wagowych nie odmawiają

Autor:

w

Spis treści

21 lipca Guillermo Rauch, dyrektor generalny firmy Vercel, opublikował na platformie X wyniki swojej wewnętrznej oceny, co spowodowało znaczne zaostrzenie dyskusji na temat modeli typu “open-weight” w dziedzinie bezpieczeństwa. Kimi K3, chiński model typu “open-weight” wprowadzony na rynek pięć dni wcześniej, uzyskał w jego testach ocenę „najwyższej klasy w zakresie cyberbezpieczeństwa”. W tym samym poście dodał, że „Fable odrzuca wszystko” i że w ogóle nie udało mu się doprowadzić tego modelu do końca testu.

Dzień później Semgrep opublikował tabelę zawierającą wskaźniki precyzji i odzysku.

Dwa dni później brytyjska organizacja AISI i amerykańska organizacja CAISI opublikowały swoje raporty.

Żaden z tych trzech pomiarów nie potwierdza tej tezy. A to jest o wiele ciekawsze niż sam ranking.

Co zakładano, a co zmierzono

Organizacje AISI i CAISI przetestowały system Kimi K3 za pomocą ExploitBench oraz w cyberpoligonie TLO, a także opublikowano dane. W teście ExploitBench uzyskał wynik 32 procent, podczas gdy GLM-5.2 – najsilniejszy z modeli o nieograniczonej wadze według stanu na czerwiec 2026 roku – osiągnął 24 procent. Wynik ten wygląda dobrze, dopóki nie spojrzy się na następną kolumnę, gdzie wiodące modele amerykańskie osiągnęły wykonanie dowolnego kodu średnio w 20 z 41 próbek. Kimi K3 nie osiągnął żadnego sukcesu na żadnej z 41 prób.

Na poligonie cybernetycznym, gdzie pełna ścieżka ataku składa się z 32 etapów, Kimi osiągnęła średnią na 17. etapie. Modele amerykańskie osiągnęły średnią 28,5. Udało jej się przejść cały poligon raz na dziesięć prób.

Semgrep przetestował coś innego, wykrywanie błędów w IDOR w rzeczywistych repozytoriach. Tam model Kimi K3 osiągnął precyzję na poziomie 0,684, podczas gdy modele Claude Opus 4,8, GPT-5,6 Sol, GPT-5,6 Terra i GLM-5,2 plasowały się w przedziale od 0,86 do 0,91. W największym repozytorium z zestawu Kimi osiągnął wynik F1 na poziomie około 6 procent, podczas gdy wszyscy inni osiągnęli około 20 procent. Jeśli ten schemat wydaje się znajomy, to nic dziwnego, ponieważ ta sama różnica między wynikiem reklamowanym a zmierzonym pojawiła się, gdy automatyczne mapowanie ATT&CK zostało poddane odpowiednim testom porównawczym.

Trzeba jednak uczciwie przyznać, że nie są to porównywalne przypadki. AISI przetestowało modele amerykańskie przy wyłączonych zabezpieczeniach na poziomie systemu. Sam system, jak podano w raporcie, “nie posiada aktywnych mechanizmów obronnych ani narzędzi obronnych”.

Dlaczego debata na temat modeli z otwartą kategorią wagową zmierza w złym kierunku

Większość dyskusji dotyczy górnej granicy – tego, czy modele z otwartą wagą dogoniły już najnowsze osiągnięcia, czy też nie.

Jeśli zarabiasz na życie, broniąc różnych rzeczy, to twoim problemem jest podłoga.

Bezpieczeństwo sprowadza się do jednej zasady. Należy podnosić koszt ataku tak długo, aż przestanie się on opłacać. Ranking modeli pokazuje, jak wysoko może sięgnąć najlepszy atakujący na świecie. Dolna granica wskazuje, ile kosztuje najtańszy atakujący, a nawet ten najtańszy wystarczy, by zrujnować ci tydzień.

Modele bez ograniczeń wagowych

Jedno zdanie zawarte w tym samym raporcie AISI i CAISI nie trafiło w ogóle na pierwsze strony gazet. “Środki zabezpieczające stosowane przez Kimi K3 nie zapobiegły podejmowaniu przez tę organizację prób opracowywania cyberataków ani prowadzenia ofensywnych operacji cybernetycznych’.

Porównajmy to teraz z drugą częścią wpisu Raucha. Model zamknięty dał odpowiedź negatywną. Model otwarty – nie, i nie ma to nic wspólnego z tym, jak dobrze któryś z nich radzi sobie z tym zadaniem.

Nie można ponownie przykręcić obciążników do dysku, które ktoś już zdjął i umieścił na swoim własnym dysku.

Co to dla Ciebie oznacza

Warstwa odrzucania, którą traktujemy jako mechanizm zabezpieczający, stanowi cechę charakterystyczną interfejsu API dostawcy. Obejmuje ona limit częstotliwości, logi po stronie dostawcy, zespół ds. nadużyć oraz możliwość zablokowania konta. Modele o otwartej wadze działające na cudzym procesorze graficznym nie posiadają żadnej z tych czterech cech.

Pod tym kryje się jeszcze jeden aspekt. Klasycznym ograniczeniem operacji ofensywnych są kwestie organizacyjne. Operator poświęca swój czas na jeden cel i nie jest w stanie zająć się dwudziestoma z zachowaniem tej samej jakości. Niedroga automatyzacja znosi to ograniczenie.

Skala zdolności Departamentu Obrony (DoD) dzieli atakujących na sześć poziomów, przy czym na poziomie pierwszym wykorzystuje się narzędzia stworzone przez innych, a na poziomie trzecim samodzielnie wykrywa się i wykorzystuje luki w zabezpieczeniach. Tanie rozwiązania techniczne przesuwają część użytkowników z poziomu pierwszego w kierunku poziomu trzeciego, ponieważ pracę wykonuje teraz automatyczny proces, a nie człowiek.

Ryzyko to iloczyn skutku i prawdopodobieństwa, a cały ten szum dotyczył właśnie skutku. Cicha zmiana nastąpiła w zakresie drugiego z tych czynników.

Mówiąc wprost, w jakich obszarach modele z otwartą wagą zawodzą

Warto dokładnie oszacować, ile kosztuje cię wskaźnik precyzji na poziomie 0,684. Niska precyzja oznacza, że model wciąż wykrywa pewne elementy, a następnie zagubia je w gąszczu błędnych wyników, które ktoś musi przejrzeć. Dla twojego zespołu to dodatkowy koszt. Dla atakującego, który tylko pobieżnie przegląda wyniki i potrzebuje tylko jednego trafienia, nie wiąże się to z żadnymi kosztami.

A tę lukę można wypełnić bez konieczności wprowadzania jakichkolwiek zmian w modelu.

W czerwcu clearbluejar odtworzył szeroko nagłośnione odkrycie – siedemnastoletni RCE w systemie FreeBSD, którego po raz pierwszy wykrył model typu „frontier”. Ten poziom autonomii był już prezentowane w ramach kontrolowanych testów kilka miesięcy wcześniej. Tyle że uruchomił go na gpt-oss-20b na swoim własnym sprzęcie, korzystając z publicznego, liczącego 1 700 wierszy potoku AISLE w języku Python. Pozorne pominięcie zniknęło po ponownym uruchomieniu. Prawdziwym problemem był szum, a rzeczywisty błąd został zagłuszony przez fałszywe alarmy.

Dodał więc etap sprawdzający, czy kod jest osiągalny. Liczba fałszywych alarmów spadła z 30 do 5, a luka CVE nadal istniała. Powiedział to wprost: “To właśnie ta konstrukcja wykonuje całą pracę i jest to dźwignia, którą można wykorzystać we własnym modelu”.

Stanislav Fort z serwisu AISLE odtworzył to samo odkrycie za mniej niż $100.

Oczywisty zarzut i dlaczego nie ma on uzasadnienia

Ktoś powie, że są to syntetyczne testy wydajnościowe, przeprowadzone w cyberpoligonach bez obrońców, z wykorzystaniem specjalnie dobranych zbiorów danych, które zawyżają wyniki. To słuszna uwaga, a sam raport AISI to potwierdza.

Jednak ten argument mija się z celem. Jeśli zakres ten sprzyja w równym stopniu zarówno modelom z otwartą masą, jak i tym z zamkniętą, to porównanie między nimi nadal ma sens. A istotny w tym przypadku wniosek ma charakter behawioralny, a nie liczbowy, ponieważ model został przetestowany i żadna konstrukcja zakresu nie zmieni tego faktu.

Cztery elementy, które należy sprawdzić w modelu zagrożeń

Pomiń tabelę wyników. Jeśli modele o dowolnej masie w ogóle występują w Twoim modelu zagrożeń, skup się raczej na tych czterech.

  1. Znajdź wszystkie elementy sterujące, z których korzystasz i które znajdują się u dostawcy. Wymień je na głos. Odmowa, ograniczenie częstotliwości, rejestrowanie, zamknięcie konta. Wszystkie pozycje z tej listy znikają w momencie, gdy algorytmy działają lokalnie.
  2. Sprawdź jeszcze raz swoje progi wykrywania, aby przeprowadzić niedrogie działania rozpoznawcze. Wraz ze wzrostem liczby prób spada jakość poszczególnych prób. Progi alarmowe dostosowane do pracy cierpliwego, ludzkiego operatora zinterpretują to jako szum.
  3. Oblicz różnicę czasową między opublikowaniem CVE a wydaniem twojej poprawki. Kiedyś zabezpieczeniem tego okna było to, że niewiele osób potrafiło wykorzystać błąd jako broń. Modele o otwartej wadze oraz publiczny potok skróciły kolejkę, a nikt nie wysyłał ci powiadomienia, gdy to się działo.
  4. Oceń, jak duże jest dla Ciebie obciążenie związane z segregacją medyczną. Niska precyzja kosztuje obrońcę realny czas, a atakującego nic. Jeśli wdrażasz wewnętrznie narzędzia tej samej klasy, uwzględnij w budżecie czas potrzebny na selekcję tak samo, jak uwzględniasz go w budżecie na skanowanie.

Żadna z tych kwestii nie wymaga nowego produktu, a żadna z nich nie dotyczy modeli o otwartej masie jako technologii. Trzeba po prostu wyeliminować z modelu zagrożeń założenie, że “prawdopodobnie nie są w stanie tego zrobić”.

Jedna zasada, którą warto zapamiętać

Przestań się zastanawiać, czy model twojego przeciwnika jest równie dobry jak twój. W przypadku modeli o dowolnej wadze należy zadać sobie szczere pytanie, czy cokolwiek jest w stanie go powstrzymać.

Laboratoria i przeprowadzane przez nie oceny wyznaczają górną granicę możliwości. Dolną granicę dostępności wyznaczają pliki zajmujące miejsce na czyimś dysku oraz 1 700 wierszy kodu w języku Python z serwisu GitHub. Modele z otwartą wagą przesunęły tę dolną granicę, podczas gdy argument pozostawał niezmienny na górnej granicy.

Opracuj model zagrożeń w oparciu o drugą liczbę.

Źródło | https://www.mbi-deepdives.com/open-weights/


Chcesz więcej? Subskrybuj The Dossier

Co tydzień w skrzynce odbiorczej:

📡 KANAŁ WYWIADOWCZY - 3-5 wyselekcjonowanych linków: [Badania] [Polityka] [Narzędzia] [Incydenty]
💡 JEDNA RADA - Jedna praktyczna wskazówka dotycząca AI/cyberbezpieczeństwa, z której możesz skorzystać już dziś

Komentarze

Dodaj komentarz

Twój adres e-mail nie zostanie opublikowany. Wymagane pola są oznaczone *