Tag: Raporty CTI

  • Mapowanie AI ATT&CK jest błędne w czterech na pięć przypadków

    Mapowanie AI ATT&CK jest błędne w czterech na pięć przypadków

    Spis treści

    Zautomatyzowane mapowanie ATT&CK to główna funkcja każdej platformy CTI sprzedawanej w 2026 roku. Z opublikowanego w czerwcu badania porównawczego wynika, że najlepszy model oparty na oprogramowaniu open source prawidłowo rozpoznaje mniej więcej jedną technikę na pięć.

    Wyobraź sobie analityka SOC, który otrzymał właśnie raport o nowym incydencie i otrzymał polecenie, by go podzielić na MITRE ATT&CK techniki. Kilka godzin pracy. Ktoś wtrąca się z oczywistą sugestią: wrzuć to do modelu LLM – minuta i gotowe.

    Tak się stanie. Cztery na pięć technik będą błędne.

    Co obejmował test porównawczy

    Sześciu naukowców oszacowało to w artykule zatytułowanym “Ocena modeli językowych typu LLM typu open source pod kątem klasyfikacji technik ATT&CK z wieloma etykietami w raportach CTI”, arXiv ID 2606.18166, opublikowanym 16 czerwca 2026 r. Jest to pierwszy rzetelny punkt odniesienia dla mapowania ATT&CK w nieustrukturyzowanych danych wywiadowczych dotyczących zagrożeń, oparty na rzeczywistych raportach, a nie na wybiórczych fragmentach tekstu.

    Zespół stworzył zbiór 2 076 zdań zaczerpniętych z 83 Raport DFIR opisy, w których 1 281 zdań zawiera opis techniki, a 795 nie zawiera żadnego opisu. Adnotacje zostały wprowadzone ręcznie w sześciu etapach, a współczynnik kappa Cohena między adnotatorami wyniósł 0,68; w sumie zidentyfikowano 114 unikalnych technik.

    Przetestowano na nich siedem modeli open source przy kwantyzacji 4-bitowej Q4_K_M. DeepSeek-V2.5 z 236 mld parametrów, GPT-OSS z 120 mld i 20 mld, Llama 3.1 Instruct z 70 mld i 8 mld oraz Gemma 3 z 27 mld i 12 mld.

    Mapowanie ATT&CK

    Najlepszy wynik w kategorii mikro F1 wyniósł 0,22 i został osiągnięty przez DeepSeek-V2.5. W tym przebiegu zastosowano temperaturę 0,0, trzy podpowiedzi oraz włączoną funkcję łańcucha myślenia. Precyzja wyniosła 0,21, a odzyskiwalność 0,23.

    Najsłabszy z całej grupy, model GPT-OSS 20B, osiągał wyniki w przedziale od 0,00 do 0,06.

    Wygląda to na narzędzie, które w procesie produkcyjnym generuje więcej pracy, niż pozwala zaoszczędzić.

    Dlaczego wyniki dostawców wyglądały tak dobrze?

    Wcześniejsze narzędzia do mapowania ATT&CK mierzyły zupełnie inne parametry, a ich wyniki dobrze prezentują się na slajdach. TTPXHunter osiągnął współczynnik F1 na poziomie 0,97, TTPHunter – 0,88, TTPDrill – 0,82, a AttacKG – 0,79.

    Haczyk tkwi w sposobie oceny tych narzędzi. Punktacja obejmowała wyłącznie 50 najpopularniejszych technik, na podstawie opisów procedur zaczerpniętych bezpośrednio z ATT&CK. Ocena odbywała się następnie na poziomie raportu, a nie na poziomie zdania, więc model otrzymywał zdanie napisane językiem taksonomii i dopasowywał je z powrotem do taksonomii. Egzamin z otwartą książką.

    Prawdziwy raport wcale tak nie wygląda, a zbiór danych pokazuje, dlaczego. Jedno zdanie zawiera średnio 1,58 techniki, a 40,2 procent oznaczonych zdań zawiera więcej niż jedną. Sytuacja komplikuje się w przypadku długiego ogona, ponieważ spośród 114 technik 56 pojawia się pięć razy lub rzadziej, a 27 występuje dokładnie raz. Najczęściej występująca technika przewyższa najrzadziej występującą w stosunku 229 do 1.

    Gdzie mapowanie ATT&CK zawodzi

    Dwa rodzaje błędów psują wyniki, a oba są dobrze znane każdemu, kto na co dzień pracuje z modelami LLM.

    Największe szkody wyrządza przechwytywanie słów kluczowych, a jeden z przykładów przytoczonych w artykule pokazuje, jak poważne mogą być tego skutki. W raporcie pojawia się sformułowanie “staged a ransomware binary” (umieszczono plik binarny oprogramowania ransomware), które człowiek odczytuje jako “Ingress Tool Transfer” – co oznacza, że ktoś umieścił narzędzie na komputerze ofiary. Model skupia się na słowie „staged” i generuje wynik „Data Staged” – technikę z innej taktyki dotyczącej przygotowywania danych do wycieku. Słowo się zgadza, ale znaczenie nie.

    Z podobnego powodu pomijane są działania wieloetapowe. Model szuka dosłownych sformułowań z taksonomii zamiast analizować działania atakującego w trzech zdaniach, przez co połowa łańcucha ataku pozostaje niezauważona.

    Szybka regulacja nic nie dała

    Wynik, który powinien zaniepokoić każdego, kto rozważa zakup rozwiązania do mapowania ATT&CK, to ten, który w ogóle nie uległ zmianie. Zmiana temperatury z 0,0 do 0,5 powoduje zmianę wskaźnika micro F1 o maksymalnie 0,01 we wszystkich siedmiu modelach. Porównanie metody zero-shot z metodą three-shot, zarówno z zastosowaniem łańcucha rozumowania, jak i bez niego, nie przyniosło nigdzie statystycznie istotnego wzrostu wyników. Liczba parametrów wykazuje dodatnią korelację z wynikiem, jednak nawet przy 236 miliardach parametrów uzyskuje się jedynie 0,22.

    Mówiąc wprost, nie da się po prostu „wymanewrować” się z błędnego przyporządkowania do modelu ATT&CK.

    Jedyną skuteczną metodą było odzyskanie danych

    Autorzy załadowali dokumentację ATT&CK do magazynu wektorów FAISS i do każdego zapytania dołączyli pięć najlepiej pasujących definicji technik. Wynik Llama 70B wzrósł z 0,22 do 0,32, a współczynnik odzysku wzrósł z 0,23 do 0,41, co stanowi poprawę o współczynnik 1,78.

    Rzetelne mapowanie ATT&CK przewyższyło wszystkie kombinacje promptów i temperatur uwzględnione w badaniu łącznie. Rozumowanie nigdy nie stanowiło wąskiego gardła. Model nie przechowuje roboczej kopii kilkuset technik i podtechnik ATT&CK, więc opiera się na pamięci.

    Pobieranie danych również stwarza nową lukę, ponieważ wszystko, co znajduje się w tym magazynie wektorów, staje się dla modelu „prawdziwym obrazem rzeczywistości” – i właśnie ta sama słabość leży u podstaw zatrucie agenta zajmującego się badaniami nad sztuczną inteligencją.

    Kierunek jest już ustalony, nawet jeśli wartość 0,32 nadal nie spełnia wymagań klasy produkcyjnej. Przekaż modelowi definicje ATT&CK i przestań dostosowywać podpowiedzi.

    Cztery pytania, które warto zadać przed zakupem narzędzia do mapowania ATT&CK

    Należy poprosić dostawcę o udzielenie odpowiedzi na wszystkie cztery pytania na piśmie.

    1. Zapytaj, na podstawie jakiego zbioru danych oceniano to narzędzie. Przykłady procedur zaczerpnięte z samego ATT&CK nie dają żadnej informacji na temat tego, jak narzędzie to radzi sobie z twoimi raportami.
    2. Sprawdź wskaźnik pokrycia technik. Ranking 50 najpopularniejszych technik ukrywa „długi ogon”, w którym kryją się prawdziwe włamania.
    3. Sprawdź, czy ocena została przeprowadzona na poziomie raportu, czy na poziomie zdania. Ocena na poziomie raportu pozwala narzędziu odgadnąć trzy popularne techniki i mimo to sprawiać wrażenie dokładnego.
    4. Zapytaj o wskaźnik wyników fałszywie pozytywnych dla zdań, które w ogóle nie zawierają żadnej techniki. W zestawieniu porównawczym znalazło się 795 takich zdań nie bez powodu.

    Odpowiedział ci sprzedawca, który uniknął wszystkich czterech pytań.

    Każdy, kto już stosuje mapowanie ATT&CK w centrum operacyjnym bezpieczeństwa (SOC), powinien sprawdzić, ile z tych powiązań jest weryfikowanych przez człowieka, zanim trafią one do reguły wykrywania. Przy wskaźniku F1 wynoszącym 0,22 automatyzacja zasila system wykrywania, a raporty kierownictwa zawierają zmyślone TTP. Jest to gorsze niż całkowity brak mapowania, ponieważ sprawia wrażenie, jakby opierało się na wiedzy.

    Ta sama pułapka czai się w każdym systemie, który samodzielnie generuje wezwania związane z bezpieczeństwem, a mapowanie ATT&CK stanowi jeden z przykładów znacznie szerszego problemu związanego z jak działa uczenie się w autonomicznej cyberobronie.

    Trzeba informować o wszystkim człowieka. Wymaga tego logika.

    Źródło: https://arxiv.org/abs/2606.18166v1


    Chcesz więcej? Subskrybuj The Dossier

    Co tydzień w skrzynce odbiorczej:

    📡 KANAŁ WYWIADOWCZY - 3-5 wyselekcjonowanych linków: [Badania] [Polityka] [Narzędzia] [Incydenty]
    💡 JEDNA RADA - Jedna praktyczna wskazówka dotycząca AI/cyberbezpieczeństwa, z której możesz skorzystać już dziś