// bezpieczeństwo systemów ai
Bezpieczeństwo systemów AI
Pojęcia, którymi opisujemy przypadki w rejestrze i klasy awarii. Tam, gdzie istnieje definicja w standardzie lub akcie prawnym, podajemy ją jako źródło; definicje robocze laboratorium są oznaczone.
// 20
prompt injection
wstrzyknięcie poleceń do modelu
Podatność, w której dane wejściowe zmieniają zachowanie lub wynik modelu językowego w niezamierzony sposób. Wejście nie musi być czytelne dla człowieka — wystarczy, że przetworzy je model. Indirect prompt injection to odmiana, w której polecenia trafiają do modelu z zewnętrznego źródła, np. strony internetowej albo pliku, który model czyta.
Dlaczego to ważne. Pozycja LLM01 w OWASP Top 10 for LLM Applications 2025. Groźna przede wszystkim tam, gdzie model ma uprawnienia do działania — patrz excessive agency.
Źródła OWASP GenAI Security Project — LLM01:2025 Prompt Injection
Zobacz też excessive agency · Retrieval-Augmented Generation · Prompt injection — Gdy dane stają się poleceniem
Gdzie ten termin pracuje Agent security · Data exposure · Excessive agency · RAG security
// 21
excessive agency
nadmierne uprawnienia systemu AI do działania
Podatność, która pozwala wykonać szkodliwe działanie w odpowiedzi na nieoczekiwany, niejednoznaczny lub zmanipulowany wynik modelu — niezależnie od przyczyny błędu modelu. Źródłem są zbyt szerokie funkcje, uprawnienia albo autonomia narzędzi, które model może wywołać.
Dlaczego to ważne. Zasada laboratorium: LLM proponuje, warstwa kontroli decyduje. Model nie powinien dostawać nieograniczonego prawa do wykonania działania.
Źródła OWASP GenAI Security Project — LLM06:2025 Excessive Agency
Zobacz też prompt injection · confabulation · Excessive agency — Gdy model może więcej, niż powinien
Gdzie ten termin pracuje Agent security · Prompt injection
// 22
Retrieval-Augmented Generation RAG
generowanie wspomagane wyszukiwaniem
Technika łącząca model językowy z zewnętrznym źródłem wiedzy: przed wygenerowaniem odpowiedzi system wyszukuje fragmenty dokumentów (zwykle przez wyszukiwanie wektorowe) i dołącza je do kontekstu modelu. Termin wprowadzili Lewis i in. (2020).
Dlaczego to ważne. Znalezienie dokumentu nie oznacza, że odpowiedź jest z nim zgodna — retrieval is not grounding.
Źródła Lewis P. i in. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. arXiv:2005.11401 · OWASP GenAI Security Project — LLM08:2025 Vector and Embedding Weaknesses
Zobacz też grounding · prompt injection · RAG security — Gdy baza wiedzy staje się wektorem ataku
Gdzie ten termin pracuje Prompt injection
// 23
grounding
oparcie odpowiedzi na sprawdzalnym źródle
Stan, w którym każde twierdzenie odpowiedzi da się przypisać do konkretnego fragmentu źródła i zostało z nim porównane. Samo dołączenie dokumentów do kontekstu (RAG) nie jest grounding — dopiero porównanie twierdzenia z niezależnym zapisem zamyka pętlę.
Definicja robocza laboratorium — w literaturze termin bywa używany szerzej, także dla samego dołączania źródeł.
Zobacz też Retrieval-Augmented Generation · confabulation · residual
Gdzie ten termin pracuje Konfabulacja · Prompt injection · RAG security · PL-AI-2026-001
// 24
confabulation
konfabulacja (potocznie: halucynacja)
Wytwarzanie przez model generatywny pewnie brzmiących, lecz błędnych lub fałszywych treści, które mogą wprowadzić użytkownika w błąd. NIST używa terminu confabulation; potocznie mówi się o halucynacjach. Model generuje tekst probabilistycznie — gdy brakuje mu dokładnej reprezentacji, uzupełnia lukę tekstem o poprawnej formie.
Dlaczego to ważne. Wspólny mechanizm kart PL-AI-2026-001, PL-AI-2025-002 i PL-AI-2023-001.
Źródła NIST AI 600-1 (2024). Generative Artificial Intelligence Profile · OWASP GenAI Security Project — LLM09:2025 Misinformation
Zobacz też grounding · automation bias · false confession · Konfabulacja — Gdy pewny ton zastępuje źródło
Gdzie ten termin pracuje Fałszywe przyznanie się · Bezpieczeństwo systemów AI · PL-AI-2023-001 · PL-AI-2025-002 · PL-AI-2026-001
// 25
automation bias
nadmierne zaufanie do automatyzacji
Skłonność do przyjmowania wyników systemu zautomatyzowanego jako poprawnych — i do pomijania informacji, które im przeczą — zamiast ich samodzielnego sprawdzenia. Szczególnie silna, gdy wynik brzmi autorytatywnie.
Źródła Parasuraman R., Manzey D. (2010). Complacency and Bias in Human Use of Automation. Human Factors 52(3), 381–410
Zobacz też confabulation
Gdzie ten termin pracuje Fałszywe przyznanie się · Konfabulacja · Shadow AI · PL-AI-2026-001
// 26
deepfake
treść typu deepfake
Według AI Act (art. 3 pkt 60): obraz, dźwięk lub wideo wygenerowane albo zmanipulowane przez AI, które przypominają istniejące osoby, przedmioty, miejsca, podmioty lub zdarzenia i mogłyby fałszywie wydać się odbiorcy autentyczne lub prawdziwe. Art. 50 ust. 4 nakłada na podmioty stosujące takie systemy obowiązek ujawnienia, że treść została wygenerowana lub zmanipulowana; przepis stosuje się od 2 sierpnia 2026 r.
Źródła Rozporządzenie (UE) 2024/1689 (AI Act) — EUR-Lex · AI Act — art. 3 (definicje), wersja przeglądowa
Zobacz też cloaking · Deepfake i syntetyczna tożsamość — Gdy twarz i głos przestają być dowodem
Gdzie ten termin pracuje PL-AI-2023-002 · PL-AI-2024-001 · PL-AI-2024-002 · PL-AI-2024-004
// 27
cloaking
pokazywanie weryfikatorowi innej treści niż użytkownikowi
Zestaw technik, którymi treść rozpoznaje, kto ją ogląda, i pokazuje mechanizmom weryfikacji inną stronę lub reklamę niż użytkownikom — na podstawie nagłówków przeglądarki, adresu IP czy strony odsyłającej. CERT Polska opisał je w kampaniach fałszywych reklam inwestycyjnych.
Źródła CERT Polska (2024). Oszustwa reklamowe na dużych platformach internetowych
Zobacz też deepfake
Gdzie ten termin pracuje Deepfake i syntetyczna tożsamość · PL-AI-2024-004
// 28
shadow AI
nieautoryzowane użycie narzędzi AI w organizacji
Korzystanie przez pracowników z publicznych narzędzi AI poza wiedzą i kontrolą organizacji — bez polityki, bez zatwierdzonego narzędzia i bez procesu. Treść wpisywana w prompt staje się wtedy kanałem wypływu danych, którego nikt nie monitoruje.
Definicja robocza laboratorium.
Zobacz też prompt injection · Shadow AI — Gdy prompt staje się kanałem wypływu danych
Gdzie ten termin pracuje Data exposure
// 29
reward hacking
optymalizacja miary zamiast celu
Zachowanie systemu uczonego przez nagrodę, który osiąga wysoką wartość funkcji celu w sposób niezamierzony przez projektantów — optymalizuje miarę, a nie to, co miara miała reprezentować. Amodei i in. (2016) opisali „unikanie reward hacking” jako jeden z pięciu praktycznych problemów bezpieczeństwa AI.
Dlaczego to ważne. W języku PCT: system kontroluje inną controlled variable niż ta, którą zakładali jego twórcy.
Źródła Amodei D. i in. (2016). Concrete Problems in AI Safety. arXiv:1606.06565 · Diener Ł. (2026). No Argument for the World. Zenodo
Zobacz też specification gaming · controlled variable · Reference Signal Engineering · Metric gaming — Gdy wskaźnik jest zielony, a proces zawodzi
// 30
specification gaming
spełnienie dosłownej specyfikacji zamiast zamierzonego celu
Zachowanie, które spełnia dosłowną specyfikację celu, nie osiągając zamierzonego rezultatu. Przykład z katalogu DeepMind: agent nagradzany za wysokość dolnej ściany czerwonego klocka zamiast położyć go na niebieskim, przewrócił go do góry dnem. Według autorów przyczyną jest błędne określenie zadania, a nie wada algorytmu uczenia.
Dlaczego to ważne. Ten sam wzorzec w systemach produkcyjnych laboratorium nazywa metric gaming: wskaźnik rośnie, cel nie jest realizowany.
Źródła Krakovna V. i in. (2020). Specification gaming: the flip side of AI ingenuity. Google DeepMind
Zobacz też reward hacking · controlled variable · Metric gaming — Gdy wskaźnik jest zielony, a proces zawodzi
// 31
sensitive information disclosure
ujawnienie informacji wrażliwych
Ujawnienie przez model językowy lub aplikację, w której działa, danych wrażliwych — osobowych, finansowych, medycznych, poufnych danych firmy, danych uwierzytelniających, dokumentów prawnych — a także zastrzeżonych algorytmów i kodu. Według OWASP ograniczenia w prompcie systemowym mogą ten problem zmniejszyć, ale nie zawsze są przestrzegane i można je obejść przez prompt injection.
Dlaczego to ważne. Pozycja LLM02 w OWASP Top 10 for LLM Applications 2025. Nie musi wymagać atakującego: dane mogą wyjść przez zwykłe użycie narzędzia — patrz shadow AI.
Źródła OWASP GenAI Security Project — LLM02:2025 Sensitive Information Disclosure
Zobacz też prompt injection · shadow AI · Data exposure — Gdy dane wychodzą kanałem, którego nikt nie pilnuje
Gdzie ten termin pracuje Shadow AI
// 32
AI agent
agent AI
System oparty na modelu językowym, który planuje, działa i podejmuje decyzje w wieloetapowych procesach: wywołuje narzędzia, odczytuje ich wyniki i na tej podstawie wybiera kolejny krok. Według OWASP systemy agentowe zwykle wielokrotnie wywołują model, używając wyniku poprzedniego wywołania do sterowania następnym.
Dlaczego to ważne. Każdy krok agenta może wprowadzić do kontekstu treść niezaufaną, a każda decyzja opiera się na wyniku poprzedniej — dlatego bezpieczeństwo agenta dotyczy przebiegu działania, nie tylko konfiguracji.
Źródła OWASP GenAI Security Project — OWASP Top 10 for Agentic Applications for 2026 · OWASP GenAI Security Project — LLM06:2025 Excessive Agency
Zobacz też excessive agency · prompt injection · Agent security — Gdy system działa sam, krok po kroku
Gdzie ten termin pracuje Excessive agency
// 33
false confession
fałszywe przyznanie się (modelu)
Nieprawdziwa wypowiedź modelu o własnym działaniu, stanie lub przyczynie zdarzenia, przedstawiona jako fakt: przyznanie się do błędu, którego nie było, zaprzeczenie działaniu, które miało miejsce, albo opis mechanizmów, których nie ma. Szczególny przypadek confabulation, którego przedmiotem jest sam system.
Dlaczego to ważne. Wypowiedź modelu o sobie nie jest dowodem. Po incydencie przyczynę ustala się z logów i stanu systemu, nie z przesłuchania modelu.
Definicja robocza laboratorium.
Źródła NIST AI 600-1 (2024). Generative Artificial Intelligence Profile — §2.2 Confabulation
Zobacz też confabulation · independent record · Fałszywe przyznanie się — Gdy model mówi o sobie coś, co nie jest prawdą