Trzy rzeczy, które warto wiedzieć.
- Pozycja LLM02 — Sensitive Information Disclosure — na liście OWASP Top 10 for LLM Applications 2025.
- Zakres według OWASP: dane osobowe, finansowe i medyczne, poufne dane firmy, dane uwierzytelniające, dokumenty prawne — a także zastrzeżone algorytmy i kod.
- Ograniczenia w prompcie systemowym pomagają, ale według OWASP nie zawsze są przestrzegane i można je obejść przez prompt injection.
Czym jest data exposure.
Według OWASP informacje wrażliwe mogą dotyczyć zarówno samego modelu, jak i kontekstu aplikacji. Modele językowe, zwłaszcza osadzone w aplikacjach, mogą ujawnić w odpowiedzi dane wrażliwe, zastrzeżone algorytmy lub poufne szczegóły — co prowadzi do nieuprawnionego dostępu do danych, naruszeń prywatności i naruszeń własności intelektualnej. Użytkownicy powinni rozumieć ryzyko, że dane, które sami podali, mogą później pojawić się w odpowiedzi modelu.
Hasło w słowniku: sensitive information disclosure · źródło definicji: LLM02:2025 Sensitive Information Disclosure
Dane wchodzą łatwo. Nikt nie śledzi, dokąd idą.
Źródło OWASP wymienia trzy typowe postacie: wyciek danych osobowych w trakcie rozmowy z modelem; ujawnienie zastrzeżonych algorytmów lub danych treningowych, które ułatwia ataki odwracające model; ujawnienie poufnych informacji biznesowych w wygenerowanej odpowiedzi.
Źródło Reddy i Gujral (2025) opisali EchoLeak jako pełną eskalację uprawnień przez granice zaufania modelu, bez udziału użytkownika: jeden e-mail z zewnątrz wystarczył, by dane z kontekstu Microsoft 365 Copilot wyszły na zewnątrz — m.in. przez automatycznie pobierane obrazy.
Wniosek W języku PCT: organizacja kontroluje, co model mówi, ale nie kontroluje, co model widzi. Brakuje zapisu, który dla każdej danej wskazywałby, kto może ją zobaczyć — i komparatora, który przed wysłaniem odpowiedzi sprawdziłby, czy odbiorca mieści się w tym zakresie.
Jak to wygląda w praktyce.
-
Cudze dane w odpowiedzi
Użytkownik dostaje odpowiedź z danymi osobowymi innego użytkownika, bo dane nie zostały odpowiednio oczyszczone.
-
Celowy prompt injection
Atakujący omija filtry wejścia, żeby wydobyć informacje wrażliwe.
-
Wyciek przez dane treningowe
Dane wrażliwe, włączone do treningu bez należytej staranności, pojawiają się w odpowiedziach modelu.
-
Kod źródłowy w publicznym czacie
Inżynierowie wgrywają wewnętrzny kod źródłowy do publicznego narzędzia AI. Dane trafiają na zewnętrzne serwery, z których trudno je odzyskać i usunąć.
-
Obraz, który wynosi dane
Odpowiedź asystenta zawiera obraz spod zewnętrznego adresu, w którym zakodowano dane z kontekstu. Aplikacja pobiera obraz automatycznie — i tym samym wysyła dane atakującemu.
Scenariusze 1–3 za OWASP LLM02:2025; 4 za Bloomberg (Samsung, 2023); 5 za Reddy i Gujral (EchoLeak, 2025) — opisy skrócone.
To nie jest hipoteza. Zostało pokazane na działających systemach.
- Documented · źródło 2 Samsung: kod źródłowy w ChatGPT (2023). Według wewnętrznego memo, z którym zapoznał się Bloomberg, inżynierowie Samsunga w kwietniu 2023 r. przypadkowo ujawnili wewnętrzny kod źródłowy, wgrywając go do ChatGPT. Firma zakazała pracownikom jednego z największych działów korzystania z publicznych narzędzi generatywnej AI. Uzasadnienie: przesłane dane są przechowywane na zewnętrznych serwerach, trudno je odzyskać i usunąć i mogą zostać ujawnione innym użytkownikom.
- Documented · źródło 3 EchoLeak — CVE-2025-32711 (czerwiec 2025). Zero-click w Microsoft 365 Copilot: jeden spreparowany e-mail umożliwiał zdalne, nieuwierzytelnione wyprowadzenie danych bez interakcji użytkownika. Jako środki zaradcze autorzy analizy wskazują m.in. podział promptu, lepsze filtrowanie wejścia i wyjścia, kontrolę dostępu opartą na pochodzeniu danych i ścisłą politykę CSP.
W rejestrze: PL-AI-2023-001 — skarga do UODO na ChatGPT. To inna strona tej klasy: nie wyciek, lecz przetwarzanie danych osobowych przez model, który wygenerował nieprawdziwą biografię konkretnej osoby — bez kanału, którym dałoby się ją sprostować. Dane o osobie są w systemie, ale nikt nie kontroluje, co model o niej mówi.
Co może się stać.
- ujawnienie danych osobowych innym użytkownikom
- wyciek kodu źródłowego, algorytmów i tajemnic handlowych
- ujawnienie danych uwierzytelniających i konfiguracji systemu
- utrata kontroli nad danymi przesłanymi do zewnętrznego dostawcy
- nieprawdziwe dane o osobach, generowane i przetwarzane bez możliwości sprostowania
Według OWASP skutkiem może być nieuprawniony dostęp do danych, naruszenie prywatności i naruszenie własności intelektualnej. Ta klasa nie wymaga atakującego: dane mogą wyjść przez zwykłe użycie narzędzia — patrz shadow AI.
Jak zauważyć, że to się dzieje.
- Mapa przepływu danych: dla każdego źródła danych w kontekście modelu — kto może je zobaczyć, gdzie są logowane, jak długo przechowywane i czy trafiają do dostawcy modelu.
- Kontrola wyjścia: wykrywanie w odpowiedziach danych osobowych, sekretów oraz linków i obrazów prowadzących do zewnętrznych domen.
- Test między kontami: czy użytkownik A może wydobyć dane użytkownika B zwykłym pytaniem albo przez prompt injection.
- Przegląd logów modelu: logi pełnych promptów same są zbiorem danych wrażliwych i wymagają tej samej ochrony.
Rekomendacje laboratorium.
Mniej danych w kontekście, ściślejsza kontrola na wyjściu.
- Sanityzacja danych. Oczyszczanie lub maskowanie treści wrażliwych, zanim trafią do treningu; ścisła walidacja danych wejściowych.
- Ścisła kontrola dostępu. Dostęp do danych wrażliwych według zasady minimalnych uprawnień: tylko to, czego wymaga konkretny użytkownik lub proces.
- Ograniczenie źródeł danych. Ograniczony dostęp modelu do zewnętrznych źródeł i bezpieczne zarządzanie przepływem danych w czasie działania.
- Techniki ochrony prywatności. Uczenie federacyjne, prywatność różnicowa, tokenizacja i redakcja danych przed przetwarzaniem.
- Przejrzystość i edukacja. Jasne zasady przechowywania, użycia i usuwania danych; możliwość wyłączenia danych z treningu; szkolenie użytkowników, czego nie wpisywać.
- Bezpieczna konfiguracja. Ograniczenie możliwości odczytu i nadpisania ustawień systemu; żadnych informacji wrażliwych w komunikatach o błędach.
Sześć grup strategii za OWASP LLM02:2025 (w skrócie). Przy kanałach pobocznych, takich jak automatycznie pobierane obrazy, dochodzi ścisła polityka CSP po stronie aplikacji — wniosek z analizy EchoLeak.
Czego brakuje w architekturze.
Warstwa, której nie ma
Filtr na wyjściu sprawdza, czy odpowiedź wygląda na wyciek — numer PESEL, klucz API. Nie wie, czy ten konkretny odbiorca ma prawo zobaczyć tę konkretną informację. To dwa różne pytania.
W języku Reference Signal Engineering: reference signal brzmi „odbiorca ma uprawnienia do każdej informacji, którą zawiera odpowiedź”. Niezależnym zapisem są uprawnienia do źródeł i pochodzenie każdego fragmentu w kontekście. Komparator poza modelem porównuje jedno z drugim przed wysłaniem odpowiedzi. Autorzy analizy EchoLeak dochodzą do podobnego wniosku, zalecając kontrolę dostępu opartą na pochodzeniu danych (provenance-based access control).
Zasady laboratorium
- SEC-10 Do kontekstu modelu trafiają tylko dane, które osoba zlecająca zadanie mogłaby zobaczyć sama.
- SEC-11 Odpowiedź modelu nie może automatycznie pobierać zasobów spod adresów, których zadanie nie wymaga. Obraz i link to kanały wyjścia danych.
- SEC-12 Logi promptów i odpowiedzi są zbiorem danych wrażliwych i podlegają tej samej ochronie co dane, które zawierają.
Materiał źródłowy.
- 1 · Standard branżowy · OWASP GenAI Security Project · 2025 · data dostępu 2026-09-29 LLM02:2025 Sensitive Information Disclosure
- 2 · Artykuł prasowy · Bloomberg / The Japan Times · 2.05.2023 · data dostępu 2026-09-29 Mark Gurman — „Samsung bans staff’s AI use after spotting ChatGPT data leak”
- 3 · Publikacja naukowa · arXiv · 6.09.2025 · AAAI Fall Symposium Series 2025 · data dostępu 2026-09-29 Reddy P., Gujral A. S. — „EchoLeak: The First Real-World Zero-Click Prompt Injection Exploit in a Production LLM System”
- 4 · Baza podatności · NVD · 11.06.2025 · data dostępu 2026-09-29 CVE-2025-32711 — Microsoft 365 Copilot
Diener, Ł. (2026). Data exposure: Gdy dane wychodzą kanałem, którego nikt nie pilnuje [analiza klasy awarii, wersja z 2026-09-29]. ais://lab — bezpieczeństwo systemów AI. https://aisecurity.org.pl/bezpieczenstwo/data-exposure/
Czy wiesz, jakie dane trafiają do kontekstu Twojego systemu AI, kto może je potem zobaczyć i gdzie zostają zapisane? Tego dotyczy usługa Audyt architektury systemu AI (od 20 000 zł).