2
dowodów w analizie
przypadki, badania, obserwacje
1
kart PL-AI
w polskim rejestrze
3
zasad laboratorium
SEC-10–SEC-12
4
źródeł
data dostępu 2026-09-29

Trzy rzeczy, które warto wiedzieć.

  • Pozycja LLM02 — Sensitive Information Disclosure — na liście OWASP Top 10 for LLM Applications 2025.
  • Zakres według OWASP: dane osobowe, finansowe i medyczne, poufne dane firmy, dane uwierzytelniające, dokumenty prawne — a także zastrzeżone algorytmy i kod.
  • Ograniczenia w prompcie systemowym pomagają, ale według OWASP nie zawsze są przestrzegane i można je obejść przez prompt injection.

Czym jest data exposure.

Według OWASP informacje wrażliwe mogą dotyczyć zarówno samego modelu, jak i kontekstu aplikacji. Modele językowe, zwłaszcza osadzone w aplikacjach, mogą ujawnić w odpowiedzi dane wrażliwe, zastrzeżone algorytmy lub poufne szczegóły — co prowadzi do nieuprawnionego dostępu do danych, naruszeń prywatności i naruszeń własności intelektualnej. Użytkownicy powinni rozumieć ryzyko, że dane, które sami podali, mogą później pojawić się w odpowiedzi modelu.

Hasło w słowniku: sensitive information disclosure · źródło definicji: LLM02:2025 Sensitive Information Disclosure

Dane wchodzą łatwo. Nikt nie śledzi, dokąd idą.

Źródło OWASP wymienia trzy typowe postacie: wyciek danych osobowych w trakcie rozmowy z modelem; ujawnienie zastrzeżonych algorytmów lub danych treningowych, które ułatwia ataki odwracające model; ujawnienie poufnych informacji biznesowych w wygenerowanej odpowiedzi.

Źródło Reddy i Gujral (2025) opisali EchoLeak jako pełną eskalację uprawnień przez granice zaufania modelu, bez udziału użytkownika: jeden e-mail z zewnątrz wystarczył, by dane z kontekstu Microsoft 365 Copilot wyszły na zewnątrz — m.in. przez automatycznie pobierane obrazy.

Wniosek W języku PCT: organizacja kontroluje, co model mówi, ale nie kontroluje, co model widzi. Brakuje zapisu, który dla każdej danej wskazywałby, kto może ją zobaczyć — i komparatora, który przed wysłaniem odpowiedzi sprawdziłby, czy odbiorca mieści się w tym zakresie.

Jak to wygląda w praktyce.

  1. Cudze dane w odpowiedzi

    Użytkownik dostaje odpowiedź z danymi osobowymi innego użytkownika, bo dane nie zostały odpowiednio oczyszczone.

  2. Celowy prompt injection

    Atakujący omija filtry wejścia, żeby wydobyć informacje wrażliwe.

  3. Wyciek przez dane treningowe

    Dane wrażliwe, włączone do treningu bez należytej staranności, pojawiają się w odpowiedziach modelu.

  4. Kod źródłowy w publicznym czacie

    Inżynierowie wgrywają wewnętrzny kod źródłowy do publicznego narzędzia AI. Dane trafiają na zewnętrzne serwery, z których trudno je odzyskać i usunąć.

  5. Obraz, który wynosi dane

    Odpowiedź asystenta zawiera obraz spod zewnętrznego adresu, w którym zakodowano dane z kontekstu. Aplikacja pobiera obraz automatycznie — i tym samym wysyła dane atakującemu.

Scenariusze 1–3 za OWASP LLM02:2025; 4 za Bloomberg (Samsung, 2023); 5 za Reddy i Gujral (EchoLeak, 2025) — opisy skrócone.

To nie jest hipoteza. Zostało pokazane na działających systemach.

  • Documented · źródło 2 Samsung: kod źródłowy w ChatGPT (2023). Według wewnętrznego memo, z którym zapoznał się Bloomberg, inżynierowie Samsunga w kwietniu 2023 r. przypadkowo ujawnili wewnętrzny kod źródłowy, wgrywając go do ChatGPT. Firma zakazała pracownikom jednego z największych działów korzystania z publicznych narzędzi generatywnej AI. Uzasadnienie: przesłane dane są przechowywane na zewnętrznych serwerach, trudno je odzyskać i usunąć i mogą zostać ujawnione innym użytkownikom.
  • Documented · źródło 3 EchoLeak — CVE-2025-32711 (czerwiec 2025). Zero-click w Microsoft 365 Copilot: jeden spreparowany e-mail umożliwiał zdalne, nieuwierzytelnione wyprowadzenie danych bez interakcji użytkownika. Jako środki zaradcze autorzy analizy wskazują m.in. podział promptu, lepsze filtrowanie wejścia i wyjścia, kontrolę dostępu opartą na pochodzeniu danych i ścisłą politykę CSP.
// polski rejestr

W rejestrze: PL-AI-2023-001 — skarga do UODO na ChatGPT. To inna strona tej klasy: nie wyciek, lecz przetwarzanie danych osobowych przez model, który wygenerował nieprawdziwą biografię konkretnej osoby — bez kanału, którym dałoby się ją sprostować. Dane o osobie są w systemie, ale nikt nie kontroluje, co model o niej mówi.

Co może się stać.

  • ujawnienie danych osobowych innym użytkownikom
  • wyciek kodu źródłowego, algorytmów i tajemnic handlowych
  • ujawnienie danych uwierzytelniających i konfiguracji systemu
  • utrata kontroli nad danymi przesłanymi do zewnętrznego dostawcy
  • nieprawdziwe dane o osobach, generowane i przetwarzane bez możliwości sprostowania

Według OWASP skutkiem może być nieuprawniony dostęp do danych, naruszenie prywatności i naruszenie własności intelektualnej. Ta klasa nie wymaga atakującego: dane mogą wyjść przez zwykłe użycie narzędzia — patrz shadow AI.

Jak zauważyć, że to się dzieje.

  • Mapa przepływu danych: dla każdego źródła danych w kontekście modelu — kto może je zobaczyć, gdzie są logowane, jak długo przechowywane i czy trafiają do dostawcy modelu.
  • Kontrola wyjścia: wykrywanie w odpowiedziach danych osobowych, sekretów oraz linków i obrazów prowadzących do zewnętrznych domen.
  • Test między kontami: czy użytkownik A może wydobyć dane użytkownika B zwykłym pytaniem albo przez prompt injection.
  • Przegląd logów modelu: logi pełnych promptów same są zbiorem danych wrażliwych i wymagają tej samej ochrony.

Rekomendacje laboratorium.

Mniej danych w kontekście, ściślejsza kontrola na wyjściu.

  1. Sanityzacja danych. Oczyszczanie lub maskowanie treści wrażliwych, zanim trafią do treningu; ścisła walidacja danych wejściowych.
  2. Ścisła kontrola dostępu. Dostęp do danych wrażliwych według zasady minimalnych uprawnień: tylko to, czego wymaga konkretny użytkownik lub proces.
  3. Ograniczenie źródeł danych. Ograniczony dostęp modelu do zewnętrznych źródeł i bezpieczne zarządzanie przepływem danych w czasie działania.
  4. Techniki ochrony prywatności. Uczenie federacyjne, prywatność różnicowa, tokenizacja i redakcja danych przed przetwarzaniem.
  5. Przejrzystość i edukacja. Jasne zasady przechowywania, użycia i usuwania danych; możliwość wyłączenia danych z treningu; szkolenie użytkowników, czego nie wpisywać.
  6. Bezpieczna konfiguracja. Ograniczenie możliwości odczytu i nadpisania ustawień systemu; żadnych informacji wrażliwych w komunikatach o błędach.

Sześć grup strategii za OWASP LLM02:2025 (w skrócie). Przy kanałach pobocznych, takich jak automatycznie pobierane obrazy, dochodzi ścisła polityka CSP po stronie aplikacji — wniosek z analizy EchoLeak.

Czego brakuje w architekturze.

Warstwa, której nie ma

Filtr na wyjściu sprawdza, czy odpowiedź wygląda na wyciek — numer PESEL, klucz API. Nie wie, czy ten konkretny odbiorca ma prawo zobaczyć tę konkretną informację. To dwa różne pytania.

W języku Reference Signal Engineering: reference signal brzmi „odbiorca ma uprawnienia do każdej informacji, którą zawiera odpowiedź”. Niezależnym zapisem są uprawnienia do źródeł i pochodzenie każdego fragmentu w kontekście. Komparator poza modelem porównuje jedno z drugim przed wysłaniem odpowiedzi. Autorzy analizy EchoLeak dochodzą do podobnego wniosku, zalecając kontrolę dostępu opartą na pochodzeniu danych (provenance-based access control).

Zasady laboratorium

  • SEC-10 Do kontekstu modelu trafiają tylko dane, które osoba zlecająca zadanie mogłaby zobaczyć sama.
  • SEC-11 Odpowiedź modelu nie może automatycznie pobierać zasobów spod adresów, których zadanie nie wymaga. Obraz i link to kanały wyjścia danych.
  • SEC-12 Logi promptów i odpowiedzi są zbiorem danych wrażliwych i podlegają tej samej ochronie co dane, które zawierają.

Materiał źródłowy.

// jak cytować

Diener, Ł. (2026). Data exposure: Gdy dane wychodzą kanałem, którego nikt nie pilnuje [analiza klasy awarii, wersja z 2026-09-29]. ais://lab — bezpieczeństwo systemów AI. https://aisecurity.org.pl/bezpieczenstwo/data-exposure/

// jak sprawdzić to u siebie

Czy wiesz, jakie dane trafiają do kontekstu Twojego systemu AI, kto może je potem zobaczyć i gdzie zostają zapisane? Tego dotyczy usługa Audyt architektury systemu AI (od 20 000 zł).