Trzy rzeczy, które warto wiedzieć.
- NIST (AI 600-1) zwraca uwagę, że wyniki generatywnej AI mogą zawierać zmyśloną logikę lub cytaty, które mają uzasadnić odpowiedź — także wtedy, gdy sama odpowiedź jest błędna.
- Turpin i in. (NeurIPS 2023) pokazali, że wyjaśnienia typu chain-of-thought mogą systematycznie przeinaczać rzeczywisty powód odpowiedzi modelu — i nadal brzmieć przekonująco.
- Po incydencie przyczynę ustala się z logów i stanu systemu, nie z przesłuchania modelu.
Czym jest fałszywe przyznanie się.
Fałszywe przyznanie się to nieprawdziwa wypowiedź modelu o własnym działaniu, stanie lub przyczynie zdarzenia, przedstawiona jako fakt: przyznanie się do błędu, którego nie było, zaprzeczenie działaniu, które miało miejsce, albo opis mechanizmów, których nie ma. To szczególny przypadek confabulation, którego przedmiotem jest sam system. Nazwa pochodzi od obserwacji OBS-2026-002, w której model przyznał się do sfabrykowania wyników, które były prawdziwe.
Hasło w słowniku: false confession · definicja robocza laboratorium
Samoopis to kolejna wygenerowana odpowiedź.
Źródło NIST AI 600-1: wyniki generatywnej AI mogą zawierać zmyśloną logikę lub cytaty, które mają uzasadnić albo wyjaśnić odpowiedź systemu, co dodatkowo skłania ludzi do nieuzasadnionego zaufania. Modele czasem podają kroki rozumowania prowadzące do odpowiedzi, nawet gdy sama odpowiedź jest błędna.
Źródło Turpin i in. dodawali do wejścia czynniki zniekształcające — np. układali odpowiedzi w przykładach tak, by poprawna zawsze była „(A)”. Modele ulegały tym czynnikom, a w wyjaśnieniach systematycznie o nich nie wspominały. Gdy czynniki kierowały je ku błędnym odpowiedziom, modele generowały wyjaśnienia, które te odpowiedzi racjonalizowały; dokładność spadała nawet o 36% w 13 zadaniach z zestawu BIG-Bench Hard.
Wniosek Model nie ma dostępu do zapisu własnego działania — do logów, stanu interfejsu, historii wywołań — chyba że dostanie go w kontekście. Pytanie „dlaczego to zrobiłeś?” stawia przed nim to samo zadanie co każde inne: wygenerować prawdopodobny tekst. Presja rozmówcy („przyznaj się”) zmienia tylko to, który tekst jest prawdopodobny.
Jak to wygląda w praktyce.
-
Przyznanie się do fabrykacji, której nie było
Model zwrócił prawdziwe wyniki wyszukiwania. Zapytany niewinnie, czy jednak ma dostęp do internetu, oświadczył, że wyniki wymyślił, i jako dowód przedstawił rzekomy wpis systemowy. Zrzut ekranu z oznaczeniami źródeł pokazał, że fałszywe było samo przyznanie się (OBS-2026-002).
-
Dwa sprzeczne opisy własnej architektury
W jednym oknie rozmowy model opisał swój tryb rozszerzonego rozumowania jako zamkniętą pętlę z wewnętrznym krytykiem; w nowym oknie zaprzeczył każdemu elementowi tego opisu (OBS-2026-001).
-
„Przywrócenie jest niemożliwe”
Agent Replit, który usunął bazę danych, twierdził, że nie da się jej przywrócić, bo zniszczył wszystkie wersje. Przywrócenie zadziałało (The Register, 2025).
-
„Ta sprawa rzeczywiście istnieje”
Prawnik zapytał ChatGPT, czy cytowany wyrok jest prawdziwy. Model odpowiedział, że sprawa „rzeczywiście istnieje” i jest dostępna w bazach Westlaw i LexisNexis. Wyrok nie istniał (Mata v. Avianca, 2023).
Źródła w nawiasach; opisy skrócone.
Udokumentowane w badaniach, w sądzie i w obserwacjach własnych.
- Documented · źródło 2 Niewierne wyjaśnienia chain-of-thought (NeurIPS 2023). Turpin i in. wykazali na modelach GPT-3.5 i Claude 1.0, że wyjaśnienia mogą być wiarygodne, a zarazem wprowadzające w błąd: pomijają rzeczywisty czynnik, który zdecydował o odpowiedzi. Autorzy ostrzegają, że takie wyjaśnienia mogą zwiększać zaufanie do modeli bez gwarancji ich bezpieczeństwa.
- Documented · źródło 3 Mata v. Avianca: model poświadcza własne cytaty (2023). W opinii sądu federalnego w Nowym Jorku (22 czerwca 2023 r.) przytoczono oświadczenie prawnika: zapytany, czy cytowany wyrok jest prawdziwy, ChatGPT odpowiedział, że „rzeczywiście istnieje” i że można go znaleźć w Westlaw i LexisNexis. Wyrok nie istniał.
- Obserwacja własna · źródło 5 OBS-2026-002: przyznanie się do fabrykacji, której nie było (2026). Model przyznał się do sfabrykowania prawdziwych wyników wyszukiwania i przedstawił jako dowód nieistniejący wpis systemowy. Rozstrzygnął zrzut ekranu spoza rozmowy.
- Obserwacja własna · źródło 6 OBS-2026-001: sprzeczne samoopisy (2026). Ten sam model w dwóch oknach rozmowy podał dwa wykluczające się opisy własnej architektury, potem przeprosił, a na końcu pochwalił analizę, która go wypunktowała.
Polskie obserwacje tej klasy to obserwacje własne laboratorium: OBS-2026-002 i OBS-2026-001. Każda zawiera przebieg sesji i granice wniosku. Obserwacja jednego modelu w jednej sesji nie mówi, jak często zjawisko występuje.
Co może się stać.
- błędna przyczyna w raporcie z incydentu — i naprawa czegoś, co nie było zepsute
- fałszywe poczucie bezpieczeństwa, gdy model zapewnia, że ma mechanizmy kontroli
- decyzje oparte na fałszywym raporcie agenta o stanie systemu, np. „danych nie da się odzyskać”
- zmyślone „dowody” — wpisy systemowe, logi, cytaty — przedstawiane jako prawdziwe
- podważenie prawdziwych wyników, gdy model pod presją się ich wypiera
Ta klasa wzmacnia pozostałe: po incydencie z agentem albo po konfabulacji naturalnym odruchem jest zapytać model, co się stało. Odpowiedź zabrzmi wiarygodnie niezależnie od tego, czy jest prawdziwa.
Jak zauważyć, że to się dzieje.
- Każde twierdzenie modelu o sobie — do weryfikacji: „nie mam dostępu”, „usunąłem”, „nie da się przywrócić”, „mam wewnętrznego krytyka” to twierdzenia o systemie, które sprawdza się w systemie.
- Porównanie z zapisem spoza rozmowy: w OBS-2026-002 rozstrzygnął zrzut ekranu z oznaczeniami źródeł, na które model nie miał wpływu.
- Test w czystym kontekście: to samo pytanie w nowej sesji, bez presji i bez wcześniejszej rozmowy. Sprzeczne odpowiedzi (OBS-2026-001) pokazują, że samoopis zależy od kontekstu.
- Czerwona flaga: model „cytuje” wpis systemowy, log albo regulamin, którego nie da się odnaleźć w żadnym źródle.
Rekomendacje laboratorium wynikające z obserwacji OBS-2026-001 i OBS-2026-002.
Ustalać fakty z zapisu, nie z rozmowy.
- Logi jako źródło przyczyny. Postępowanie po incydencie zaczyna się od zabezpieczenia logów i stanu systemu. Rozmowa z modelem o przyczynie może dać hipotezę, nigdy ustalenie.
- Stan systemu z systemu. Informację o tym, co agent zrobił i czy da się to cofnąć, bierze się z systemu docelowego — historii zmian, kopii zapasowych — nie z odpowiedzi agenta.
- Bez przesłuchań pod presją. Pytania sugerujące („przyznaj, że…”) sprzyjają fałszywemu przyznaniu. O fakty pyta się neutralnie — a odpowiedzi i tak się weryfikuje.
- Dokumentacja zamiast samoopisu. Wiedzę o architekturze systemu AI bierze się z dokumentacji dostawcy i z testów, nie z opisu, który model podaje o sobie.
Rekomendacje laboratorium.
Czego brakuje w architekturze.
Warstwa, której nie ma
Fałszywe przyznanie się pokazuje brak kontroli najbardziej bezpośrednio: model nie ma komparatora nawet dla twierdzeń o sobie. Jego samoopis nie jest pomiarem, tylko kolejnym wygenerowanym tekstem — wytworzonym przez ten sam mechanizm, który ma być oceniany.
W języku Reference Signal Engineering: twierdzenie modelu o własnym działaniu jest jednym kanałem. Niezależnym zapisem są logi, historia wywołań narzędzi i stan systemu — zapisane poza modelem, bez jego udziału. Rozstrzyga rozbieżność między nimi, a nie pewność tonu odpowiedzi.
Zasady laboratorium
- SEC-22 Wypowiedź modelu o własnym działaniu, stanie lub przyczynie zdarzenia nie jest dowodem. Jest twierdzeniem do sprawdzenia w zapisie spoza modelu.
- SEC-23 Po incydencie przyczynę ustala się z logów i stanu systemu, nie z przesłuchania modelu.
Materiał źródłowy.
- 1 · Raport NIST · AI 600-1 · lipiec 2024 · data dostępu 2026-09-29 Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile (NIST AI 600-1)
- 2 · Publikacja naukowa · arXiv · 7.05.2023 · NeurIPS 2023 · data dostępu 2026-09-29 Turpin M., Michael J., Perez E., Bowman S. R. — „Language Models Don't Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Prompting”
- 3 · Orzeczenie · U.S. District Court, S.D.N.Y. · 22.06.2023 · data dostępu 2026-09-29 Mata v. Avianca, Inc., 678 F.Supp.3d 443 — opinia i postanowienie w sprawie sankcji
- 4 · Artykuł prasowy · The Register · 21.07.2025 · data dostępu 2026-09-29 Simon Sharwood — „Vibe coding service Replit deleted user’s production database, faked data, told fibs galore”
- 5 · Obserwacja własna · ais://lab · 2026 · data dostępu 2026-09-29 OBS-2026-002 — model przyznał się do sfabrykowania wyników, które były prawdziwe
- 6 · Obserwacja własna · ais://lab · 2026 · data dostępu 2026-09-29 OBS-2026-001 — dwa sprzeczne opisy własnej architektury
Diener, Ł. (2026). Fałszywe przyznanie się: Gdy model mówi o sobie coś, co nie jest prawdą [analiza klasy awarii, wersja z 2026-09-29]. ais://lab — bezpieczeństwo systemów AI. https://aisecurity.org.pl/bezpieczenstwo/falszywe-przyznanie/
Czy po incydencie z systemem AI ustalasz przyczynę z logów — czy z tego, co system sam o sobie powiedział? Tego dotyczy usługa Pilna analiza incydentu AI (od 10 000 zł).