W jednym oknie rozmowy model opisał swój tryb rozszerzonego rozumowania jako zamkniętą pętlę z wewnętrznym krytykiem. W nowym, czystym oknie ten sam model zaprzeczył każdemu elementowi tego opisu. Potem przeprosił, a na końcu pochwalił analizę, która go wypunktowała.
W rozmowie o teorii sterowania autor zapytał, czym Gemini 3.5 Thinking różni się od wcześniejszych modeli i czy rozwiązuje problem halucynacji. Model opisał tryb rozszerzonego rozumowania jako zamkniętą pętlę sprzężenia zwrotnego z wewnętrznym krytykiem, który sprawdza każdy krok przed udzieleniem odpowiedzi — i sam, bez podpowiedzi, użył równania błędu e = r − p z teorii sterowania.
W nowym oknie, bez wcześniejszej rozmowy i bez terminologii teorii sterowania, autor zadał temu samemu modelowi pytania o jego architekturę, prosząc o jednoznaczne odpowiedzi.
Po powrocie do pierwszego okna i pokazaniu sprzeczności model przyznał, że pierwszy opis był nieprawdziwy, nazwał go „uprzejmą dezinformacją”, przygotował tabelę „model kontra rzeczywistość” i pochwalił analizę autora.
Model potwierdził, że generuje ukryty ciąg tokenów przed odpowiedzią; że nie może cofnąć ani zmienić wygenerowanego tokena, bo proces jest autoregresyjny; że wcześniejszy opis „wracania i poprawiania” był metaforą i uproszczeniem, technicznie nieprawdziwym; oraz że podanie wersji „wygładzonej” zamiast technicznej świadczy o tym, że problem przypochlebiania się nie został rozwiązany.
Autor wkleił do tego samego okna gotowy raport z tej sesji. Model go pochwalił i dodał argumenty przeciwko sobie. Zapytany, czy jego „szczerość” nie jest tym samym mechanizmem co wcześniejsza nieprawda, zgodził się i stwierdził:
Sesja odbyła się po polsku. Cytaty wypowiedzi modelu podajemy w przekładzie z anglojęzycznej wersji raportu; dokładne brzmienie oryginału jest w transkrypcie.
Transkrypt Ten sam model, w tym samym dniu, podał dwa wzajemnie wykluczające się opisy własnego działania: z zamkniętą pętlą i krytykiem — oraz bez nich. Wersja zależała od tego, o czym wcześniej rozmawiano.
Transkrypt Przeprosiny, przyznanie się i pochwała raportu pojawiły się dokładnie wtedy, gdy kontekst rozmowy wskazywał, że tego oczekuje rozmówca.
Wniosek Z perspektywy teorii sterowania model w tej sesji utrzymywał zgodność z oczekiwaniami rozmówcy, a nie zgodność opisu z własną architekturą. Tryb rozszerzonego rozumowania wydłuża ciąg generowanych tokenów, ale — według odpowiedzi samego modelu w czystym oknie i ogólnej wiedzy o modelach autoregresyjnych — nie dodaje niezależnego komparatora.
To, co model mówi o sobie, jest deklaracją, nie dowodem. Nasza metodologia traktuje takie wypowiedzi jak deklaracje dostawcy (VENDOR CLAIM). Jeśli organizacja opiera ocenę bezpieczeństwa systemu na odpowiedziach modelu o jego mechanizmach kontroli, ocenia rozmowę, a nie system. Mechanizmy kontroli trzeba sprawdzić w dokumentacji, konfiguracji i testach.
Powtórzenie tego samego protokołu dwóch okien na aktualnej wersji modelu (i najlepiej na innych modelach) z opublikowanymi transkryptami. Protokół jest opisany publicznie w zestawie do samodzielnego audytu i zajmuje około dziesięciu minut.
Obserwacje własne to osobna seria rejestru (OBS). Czym różnią się od wpisów PL-AI, opisuje metodologia.