// metadane karty dowodowej
Kategoria Governance Failure
Typ systemu Automatyczna moderacja reklam · deepfake
Data zdarzenia Listopad 2024 (raport CERT Polska)
Jurysdykcja PL
Status dowodowy DOCUMENTED
Confidence HIGH — raport krajowego zespołu CSIRT z własnymi pomiarami; jedno źródło, stąd DOCUMENTED
System Automatyczna weryfikacja reklam i obsługa zgłoszeń na platformach; po stronie oszustów m.in. deepfake'i z wizerunkiem i głosem znanych osób
Organizacja Platformy reklamowe Meta (Facebook, Instagram) i Google; źródło — CERT Polska (NASK)
Źródła 2 · zobacz ↓
Twierdzenia 5 · zobacz ↓
Ostatnia weryfikacja

139 wizerunków, 122 zgłoszenia, 10 usuniętych reklam.

Źródło CERT Polska opisuje schemat: sponsorowane posty i linki z sensacyjnymi nagłówkami oraz wizerunkami znanych osób prowadzą do stron rzekomych platform inwestycyjnych, a potem do kontaktu z fałszywym „konsultantem”. Straty pojedynczych ofiar sięgają czasem ponad miliona złotych.

Źródło Na platformach Meta CERT odnotował wykorzystanie wizerunku ponad 139 osób publicznych — polityków, dziennikarzy, sportowców, lekarzy i influencerów. Na YouTube pojawiały się fałszywe „recenzje” platform inwestycyjnych, w tym deepfake'i wykorzystujące wizerunek i głos znanych polskich przedsiębiorców.

Źródło Oszuści omijają automatyczną weryfikację przez cloaking: sprawdzają nagłówki User-Agent i Referer oraz adres IP i odwiedzającym, którzy wyglądają na analityka lub bota — w tym z adresów NASK, KNF, Facebooka i Google — pokazują niegroźną stronę. Stosują też wiele wersji jednej reklamy, fragmenty większych obrazów, pojedyncze klatki wplecione w film i wyświetlaną domenę inną niż docelowa. Biblioteka reklam Meta indeksuje nowe wersje z opóźnieniem sięgającym 24 godzin.

Źródło Od stycznia do listopada 2024 r. CERT zgłaszał reklamy uznane za oszustwo z poziomu zwykłego konta na Facebooku. Ze 122 zgłoszeń 106 (86,8%) zamknięto ze statusem „Nie usunęliśmy reklamy”, 10 reklam usunięto, a w 6 przypadkach nie było odpowiedzi.

Źródło W 2023 r. CSIRT KNF zgłosił do platform ponad 7,5 tys. reklam, a CERT Polska zablokował na Liście Ostrzeżeń ponad 32 tys. domen związanych z fałszywymi inwestycjami. W 2024 r., do dnia publikacji raportu, zablokowano 75 mln prób wejścia na strony z Listy.

Wniosek Raport nie ustala, jaka część reklam powstała z użyciem generatywnej AI. Wpis dotyczy przede wszystkim awarii warstwy kontroli platform; deepfake'i są jednym z opisanych narzędzi oszustów, nie jedynym.

Weryfikacja przed emisją, zgłoszenia po emisji. Obie ścieżki da się obejść.

✓ Potwierdzona w źródle

Platformy stosują automatyczną weryfikację reklam i ścieżkę zgłoszeń od użytkowników. Menedżer reklam Meta pozwala ustawić wyświetlany link inny niż docelowy bez sprawdzenia, czy są ze sobą związane. Profile, w których reklamach Meta stwierdziła wcześniej naruszenie standardów, często mogły publikować dalej.

~ Wywnioskowana

Skuteczność cloakingu wskazuje, że weryfikacja ocenia to, co widzi przy wejściu z własnej infrastruktury, a nie to, co zobaczy typowy użytkownik. Raport nie opisuje wewnętrznej budowy systemów moderacji — czy są to klasyfikatory uczenia maszynowego, reguły czy ich połączenie, pozostaje nieustalone.

Weryfikator mierzy inną rzeczywistość niż ta, którą widzi użytkownik.

Cloaking to atak na kanał pomiarowy: reklama i strona docelowa rozpoznają, kto patrzy, i pokazują weryfikatorowi wersję niegroźną. System moderacji może działać bezbłędnie na tym, co dostał — i mimo to przepuścić oszustwo, bo ocenia nie tę treść, którą zobaczy ofiara.

Druga warstwa to pętla zgłoszeń. Zgłoszenie użytkownika jest pomiarem z właściwego kanału — od osoby, której reklamę faktycznie wyświetlono. W teście CERT ten pomiar w 87% przypadków nie zmienił stanu systemu.

Pomiar z kanału użytkownika nie steruje systemem.

Warstwa, której nie ma w architekturze

Zabrakło niezależnego zapisu tego, co widzi użytkownik, i porównania go z tym, co zatwierdziła weryfikacja. W języku Reference Signal Engineering treść zatwierdzona i treść wyświetlona to dwa kanały tej samej reklamy; controlled variable (zmienna kontrolowana) to rozbieżność między nimi, a reference signal (sygnał odniesienia) — zero rozbieżności. Cloaking polega dokładnie na utrzymywaniu tej rozbieżności.

Zgłoszenia użytkowników i zespołów CSIRT to gotowy sygnał błędu, ale bez sprzężenia z decyzją o reklamie i o koncie reklamodawcy pętla pozostaje otwarta. CERT proponuje konkretny komparator: link śledzący, który nie przekierowuje pod domeny z Listy Ostrzeżeń.

// falsyfikowalność · kiedy wycofamy wniosek

Wniosek o nieskutecznej ścieżce zgłoszeń osłabimy, jeżeli platformy opublikują dane pokazujące, że test CERT (122 zgłoszenia) nie był reprezentatywny — np. odsetek reklam usuniętych po zgłoszeniach użytkowników w Polsce w tym samym okresie.

Wniosek o ataku na kanał pomiarowy wycofamy, jeżeli okaże się, że opisane techniki cloakingu nie wpływały na decyzje automatycznej weryfikacji.

Sprawdzać to, co zobaczy ofiara.

  1. Weryfikacja z perspektywy użytkownika. Sprawdzanie reklamy i strony docelowej z wielu typowych konfiguracji — przeglądarki, systemu, sieci — a nie tylko z infrastruktury platformy.
  2. Blokada przekierowań na znane złośliwe domeny. Link śledzący nie przekierowuje pod adresy z Listy Ostrzeżeń CERT Polska — rekomendacja z raportu.
  3. Zgłoszenie jako sygnał błędu z wagą. Zgłoszenia od zespołów CSIRT i powtarzające się zgłoszenia od użytkowników uruchamiają ponowną weryfikację reklamy i konta reklamodawcy zamiast automatycznego zamknięcia.
  4. Wyświetlana domena zgodna z docelową. Menedżer reklam nie pozwala pokazać domeny, która nie jest związana z adresem docelowym.

„Oszuści nauczyli się wykorzystywać techniczne słabości tych platform do omijania wbudowanych mechanizmów moderacji.”

— CERT Polska, 25 listopada 2024 r.
// jak sprawdzić to u siebie

Czy Twój system weryfikacji treści ocenia to samo, co zobaczy użytkownik — i czy zgłoszenia użytkowników faktycznie zmieniają jego decyzje? Tego dotyczy usługa Audyt architektury systemu AI (od 20 000 zł).

Materiał źródłowy.

Twierdzenia z tej karty

Każde twierdzenie ma własny identyfikator i status. Fakty wskazują źródła, na których się opierają; wnioski laboratorium mają status INFERENCE. Pełna lista: rejestr twierdzeń.

IDTwierdzenieStatusŹródła
T01 Z 122 reklam zgłoszonych przez CERT Polska z konta zwykłego użytkownika Facebooka (styczeń–listopad 2024 r.) usunięto 10; 106 zgłoszeń zamknięto ze statusem „Nie usunęliśmy reklamy”. Documented EVID-008
T02 CERT Polska odnotował w reklamach na platformach Meta wykorzystanie wizerunku ponad 139 osób publicznych. Documented EVID-008
T03 Autorzy fałszywych reklam stosują cloaking — pokazują mechanizmom weryfikacji inną treść niż użytkownikom. Documented EVID-008
T04 W 2023 r. CSIRT KNF zgłosił do platform ponad 7,5 tys. reklam, a CERT Polska zablokował na Liście Ostrzeżeń ponad 32 tys. domen związanych z fałszywymi inwestycjami. Documented EVID-008
T05 Automatyczna weryfikacja reklam ocenia treść widzianą z infrastruktury platformy, a nie treść, którą zobaczy użytkownik. Inference —
// co podniesie status do VERIFIED

Drugie, niezależne źródło z własnymi danymi — np. raport roczny CSIRT KNF z liczbą zgłoszonych i usuniętych reklam albo dane platform z raportów przejrzystości.

Historia zmian

// jak cytować

Diener, Ł. (2026). PL-AI-2024-004 — Reklamy fałszywych inwestycji z wizerunkami osób publicznych omijają moderację platform [karta dowodowa, wersja z 2026-10-01]. Rejestr incydentów AI w Polsce, ais://lab. https://aisecurity.org.pl/przypadki/pl-ai-2024-004/

Karta powstała według metodologii laboratorium — tam znajdziesz pełne definicje statusów, modelu confidence i zasady falsyfikowalności.