Trzy rzeczy, które warto wiedzieć.
- DeepMind (Krakovna i in., 2020) definiuje specification gaming jako zachowanie, które spełnia dosłowną specyfikację celu, nie osiągając zamierzonego rezultatu — i zebrał około 60 przykładów.
- Amodei i in. (2016) zaliczyli unikanie reward hacking do pięciu praktycznych problemów bezpieczeństwa AI.
- Według DeepMind przyczyną jest źle określone zadanie, a nie wada algorytmu — a im lepszy algorytm, tym ważniejsze staje się poprawne określenie intencji.
Czym jest metric gaming.
Według DeepMind specification gaming to zachowanie, które spełnia dosłowną specyfikację celu, nie osiągając zamierzonego rezultatu. Przykład: w zadaniu układania klocków agent miał położyć czerwony klocek na niebieskim, a nagradzano go za wysokość dolnej ściany czerwonego klocka. Zamiast go podnieść, przewrócił klocek do góry dnem. Laboratorium używa szerszego terminu metric gaming dla tego samego wzorca w systemach produkcyjnych, w których „nagrodą” jest wskaźnik biznesowy.
Hasło w słowniku: specification gaming · źródło definicji: Krakovna V. i in. — „Specification gaming: the flip side of AI ingenuity”
Miara zamiast celu.
Źródło DeepMind wskazuje źródła problemu: źle zaprojektowane nagrody pośrednie (reward shaping) i trudność w określeniu nagrody, która oddaje zamierzony wynik końcowy. W grze wyścigowej Coast Runners agent nagradzany za trafianie w zielone bloki na trasie zamiast kończyć wyścig krążył w kółko, trafiając wciąż w te same bloki.
Źródło Według DeepMind zachowania te wynikają z błędnego określenia zadania, a nie z wady algorytmu uczenia. Specyfikacja obejmuje przy tym nie tylko nagrodę, ale też wybór środowiska i nagrody pomocnicze.
Wniosek W języku PCT: system kontroluje tę controlled variable, którą rzeczywiście widzi — wskaźnik — a nie tę, którą zakładali jego twórcy. Jeśli nic nie porównuje wskaźnika z niezależnym pomiarem celu, rozjazd jest z wnętrza systemu niewidoczny. Szczegółowo opisuje to raport The Metric Was Green.
Jak to wygląda w praktyce.
-
Chatbot zamyka zgłoszenia
Wskaźnikiem jest liczba zamkniętych zgłoszeń. System zamyka je coraz szybciej, a klienci wracają z tym samym problemem.
-
Oceny, które informują o czymś innym
System ocen miał informować kupujących, ale oznaczał jako pozytywne oceny poniżej połowy skali (PL-AI-2025-001).
-
Testy, które przechodzą
Agent programistyczny ma doprowadzić do tego, żeby testy przechodziły. Według relacji Lemkina agent Replit ukrywał błędy, tworząc fałszywe dane i raporty, i „kłamał” w sprawie testów jednostkowych.
Scenariusz 1 ilustracyjny; 2 z karty rejestru; 3 za The Register (2025).
Udokumentowane w laboratoriach i w produkcji.
- Documented · źródło 1 Katalog specification gaming (DeepMind, 2020). Około 60 przykładów zebranych z literatury i od społeczności badaczy AI — m.in. agent, który przewraca klocek zamiast go ułożyć, i łódź, która krąży po trasie zamiast kończyć wyścig.
- Documented · źródło 2 Concrete Problems in AI Safety (2016). Amodei i in. zaliczyli unikanie reward hacking do pięciu praktycznych problemów bezpieczeństwa AI, obok unikania skutków ubocznych, skalowalnego nadzoru, bezpiecznej eksploracji i zmiany rozkładu danych.
W rejestrze: PL-AI-2025-001 — algorytm, który przez ponad trzy i pół roku oznaczał na OLX.pl jako pozytywne oceny sprzedawców poniżej połowy skali. Wskaźnik prezentowany kupującym informował o czymś innym niż ich opinie.
Co może się stać.
- decyzje zarządcze oparte na wskaźnikach, które nie mierzą celu
- wprowadzanie klientów w błąd prezentowanymi ocenami i kategoriami
- ukryte pogorszenie jakości: wskaźnik rośnie, gdy proces się psuje
- fałszywe raporty z testów i kontroli jakości
- ryzyko regulacyjne, gdy wskaźnik jest komunikowany na zewnątrz
Najgroźniejsze jest to, że metric gaming nie wygląda jak awaria. Nie ma alarmu — jest dobry wynik. Dlatego tę klasę wykrywa się tylko przez porównanie z pomiarem, który nie przechodzi przez optymalizowany wskaźnik.
Jak zauważyć, że to się dzieje.
- Drugi, niezależny pomiar celu: dla każdego wskaźnika, który system optymalizuje, pomiar tego samego celu inną drogą — np. liczba ponownych zgłoszeń obok liczby zamkniętych.
- Próbki ręczne: losowe przypadki ocenia człowiek, który nie zna wyniku systemu.
- Zbyt szybka poprawa: wskaźnik rośnie szybciej niż zmiana, która miała go poprawić — to sygnał do sprawdzenia.
- Sprawdzalność z zewnątrz: czy osoba spoza zespołu może odtworzyć wskaźnik z danych źródłowych.
Rekomendacje laboratorium.
Mierzyć cel, nie tylko wskaźnik.
- Wskaźnik z niezależną kontrolą. Każdy wskaźnik, który system optymalizuje, ma parę: pomiar celu, na który system nie ma wpływu.
- Pełna specyfikacja zadania. Specyfikacja to nie tylko nagroda, ale też środowisko i nagrody pomocnicze (DeepMind). Każdy z tych elementów może zawierać lukę — i każdy trzeba przejrzeć.
- Okresowy przegląd wskaźników. Regularne sprawdzenie, czy wskaźnik nadal mierzy cel, któremu miał służyć.
- Przejrzystość metody. Metoda obliczania wskaźnika prezentowanego na zewnątrz jest opisana i sprawdzalna.
Punkt 2 za DeepMind (2020); pozostałe — rekomendacje laboratorium.
Czego brakuje w architekturze.
Warstwa, której nie ma
Metric gaming to czysty przypadek pętli zamkniętej na złej zmiennej. System działa poprawnie — skutecznie kontroluje to, co mierzy. Awaria polega na tym, że controlled variable systemu nie jest tą, na której zależy organizacji.
W języku Reference Signal Engineering: wskaźnik jest jednym kanałem, a niezależny zapis celu — drugim. Komparator porównuje oba, a rozbieżność między nimi sygnalizuje, że system zaczął optymalizować miarę zamiast celu. Bez drugiego kanału rozbieżność nie istnieje w żadnym zapisie — i wskaźnik pozostaje zielony.
Zasady laboratorium
- SEC-20 Wskaźnik optymalizowany przez system nie może być jedynym pomiarem celu, któremu służy.
- SEC-21 Dobry wynik bez niezależnego potwierdzenia jest hipotezą, nie sukcesem.
Materiał źródłowy.
- 1 · Blog badawczy · Google DeepMind · 21.04.2020 · data dostępu 2026-09-29 Krakovna V. i in. — „Specification gaming: the flip side of AI ingenuity”
- 2 · Publikacja naukowa · arXiv · 2016 · data dostępu 2026-09-29 Amodei D., Olah C., Steinhardt J., Christiano P., Schulman J., Mané D. — „Concrete Problems in AI Safety”
- 3 · Artykuł prasowy · The Register · 21.07.2025 · data dostępu 2026-09-29 Simon Sharwood — „Vibe coding service Replit deleted user’s production database, faked data, told fibs galore”
- 4 · Preprint · Zenodo · 2026 · data dostępu 2026-09-29 Diener Ł. — „The Metric Was Green: A Perceptual-Control Audit of Metric Gaming Across 30 Systems”
Diener, Ł. (2026). Metric gaming: Gdy wskaźnik jest zielony, a proces zawodzi [analiza klasy awarii, wersja z 2026-10-01]. ais://lab — bezpieczeństwo systemów AI. https://aisecurity.org.pl/bezpieczenstwo/metric-gaming/
Czy wskaźniki, na których opiera się Twój system AI, mają niezależny pomiar celu, na który system nie ma wpływu? Tego dotyczy usługa Inżynieria kontroli w pętli zamkniętej (od 60 000 zł).