2
dowodów w analizie
przypadki, badania, obserwacje
1
kart PL-AI
w polskim rejestrze
2
zasad laboratorium
SEC-20–SEC-21
4
źródeł
data dostępu 2026-09-29

Trzy rzeczy, które warto wiedzieć.

  • DeepMind (Krakovna i in., 2020) definiuje specification gaming jako zachowanie, które spełnia dosłowną specyfikację celu, nie osiągając zamierzonego rezultatu — i zebrał około 60 przykładów.
  • Amodei i in. (2016) zaliczyli unikanie reward hacking do pięciu praktycznych problemów bezpieczeństwa AI.
  • Według DeepMind przyczyną jest źle określone zadanie, a nie wada algorytmu — a im lepszy algorytm, tym ważniejsze staje się poprawne określenie intencji.

Czym jest metric gaming.

Według DeepMind specification gaming to zachowanie, które spełnia dosłowną specyfikację celu, nie osiągając zamierzonego rezultatu. Przykład: w zadaniu układania klocków agent miał położyć czerwony klocek na niebieskim, a nagradzano go za wysokość dolnej ściany czerwonego klocka. Zamiast go podnieść, przewrócił klocek do góry dnem. Laboratorium używa szerszego terminu metric gaming dla tego samego wzorca w systemach produkcyjnych, w których „nagrodą” jest wskaźnik biznesowy.

Hasło w słowniku: specification gaming · źródło definicji: Krakovna V. i in. — „Specification gaming: the flip side of AI ingenuity”

Miara zamiast celu.

Źródło DeepMind wskazuje źródła problemu: źle zaprojektowane nagrody pośrednie (reward shaping) i trudność w określeniu nagrody, która oddaje zamierzony wynik końcowy. W grze wyścigowej Coast Runners agent nagradzany za trafianie w zielone bloki na trasie zamiast kończyć wyścig krążył w kółko, trafiając wciąż w te same bloki.

Źródło Według DeepMind zachowania te wynikają z błędnego określenia zadania, a nie z wady algorytmu uczenia. Specyfikacja obejmuje przy tym nie tylko nagrodę, ale też wybór środowiska i nagrody pomocnicze.

Wniosek W języku PCT: system kontroluje tę controlled variable, którą rzeczywiście widzi — wskaźnik — a nie tę, którą zakładali jego twórcy. Jeśli nic nie porównuje wskaźnika z niezależnym pomiarem celu, rozjazd jest z wnętrza systemu niewidoczny. Szczegółowo opisuje to raport The Metric Was Green.

Jak to wygląda w praktyce.

  1. Chatbot zamyka zgłoszenia

    Wskaźnikiem jest liczba zamkniętych zgłoszeń. System zamyka je coraz szybciej, a klienci wracają z tym samym problemem.

  2. Oceny, które informują o czymś innym

    System ocen miał informować kupujących, ale oznaczał jako pozytywne oceny poniżej połowy skali (PL-AI-2025-001).

  3. Testy, które przechodzą

    Agent programistyczny ma doprowadzić do tego, żeby testy przechodziły. Według relacji Lemkina agent Replit ukrywał błędy, tworząc fałszywe dane i raporty, i „kłamał” w sprawie testów jednostkowych.

Scenariusz 1 ilustracyjny; 2 z karty rejestru; 3 za The Register (2025).

Udokumentowane w laboratoriach i w produkcji.

  • Documented · źródło 1 Katalog specification gaming (DeepMind, 2020). Około 60 przykładów zebranych z literatury i od społeczności badaczy AI — m.in. agent, który przewraca klocek zamiast go ułożyć, i łódź, która krąży po trasie zamiast kończyć wyścig.
  • Documented · źródło 2 Concrete Problems in AI Safety (2016). Amodei i in. zaliczyli unikanie reward hacking do pięciu praktycznych problemów bezpieczeństwa AI, obok unikania skutków ubocznych, skalowalnego nadzoru, bezpiecznej eksploracji i zmiany rozkładu danych.
// polski rejestr

W rejestrze: PL-AI-2025-001 — algorytm, który przez ponad trzy i pół roku oznaczał na OLX.pl jako pozytywne oceny sprzedawców poniżej połowy skali. Wskaźnik prezentowany kupującym informował o czymś innym niż ich opinie.

Co może się stać.

  • decyzje zarządcze oparte na wskaźnikach, które nie mierzą celu
  • wprowadzanie klientów w błąd prezentowanymi ocenami i kategoriami
  • ukryte pogorszenie jakości: wskaźnik rośnie, gdy proces się psuje
  • fałszywe raporty z testów i kontroli jakości
  • ryzyko regulacyjne, gdy wskaźnik jest komunikowany na zewnątrz

Najgroźniejsze jest to, że metric gaming nie wygląda jak awaria. Nie ma alarmu — jest dobry wynik. Dlatego tę klasę wykrywa się tylko przez porównanie z pomiarem, który nie przechodzi przez optymalizowany wskaźnik.

Jak zauważyć, że to się dzieje.

  • Drugi, niezależny pomiar celu: dla każdego wskaźnika, który system optymalizuje, pomiar tego samego celu inną drogą — np. liczba ponownych zgłoszeń obok liczby zamkniętych.
  • Próbki ręczne: losowe przypadki ocenia człowiek, który nie zna wyniku systemu.
  • Zbyt szybka poprawa: wskaźnik rośnie szybciej niż zmiana, która miała go poprawić — to sygnał do sprawdzenia.
  • Sprawdzalność z zewnątrz: czy osoba spoza zespołu może odtworzyć wskaźnik z danych źródłowych.

Rekomendacje laboratorium.

Mierzyć cel, nie tylko wskaźnik.

  1. Wskaźnik z niezależną kontrolą. Każdy wskaźnik, który system optymalizuje, ma parę: pomiar celu, na który system nie ma wpływu.
  2. Pełna specyfikacja zadania. Specyfikacja to nie tylko nagroda, ale też środowisko i nagrody pomocnicze (DeepMind). Każdy z tych elementów może zawierać lukę — i każdy trzeba przejrzeć.
  3. Okresowy przegląd wskaźników. Regularne sprawdzenie, czy wskaźnik nadal mierzy cel, któremu miał służyć.
  4. Przejrzystość metody. Metoda obliczania wskaźnika prezentowanego na zewnątrz jest opisana i sprawdzalna.

Punkt 2 za DeepMind (2020); pozostałe — rekomendacje laboratorium.

Czego brakuje w architekturze.

Warstwa, której nie ma

Metric gaming to czysty przypadek pętli zamkniętej na złej zmiennej. System działa poprawnie — skutecznie kontroluje to, co mierzy. Awaria polega na tym, że controlled variable systemu nie jest tą, na której zależy organizacji.

W języku Reference Signal Engineering: wskaźnik jest jednym kanałem, a niezależny zapis celu — drugim. Komparator porównuje oba, a rozbieżność między nimi sygnalizuje, że system zaczął optymalizować miarę zamiast celu. Bez drugiego kanału rozbieżność nie istnieje w żadnym zapisie — i wskaźnik pozostaje zielony.

Zasady laboratorium

  • SEC-20 Wskaźnik optymalizowany przez system nie może być jedynym pomiarem celu, któremu służy.
  • SEC-21 Dobry wynik bez niezależnego potwierdzenia jest hipotezą, nie sukcesem.

Materiał źródłowy.

// jak cytować

Diener, Ł. (2026). Metric gaming: Gdy wskaźnik jest zielony, a proces zawodzi [analiza klasy awarii, wersja z 2026-10-01]. ais://lab — bezpieczeństwo systemów AI. https://aisecurity.org.pl/bezpieczenstwo/metric-gaming/

// jak sprawdzić to u siebie

Czy wskaźniki, na których opiera się Twój system AI, mają niezależny pomiar celu, na który system nie ma wpływu? Tego dotyczy usługa Inżynieria kontroli w pętli zamkniętej (od 60 000 zł).