Bölüm 12: Öğrenme ve Adaptasyon

Algoritmik Oyun Kuramı · Çalışma Soruları
En iyi tepki dinamiğiKurgusal oyunPişmanlık ve Hedgeε-açgözlü ve UCBQ-öğrenmeReplikatörTit-for-Tat
Çoktan seçmeli sorular, her slaytta bir soru. Bir şık seçin: doğru cevap ve açıklaması görünür. · Sercan KÜLCÜ

Çoktan Seçmeli · Öğrenme Modelleri

Soru 1

Çok kollu haydut probleminde oyuncu her turda neyi gözler?

Haydutta geri bildirim kısmidir: yalnız çekilen kolun ödülü görülür. Her eylemin kazancını görmek Hedge'in (tam bilgi) ortamıdır.

Çoktan Seçmeli · Öğrenme Modelleri

Soru 2

En iyi tepki dinamiği hangi oyun sınıfında her zaman bir saf Nash dengesinde durur?

Her kârlı sapma ortak potansiyeli artırır; sonlu oyunda bu sonsuza kadar süremez (Monderer–Shapley). Saf dengesi olmayan oyunlarda dinamik döner.

Çoktan Seçmeli · En İyi Tepki Dinamiği

Soru 3

Yazı-Tura Eşleştirme'de en iyi tepki dinamiği nasıl davranır?

Oyunun saf dengesi yoktur; her adımda bir oyuncu memnun, öteki memnun değildir. Çare tüm geçmişe bakmaktır (kurgusal oyun).

Çoktan Seçmeli · En İyi Tepki Dinamiği

Soru 4

Kurgusal oyunda (fictitious play) bir oyuncu neye en iyi tepki verir?

Kurgusal oyun rakibi geçmiş frekanslarla oynayan karışık bir strateji gibi görür ve ona en iyi tepkiyi verir. Son eyleme tepki en iyi tepki dinamiğidir.

Çoktan Seçmeli · Kurgusal Oyun

Soru 5

Kurgusal oyunda Eşleştiren, Ayrıştıran'ın geçmişinde Y/T = 2/5 görüyor (eşitlikte Y). Bu tur ne oynar?

Eşleştiren çoğunluğu eşler: rakip çoğunlukla T oynamış (5 > 2), bu yüzden T oynar. Ayrıştıran ise çoğunluğun tersini seçer.

Çoktan Seçmeli · Kurgusal Oyun

Soru 6

Kurgusal oyunda frekansların dengeye yakınsaması hangisinde garanti DEĞİLDİR?

Robinson (1951) sıfır toplamlıda yakınsamayı gösterdi; 2×2 ve potansiyel oyunlarda da yakınsar. Shapley'nin 3×3 oyununda frekanslar döner.

Çoktan Seçmeli · Pişmanlık

Soru 7

5 turda sabit eylemler A, B, C sırasıyla 2; 3; 2,5 toplardı. Algoritma 2,34 topladı. Dışsal pişmanlık kaçtır?

Dışsal pişmanlık = en iyi sabit eylemin toplamı − algoritmanın toplamı = 3 − 2,34 = 0,66.

Çoktan Seçmeli · Pişmanlık

Soru 8

Hedge'de η = ln 2, iki eylem; ilk iki turda kazançlar (1, 0) ve (1, 0). Üçüncü turda p1 kaçtır?

w1 = e2 ln 2 = 4, w2 = 1 → p1 = 4/5 = 0,8. Kazançlar üste girer, ağırlık çarpımsal büyür.

Çoktan Seçmeli · Hedge ve Denge

Soru 9

“Lideri izle” kuralı neden pişmanlıksız değildir?

Sıradaki seçimi önceden bilinen algoritma sömürülür (sunumdaki tabloda 6 turda pişmanlık 2,5). Hedge karışık oynayarak bunu önler.

Çoktan Seçmeli · Hedge ve Denge

Soru 10

Bütün oyuncular Hedge gibi pişmanlıksız algoritma kullanırsa oyunun zaman ortalaması neye yaklaşır?

Dışsal pişmanlığın küçük olması kaba korelasyonlu dengeyi verir. Korelasyonlu denge için daha güçlü iç (swap) pişmanlık gerekir.

Çoktan Seçmeli · Hedge ve UCB

Soru 11

Kazançlar [0, 1]'de ve n eylem varken Hedge'de η = √(ln n / T) seçilirse hangi sınır elde edilir?

RT ≤ (ln n)/η + ηT ifadesine η = √(ln n / T) konursa 2√(T ln n) çıkar; RT/T → 0, yani algoritma pişmanlıksızdır.

Çoktan Seçmeli · Hedge ve UCB

Soru 12

UCB1, t = 10: kol 1 için Q = 0,6, N = 5; kol 2 için Q = 0,2, N = 1. Hangi kol seçilir?

Kol 1: 0,6 + √(2 ln 10 / 5) ≈ 1,56; kol 2: 0,2 + √(2 ln 10) ≈ 2,35. Az denenen kolun güven payı büyüktür, keşif kendiliğinden olur.

Çoktan Seçmeli · Haydut ve Q-öğrenme

Soru 13

ε sabit tutulursa ε-açgözlü algoritmanın pişmanlığı T ile nasıl büyür?

Sürekli ε oranında rastgele kol çekmek her turda sabit bir kayıp getirir. UCB1'in pişmanlığı ise logaritmiktir (Auer vd., 2002).

Çoktan Seçmeli · Haydut ve Q-öğrenme

Soru 14

Q-öğrenmede Q(s, a) = 0,5, r = 1, γ = 0,9, max Q(s′, ·) = 1, α = 0,5. Güncellemeden sonra Q(s, a) kaçtır?

Hedef = r + γ·max Q(s′, ·) = 1 + 0,9 = 1,9. Q ← 0,5 + 0,5·(1,9 − 0,5) = 0,5 + 0,7 = 1,2. 1,9 hedefin kendisidir.

Çoktan Seçmeli · Çoklu Ajan ve Evrim

Soru 15

Çoklu ajan ortamında tek ajanlı Q-öğrenme garantileri neden geçerliliğini yitirir?

Bir ajanın gördüğü geçişler ötekilerin değişen politikalarına bağlıdır; durağanlık varsayımı bozulur. Kendine karşı oyun bir çözüm yoludur.

Çoktan Seçmeli · Çoklu Ajan ve Evrim

Soru 16

Şahin–Güvercin oyununda kaynak V = 4, kavga maliyeti C = 6. Replikatör dinamiğinin vardığı ESS'de şahin payı kaçtır?

fŞ = fG: 7 − 5x = 5 − 2x → x* = 2/3 = V/C. Bu, simetrik karışık Nash dengesiyle aynıdır.

Çoktan Seçmeli · Replikatör ve Grim

Soru 17

Şahin–Güvercin (V = 4, C = 6, taban uygunluk 3) oyununda x = 0,5 iken bir sonraki nesilde şahin payı kaçtır?

fŞ = 3 − 0,5 + 2 = 4,5; fG = 3 + 1 = 4; f̄ = 4,25. x′ = 0,5·4,5/4,25 ≈ 0,529: şahinler 2/3'e doğru artar.

Çoktan Seçmeli · Replikatör ve Grim

Soru 18

Tekrarlanan Mahkûmun İkilemi'nde T = 7, R = 3, P = 1. Kinci (Grim) stratejiyle işbirliğinin denge olması için en küçük δ nedir?

δ ≥ (T − R)/(T − P) = (7 − 3)/(7 − 1) = 2/3. T = 5 için aynı formül 1/2 verir; ihanet cazipleştikçe gereken sabır artar.

Çoktan Seçmeli · Axelrod Turnuvası

Soru 19

10 turluk maçta Tit-for-Tat, Hep İhanet'e karşı kaç puan toplar (T = 5, R = 3, P = 1, S = 0)?

İlk turda TFT işbirliği yapar ve 0 alır; sonraki 9 turda karşılıklı ihanet: 9·1 = 9. Hep İhanet 5 + 9 = 14 toplar.

Çoktan Seçmeli · Axelrod Turnuvası

Soru 20

Mini Axelrod turnuvasında Tit-for-Tat hiçbir maçı kazanmadan nasıl birinci oldu?

Turnuvada toplam puan önemlidir: TFT iyi niyetli, misillemeci ve affedicidir. Maçları en fazla berabere bitirir ama toplamda en yükseğe çıkar (124).

Son

Bölüm 12: Öğrenme ve Adaptasyon · Çalışma Soruları
Konu anlatımı: Bölüm 12 sunumu · Terim sözlüğü
1 / 1 Sercan KÜLCÜ, Tüm hakları saklıdır.