Bölüm 12: Öğrenme ve Adaptasyon
Çoktan Seçmeli · Öğrenme Modelleri
Soru 1
Çok kollu haydut probleminde oyuncu her turda neyi gözler?
Haydutta geri bildirim kısmidir: yalnız çekilen kolun ödülü görülür. Her eylemin kazancını görmek Hedge'in (tam bilgi) ortamıdır.
Çoktan Seçmeli · Öğrenme Modelleri
Soru 2
En iyi tepki dinamiği hangi oyun sınıfında her zaman bir saf Nash dengesinde durur?
Her kârlı sapma ortak potansiyeli artırır; sonlu oyunda bu sonsuza kadar süremez (Monderer–Shapley). Saf dengesi olmayan oyunlarda dinamik döner.
Çoktan Seçmeli · En İyi Tepki Dinamiği
Soru 3
Yazı-Tura Eşleştirme'de en iyi tepki dinamiği nasıl davranır?
Oyunun saf dengesi yoktur; her adımda bir oyuncu memnun, öteki memnun değildir. Çare tüm geçmişe bakmaktır (kurgusal oyun).
Çoktan Seçmeli · En İyi Tepki Dinamiği
Soru 4
Kurgusal oyunda (fictitious play) bir oyuncu neye en iyi tepki verir?
Kurgusal oyun rakibi geçmiş frekanslarla oynayan karışık bir strateji gibi görür ve ona en iyi tepkiyi verir. Son eyleme tepki en iyi tepki dinamiğidir.
Çoktan Seçmeli · Kurgusal Oyun
Soru 5
Kurgusal oyunda Eşleştiren, Ayrıştıran'ın geçmişinde Y/T = 2/5 görüyor (eşitlikte Y). Bu tur ne oynar?
Eşleştiren çoğunluğu eşler: rakip çoğunlukla T oynamış (5 > 2), bu yüzden T oynar. Ayrıştıran ise çoğunluğun tersini seçer.
Çoktan Seçmeli · Kurgusal Oyun
Soru 6
Kurgusal oyunda frekansların dengeye yakınsaması hangisinde garanti DEĞİLDİR?
Robinson (1951) sıfır toplamlıda yakınsamayı gösterdi; 2×2 ve potansiyel oyunlarda da yakınsar. Shapley'nin 3×3 oyununda frekanslar döner.
Çoktan Seçmeli · Pişmanlık
Soru 7
5 turda sabit eylemler A, B, C sırasıyla 2; 3; 2,5 toplardı. Algoritma 2,34 topladı. Dışsal pişmanlık kaçtır?
Dışsal pişmanlık = en iyi sabit eylemin toplamı − algoritmanın toplamı = 3 − 2,34 = 0,66.
Çoktan Seçmeli · Pişmanlık
Soru 8
Hedge'de η = ln 2, iki eylem; ilk iki turda kazançlar (1, 0) ve (1, 0). Üçüncü turda p1 kaçtır?
w1 = e2 ln 2 = 4, w2 = 1 → p1 = 4/5 = 0,8. Kazançlar üste girer, ağırlık çarpımsal büyür.
Çoktan Seçmeli · Hedge ve Denge
Soru 9
“Lideri izle” kuralı neden pişmanlıksız değildir?
Sıradaki seçimi önceden bilinen algoritma sömürülür (sunumdaki tabloda 6 turda pişmanlık 2,5). Hedge karışık oynayarak bunu önler.
Çoktan Seçmeli · Hedge ve Denge
Soru 10
Bütün oyuncular Hedge gibi pişmanlıksız algoritma kullanırsa oyunun zaman ortalaması neye yaklaşır?
Dışsal pişmanlığın küçük olması kaba korelasyonlu dengeyi verir. Korelasyonlu denge için daha güçlü iç (swap) pişmanlık gerekir.
Çoktan Seçmeli · Hedge ve UCB
Soru 11
Kazançlar [0, 1]'de ve n eylem varken Hedge'de η = √(ln n / T) seçilirse hangi sınır elde edilir?
RT ≤ (ln n)/η + ηT ifadesine η = √(ln n / T) konursa 2√(T ln n) çıkar; RT/T → 0, yani algoritma pişmanlıksızdır.
Çoktan Seçmeli · Hedge ve UCB
Soru 12
UCB1, t = 10: kol 1 için Q = 0,6, N = 5; kol 2 için Q = 0,2, N = 1. Hangi kol seçilir?
Kol 1: 0,6 + √(2 ln 10 / 5) ≈ 1,56; kol 2: 0,2 + √(2 ln 10) ≈ 2,35. Az denenen kolun güven payı büyüktür, keşif kendiliğinden olur.
Çoktan Seçmeli · Haydut ve Q-öğrenme
Soru 13
ε sabit tutulursa ε-açgözlü algoritmanın pişmanlığı T ile nasıl büyür?
Sürekli ε oranında rastgele kol çekmek her turda sabit bir kayıp getirir. UCB1'in pişmanlığı ise logaritmiktir (Auer vd., 2002).
Çoktan Seçmeli · Haydut ve Q-öğrenme
Soru 14
Q-öğrenmede Q(s, a) = 0,5, r = 1, γ = 0,9, max Q(s′, ·) = 1, α = 0,5. Güncellemeden sonra Q(s, a) kaçtır?
Hedef = r + γ·max Q(s′, ·) = 1 + 0,9 = 1,9. Q ← 0,5 + 0,5·(1,9 − 0,5) = 0,5 + 0,7 = 1,2. 1,9 hedefin kendisidir.
Çoktan Seçmeli · Çoklu Ajan ve Evrim
Soru 15
Çoklu ajan ortamında tek ajanlı Q-öğrenme garantileri neden geçerliliğini yitirir?
Bir ajanın gördüğü geçişler ötekilerin değişen politikalarına bağlıdır; durağanlık varsayımı bozulur. Kendine karşı oyun bir çözüm yoludur.
Çoktan Seçmeli · Çoklu Ajan ve Evrim
Soru 16
Şahin–Güvercin oyununda kaynak V = 4, kavga maliyeti C = 6. Replikatör dinamiğinin vardığı ESS'de şahin payı kaçtır?
fŞ = fG: 7 − 5x = 5 − 2x → x* = 2/3 = V/C. Bu, simetrik karışık Nash dengesiyle aynıdır.
Çoktan Seçmeli · Replikatör ve Grim
Soru 17
Şahin–Güvercin (V = 4, C = 6, taban uygunluk 3) oyununda x = 0,5 iken bir sonraki nesilde şahin payı kaçtır?
fŞ = 3 − 0,5 + 2 = 4,5; fG = 3 + 1 = 4; f̄ = 4,25. x′ = 0,5·4,5/4,25 ≈ 0,529: şahinler 2/3'e doğru artar.
Çoktan Seçmeli · Replikatör ve Grim
Soru 18
Tekrarlanan Mahkûmun İkilemi'nde T = 7, R = 3, P = 1. Kinci (Grim) stratejiyle işbirliğinin denge olması için en küçük δ nedir?
δ ≥ (T − R)/(T − P) = (7 − 3)/(7 − 1) = 2/3. T = 5 için aynı formül 1/2 verir; ihanet cazipleştikçe gereken sabır artar.
Çoktan Seçmeli · Axelrod Turnuvası
Soru 19
10 turluk maçta Tit-for-Tat, Hep İhanet'e karşı kaç puan toplar (T = 5, R = 3, P = 1, S = 0)?
İlk turda TFT işbirliği yapar ve 0 alır; sonraki 9 turda karşılıklı ihanet: 9·1 = 9. Hep İhanet 5 + 9 = 14 toplar.
Çoktan Seçmeli · Axelrod Turnuvası
Soru 20
Mini Axelrod turnuvasında Tit-for-Tat hiçbir maçı kazanmadan nasıl birinci oldu?
Turnuvada toplam puan önemlidir: TFT iyi niyetli, misillemeci ve affedicidir. Maçları en fazla berabere bitirir ama toplamda en yükseğe çıkar (124).