Bölüm 12: Öğrenme ve Adaptasyon
Algoritmik Oyun Teorisi
GirişÖğrenme ModelleriAdaptasyon ve Dinamik OyunlarÖğrenme ve DengeGerçek Hayat UygulamalarıTartışma Soruları
Sercan KÜLCÜ · Giresun Üniversitesi · Bilgisayar MühendisliğiGiriş
- Öğrenme: Geçmiş deneyimlerden strateji geliştirme
- Adaptasyon: Rakiplerin ve çevrenin değişimine tepki verme
- Örnekler: Satranç, poker, trafik ağları
Öğrenme Modelleri
- Pekiştirmeli öğrenme, eylemleri gözlenen ödüllere göre günceller.
- Kurgusal oyunda oyuncu rakiplerinin geçmiş eylem frekanslarını tahmin eder ve bu tahmine en iyi tepkiyi verir.
- Pişmanlık minimizasyonu, gerçekleşen performansı geriye dönük en iyi sabit stratejiyle karşılaştırır.
- Çevrim içi öğrenme, geri bildirim geldikçe karar kuralını ardışık biçimde günceller.
Adaptasyon ve Dinamik Oyunlar
- Tekrarlayan oyunlarda strateji değişimi
- Çevresel değişikliklere adaptasyon
- Örnekler:
- Piyasa fiyatları → firmalar strateji değiştirir
- Online platform öneri algoritmaları → kullanıcı davranışına adaptasyon
Öğrenme ve Denge
- Bazı oyun sınıflarında kurgusal oyun veya en iyi tepki dinamikleri Nash dengesine yakınsayabilir.
- Genel oyunlarda eylemlerin tek bir Nash dengesine yakınsaması garanti değildir.
- Pişmanlıksız öğrenmede zaman ortalamaları daha geniş bir kavram olan kaba korelasyonlu dengeye yaklaşır.
- Öğrenme kuralı, geri bildirim yapısı ve diğer oyuncuların değişen davranışları sonucu belirler.
Gerçek Hayat Uygulamaları
- Otonom araçlar → yol ve trafik adaptasyonu
- Finans piyasaları → stratejik adaptasyon ve öğrenme
- Reklam ve öneri sistemleri → kullanıcı etkileşimine göre öğrenme
Pişmanlık ve Öğrenme
- Dışsal pişmanlık, gerçekleşen toplam kazancı geçmişte tek bir sabit strateji seçilseydi elde edilecek kazançla karşılaştırır.
- Toplam pişmanlığın tur sayısına oranı zamanla sıfıra yaklaşıyorsa algoritma pişmanlıksız öğrenir.
- Bu ölçüt, rakibin modelini bilmeden uzun dönem performansını değerlendirmeye yarar.
Çarpımsal Ağırlıklar
- Algoritma her stratejiye bir ağırlık verir ve başarılı stratejilerin ağırlığını artırır.
- Öğrenme oranı, yeni sonuçlara ne kadar hızlı tepki verileceğini belirler.
- Uygun parametrelerle dışsal pişmanlık alt doğrusal büyür ve ortalama pişmanlık sıfıra yaklaşır.
Keşif ve Sömürü Dengesi
- Keşif yeni stratejiler hakkında bilgi toplar, sömürü ise o ana kadar en iyi görünen stratejiyi kullanır.
- Çok kollu haydut modelinde oyuncu yalnızca seçtiği eylemin ödülünü gözlemler.
- Epsilon-açgözlü yöntemler ve üst güven sınırı algoritmaları bu iki amacı farklı biçimlerde dengeler.
Tartışma Soruları
- Öğrenme ve adaptasyon her zaman optimum stratejiye götürür mü?
- İnsan davranışları algoritmik öğrenmeyle ne kadar benzer?
- Adaptif sistemlerde etik riskler nelerdir?
Öğrenme ve adaptasyon her zaman optimum stratejiye götürür mü? (1/2)
- Teorik olarak: Tekrarlayan oyunlarda bazı öğrenme süreçleri Nash dengesine yaklaşabilir
- Ama her zaman değil:
- Çevresel değişiklikler
- Eksik bilgi veya yanlış modelleme
Öğrenme ve adaptasyon her zaman optimum stratejiye götürür mü? (2/2)
- Rakiplerin stratejilerinde sürekli değişim
- Örnekler:
- Otonom araçlar → sürekli öğrenme ile güvenlik artar, ama her zaman en hızlı rota seçilemeyebilir
- Poker → deneyim kazanılır ama rakipler adaptasyon yaptığında denge bozulur
İnsan davranışları algoritmik öğrenmeyle ne kadar benzer? (1/2)
- İnsan davranışı genellikle sınırlı rasyonel, duygusal ve önyargılıdır
- Algoritmalar → matematiksel ve veri odaklı öğrenir
- Benzerlikler:
- Deneme-yanılma yaklaşımı
İnsan davranışları algoritmik öğrenmeyle ne kadar benzer? (2/2)
- Geçmiş deneyimden öğrenme
- Farklar:
- İnsanlar risk algısına, duygulara ve sosyal normlara göre hareket eder
- Algoritmalar önceden belirlenmiş ödül/ceza sistemine dayanır
Adaptif sistemlerde etik riskler nelerdir?
- Veri önyargısı: Yanlış veya eksik veri → haksız kararlar
- Manipülasyon: Sistem kullanıcı davranışını yanlış yönlendirebilir
- Gizlilik: Kişisel verilerin sürekli öğrenme için kullanılması
- Örnekler:
- Sosyal medya → tıklama tuzağı ve yanıltıcı öneriler
- Finansal algoritmalar → bazı yatırımcıları avantajlı, bazılarını dezavantajlı duruma düşürebilir
Son
Bölüm 12: Öğrenme ve Adaptasyon
Sonraki bölüm: Bölüm 13: Karar Alma 1 / 1 Sercan KÜLCÜ, Tüm hakları saklıdır.
← → veya boşluk ile gezinin · F: tam ekran · Home/End: ilk/son slayt