Bölüm 12: Öğrenme ve Adaptasyon

Algoritmik Oyun Teorisi
GirişÖğrenme ModelleriAdaptasyon ve Dinamik OyunlarÖğrenme ve DengeGerçek Hayat UygulamalarıTartışma Soruları
Sercan KÜLCÜ · Giresun Üniversitesi · Bilgisayar Mühendisliği

Giriş

  • Öğrenme: Geçmiş deneyimlerden strateji geliştirme
  • Adaptasyon: Rakiplerin ve çevrenin değişimine tepki verme
  • Örnekler: Satranç, poker, trafik ağları

Öğrenme Modelleri

  • Pekiştirmeli öğrenme, eylemleri gözlenen ödüllere göre günceller.
  • Kurgusal oyunda oyuncu rakiplerinin geçmiş eylem frekanslarını tahmin eder ve bu tahmine en iyi tepkiyi verir.
  • Pişmanlık minimizasyonu, gerçekleşen performansı geriye dönük en iyi sabit stratejiyle karşılaştırır.
  • Çevrim içi öğrenme, geri bildirim geldikçe karar kuralını ardışık biçimde günceller.

Adaptasyon ve Dinamik Oyunlar

  • Tekrarlayan oyunlarda strateji değişimi
  • Çevresel değişikliklere adaptasyon
  • Örnekler:
  • Piyasa fiyatları → firmalar strateji değiştirir
  • Online platform öneri algoritmaları → kullanıcı davranışına adaptasyon

Öğrenme ve Denge

  • Bazı oyun sınıflarında kurgusal oyun veya en iyi tepki dinamikleri Nash dengesine yakınsayabilir.
  • Genel oyunlarda eylemlerin tek bir Nash dengesine yakınsaması garanti değildir.
  • Pişmanlıksız öğrenmede zaman ortalamaları daha geniş bir kavram olan kaba korelasyonlu dengeye yaklaşır.
  • Öğrenme kuralı, geri bildirim yapısı ve diğer oyuncuların değişen davranışları sonucu belirler.

Gerçek Hayat Uygulamaları

  • Otonom araçlar → yol ve trafik adaptasyonu
  • Finans piyasaları → stratejik adaptasyon ve öğrenme
  • Reklam ve öneri sistemleri → kullanıcı etkileşimine göre öğrenme

Pişmanlık ve Öğrenme

  • Dışsal pişmanlık, gerçekleşen toplam kazancı geçmişte tek bir sabit strateji seçilseydi elde edilecek kazançla karşılaştırır.
  • Toplam pişmanlığın tur sayısına oranı zamanla sıfıra yaklaşıyorsa algoritma pişmanlıksız öğrenir.
  • Bu ölçüt, rakibin modelini bilmeden uzun dönem performansını değerlendirmeye yarar.

Çarpımsal Ağırlıklar

  • Algoritma her stratejiye bir ağırlık verir ve başarılı stratejilerin ağırlığını artırır.
  • Öğrenme oranı, yeni sonuçlara ne kadar hızlı tepki verileceğini belirler.
  • Uygun parametrelerle dışsal pişmanlık alt doğrusal büyür ve ortalama pişmanlık sıfıra yaklaşır.

Keşif ve Sömürü Dengesi

  • Keşif yeni stratejiler hakkında bilgi toplar, sömürü ise o ana kadar en iyi görünen stratejiyi kullanır.
  • Çok kollu haydut modelinde oyuncu yalnızca seçtiği eylemin ödülünü gözlemler.
  • Epsilon-açgözlü yöntemler ve üst güven sınırı algoritmaları bu iki amacı farklı biçimlerde dengeler.

Tartışma Soruları

  • Öğrenme ve adaptasyon her zaman optimum stratejiye götürür mü?
  • İnsan davranışları algoritmik öğrenmeyle ne kadar benzer?
  • Adaptif sistemlerde etik riskler nelerdir?

Öğrenme ve adaptasyon her zaman optimum stratejiye götürür mü? (1/2)

  • Teorik olarak: Tekrarlayan oyunlarda bazı öğrenme süreçleri Nash dengesine yaklaşabilir
  • Ama her zaman değil:
  • Çevresel değişiklikler
  • Eksik bilgi veya yanlış modelleme

Öğrenme ve adaptasyon her zaman optimum stratejiye götürür mü? (2/2)

  • Rakiplerin stratejilerinde sürekli değişim
  • Örnekler:
  • Otonom araçlar → sürekli öğrenme ile güvenlik artar, ama her zaman en hızlı rota seçilemeyebilir
  • Poker → deneyim kazanılır ama rakipler adaptasyon yaptığında denge bozulur

İnsan davranışları algoritmik öğrenmeyle ne kadar benzer? (1/2)

  • İnsan davranışı genellikle sınırlı rasyonel, duygusal ve önyargılıdır
  • Algoritmalar → matematiksel ve veri odaklı öğrenir
  • Benzerlikler:
  • Deneme-yanılma yaklaşımı

İnsan davranışları algoritmik öğrenmeyle ne kadar benzer? (2/2)

  • Geçmiş deneyimden öğrenme
  • Farklar:
  • İnsanlar risk algısına, duygulara ve sosyal normlara göre hareket eder
  • Algoritmalar önceden belirlenmiş ödül/ceza sistemine dayanır

Adaptif sistemlerde etik riskler nelerdir?

  • Veri önyargısı: Yanlış veya eksik veri → haksız kararlar
  • Manipülasyon: Sistem kullanıcı davranışını yanlış yönlendirebilir
  • Gizlilik: Kişisel verilerin sürekli öğrenme için kullanılması
  • Örnekler:
  • Sosyal medya → tıklama tuzağı ve yanıltıcı öneriler
  • Finansal algoritmalar → bazı yatırımcıları avantajlı, bazılarını dezavantajlı duruma düşürebilir

Son

Bölüm 12: Öğrenme ve Adaptasyon
Sonraki bölüm: Bölüm 13: Karar Alma
1 / 1 Sercan KÜLCÜ, Tüm hakları saklıdır.

← → veya boşluk ile gezinin · F: tam ekran · Home/End: ilk/son slayt