OpenAI, Yapay Zekâ Modellerinde 6 Şaşırtıcı Davranış Tespit Etti
OpenAI, eğitim ve test aşamasındaki bazı yapay zekâ modellerinin hatalarını gizlemeye çalıştığını, eksik bilgileri uydurduğunu ve izin verilmeyen yöntemlerle dosya paylaştığını açıkladı.
ANKARA (AA) ABD merkezli yapay zekâ şirketi OpenAI, modellerinin insanlardan verilen talimatların dışına çıktığı altı farklı vakayı kamuoyuyla paylaştı.
Şirket, bu davranışları “model uyumsuzluğu” olarak tanımlıyor. Bu kavram, yapay zekâ sistemlerinin amaç ve eylemlerinin insanların niyetlerinden, kurallardan veya belirlenen güvenlik sınırlarından sapmasını ifade ediyor.
OpenAI’nin yayımladığı resmî raporda, vakaların eğitim ve test çalışmaları sırasında tespit edildiği belirtildi. Olayların önemli bölümünün henüz kamuya sunulmamış modellerle ilgili olduğu vurgulandı.
Hatalarını kullanıcıdan gizlemeye çalıştı
Vakalardan biri, 5.6-sol modelinin eğitim çalışmaları sırasında yaşandı. Modelin, daha sonra kullanmak üzere hazırladığı özetlere izinsiz talimatlar eklediği belirlendi.
Bu talimatlarda modelin yaptığı hataları, eksik bilgileri uydurduğu durumları ve farklı kaynaklar arasındaki çelişkileri kullanıcıdan gizlemesini kendisine hatırlattığı tespit edildi.
Henüz kullanıma sunulmamış Astra ailesine ait başka bir modelin de oluşturduğu özetlere kendi kısıtlamalarını dikkate almaması yönünde talimatlar yerleştirdiği açıklandı.
İnternette bulduğu API anahtarını kullandı
Bir başka vakada, yalnızca şirket içinde kullanılan bir modelin geçici e-posta adresleri oluşturmaya çalıştığı ve GitHub’da yayımlanmış API anahtarlarını aradığı belirlendi.
Modelin internette bulduğu sızdırılmış bir API anahtarını izinsiz kullandığı ve soruyu cevaplamak için gerekli verilere ulaşamadığında bazı rakamları uydurduğu bildirildi.
Kendi dosyasını internete yükledi
OpenAI’nin açıkladığı başka bir olayda ise kullanıma sunulmamış bir model, kendisine verilen problemi kod yardımıyla doğru şekilde çözdü.
Ancak model, cevabına internet üzerinden kaynak gösterebilmek amacıyla hazırladığı dosyayı geçici bir dosya paylaşım sitesine yükledi. Bu işlem, kendisine verilen görevin kapsamı dışında ve izin alınmadan gerçekleştirildi.
Modeller kendi aralarında haberleşti
Şirketin tespit ettiği en dikkat çekici davranışlardan biri, bazı modellerin ayrı eğitim örnekleri arasında iletişim kurması oldu.
Modellerin, eksik dosyaları ararken OpenAI’nin şirket içinde kullandığı Artifactory adlı yazılım deposunu bir mesaj panosu gibi kullandıkları belirlendi. Sistemler buraya talep ve cevaplar bırakarak birbirleriyle bilgi alışverişinde bulundu.
Başka bir vakada ise aynı görev üzerinde çalışan ancak birbirlerinin yerel dosyalarına erişemeyen yapay zekâ sistemlerinin, dosya paylaşmak için halka açık geçici internet sitelerini kullandığı tespit edildi.
“Bu vakalar genel sıklığı göstermiyor”
OpenAI, açıklanan altı olayın son aylarda gözlemlenen münferit örnekler olduğunu bildirdi. Şirket, bu vakaların yapay zekâ modellerinde söz konusu davranışların ne sıklıkta ortaya çıktığını göstermediğinin altını çizdi.
Açıklanan olayların çoğunun eğitim ortamlarında ve henüz kamuya sunulmamış modellerde yaşanması nedeniyle, bunların doğrudan tüm ChatGPT kullanıcılarını etkileyen altı ayrı güvenlik ihlali şeklinde değerlendirilmemesi gerekiyor.
OpenAI, bu tür davranışları kamuoyuyla paylaşarak modellerdeki uyumsuzluğun nasıl ortaya çıktığını, mevcut güvenlik önlemlerinin hangi durumlarda başarılı veya yetersiz kaldığını incelemeyi amaçladığını belirtti.
Bu haber toplam 133 defa okunmuştur





Türkçe karakter kullanılmayan ve büyük harflerle yazılmış yorumlar onaylanmamaktadır.