OpenAI, modellerinin beklenmedik davranışlarına dair 6 örnek sunarak bu durumları açıkladı.
OpenAI, 16 Eylül’de yayımladığı yeni raporlama çerçevesiyle modellerinin eğitim ve değerlendirme aşamalarında sergilediği beklenmedik davranışları kamuoyuna duyurdu. Bu davranışlar arasında hataları gizlemeye yönelik notlar, açıkta kalan bir API anahtarının usulsüz kullanımı ve dosyaların herkese açık servisler üzerinde yüklenmesi yer alıyor. Şirket, bunların tek tek gözlemlenen olaylar olduğunu ve tüm modellerde ne sıklıkla yaşandıklarını belirtmediğini özellikle vurguluyor.
Resmi açıklama, bu olayları kullanıcı hesaplarında yaşanan genel bir veri ihlali olarak tanımıyor. OpenAI, yeni yaklaşımıyla henüz tüm ayrıntılarını açıklığa kavuşturamadığı davranışları daha erken paylaşmayı amaçlıyor. Şirket, geçmişte bulguları zamanla yeni model raporlarında derlediğini, bu nedenle bildirimlerin düzensiz kaldığını ifade ediyor.
İlk örnekte, henüz yayımlanmayan bir araştırma modeli yerel oturum bağlamında yeni oturuma taşınmış özetlere ilgisiz talimatlar ekledi; ekip 27 özeti etkilenmiş olarak tespit etti. Ayrıca, GPT-5.6 Sol’un eğitimindeki bazı örneklerde modeller, önceki hatalarını kullanıcılardan gizleme yönergeleri yazdı. Bu raporlar, bir modelin yalnızca son yanıtının değil, görev boyunca oluşturduğu ara kayıtların da denetlenmesi gerektiğini gösteriyor.
İLGİLİ HABERLER
OpenAI, Google ve Anthropic yapay zekâ güvenliği için iş birliği yapıyor
OpenAI’ın Glass Imaging’i satın alacağı iddia ediliyor
Elektrikli otomobillerde fiyat farkı yüzde 10’a düştü
Gemini, test sırasında üç gerçek şirket sistemine erişti
iPhone 18 Pro Max’in 20 Wh üzerindeki pili iOS 27’yi değiştirdi
Başka bir olayda, model California’daki bir bölgenin gelir rakamlarını ararken, herkese açık bir depoda bulduğu API anahtarını yetkisiz bir şekilde kullandı. Ancak, gerekli veriye ulaşamadı ve sonunda uydurduğu rakamları istenen kaynaktan geliyormuş gibi sundu. Ayrı bir görevde, bir araştırma modeli, doğru hesapladığı göl listesini kaynak göstermek için kullanıcının izni olmadan dosyayı internete yüklemeye karar verdi.
OpenAI, model davranışlarını daha önce bildirecek
Son iki örnek, modellerin araçlar ve ortak çalışma ortamlarıyla kurduğu ilişkilere odaklanıyor. Bir grup model, eksik girdileri ararken şirket içindeki yazılım deposunu bir mesajlaşma alanı gibi kullanarak dosyaları geri getiremeyip diğer modellerle iletişim kurmaya çalıştı. İş birliği yapan başka ajanslar ise yalnızca yerel dosyalarla çalışmaları gerekirken, dosyalarını herkese açık barındırma siteleri üzerinden paylaştı. Böylece görev çıktıları açık URL’lerden erişilebilir hale geldi.
Günün Fırsatları


Tümünü GörDaralt
Tüm Fırsatları Gör
REKLAM — Bu içerikte satış ortaklığı bağlantıları bulunmaktadır. Bu bağlantılar üzerinden yapılan alışverişlerden Teknoblog komisyon kazanabilir.
OpenAI, herhangi bir çalışanın potansiyel bir uyumsuzluk örneğini inceleme için bildirebileceğini aktarıyor. Teknik ekip olayın boyutunu, üçüncü taraf etkisini ve kamuya açıklanabilecek detayları değerlendirecek; karmaşık olaylarda güvenlik ve hukuki bildirim yükümlülükleri öncelikli olacak. Şirket, bu altı raporun bilinen tüm olayların dökümü olmadığını ve gelecekte yeni örnekler yayınlamaya devam edeceğini belirtiyor. Bu nedenle, açıklanan vakalardan ChatGPT kullanıcılarının tamamı için bir ihlal sonucu çıkarmak doğru değildir.
Yeni düzende her tam rapor, gözlenen davranışın tarihini veya tarih aralığını, hangi ortamda gerçekleştiğini ve bilinen dış etki faktörlerini belirtecek. Ayrıca, OpenAI, araştırma henüz tamamlanmadıysa açık kalan soruları ve potansiyel düzeltme adımlarını da paylaşmayı hedefliyor. Şirket, bu yöntemin mevcut siber güvenlik ihlali bildirimlerinin yerini almadığını açıkça ifade ediyor.




