GitHub güvenlik duyurularına gizli yorum ekledi: İç inceleme aynı kayıtta kalıyor
2 Ekim yeniliği, bakım ekibinin araştırmacıdan ayrı değerlendirmesini duyuru geçmişi içinde tutabiliyor.
Google DeepMind ve ortakları, tarafların hassas bilgilerini açmadan bağımsız değerlendirme yapılmasını denedi.
Duyuru / olay tarihi:

Google DeepMind, 27 Ağustos 2026'da çift kör AI değerlendirmesi pilotunu açıkladı. Singapur AI Güvenlik Enstitüsü, OpenMined, AVERI ve MLCommons ile yapılan çalışma, test sorularının geliştiriciden ve model ağırlıklarının değerlendiriciden gizlenmesini hedefliyor. Böylece iki tarafın hassas bilgisini paylaşmadan bir değerlendirme yürütme yöntemi sınanıyor.
Teknik rapor, güvenli işlem ortamına şifreli olarak gönderilen model ve test verilerinin birlikte çalıştırılmasını açıklıyor. Donanım doğrulaması, tarafların beklenen yazılım ortamının kullanıldığını kontrol etmesine yardımcı oluyor. Raporda pilotun Gemini 2.5 Flash Lite ile yürütüldüğü belirtiliyor; bu, bütün yeni modellerin aynı düzenle sınandığı anlamına gelmiyor.
Google Cloud'un gizli işleme yazısı, donanım temelli izolasyonun ve doğrulanabilir çalışma ortamlarının altyapı bağlamını sağlıyor. Teknik rapor ise bazı kod parçalarının tamamen incelenemediğini ve doğrulama yolunda Google hizmetlerine güven bulunduğunu açıkça kaydediyor. Yani pilot, hiç kimseye güven gerektirmeyen kusursuz bir düzen olarak sunulmamalı.
Editoryal değerlendirmemize göre yöntem, AI değerlendirmelerindeki gerçek bir gerilime yanıt arıyor. Geliştirici modelini korumak isterken değerlendirici de özel testlerini açıklamak istemeyebilir. Taraflar bilgi paylaşmadığında inceleme zorlaşır; her şeyi paylaştığında ise gizlilik ve ilerideki testlerin geçerliliği sorunları ortaya çıkabilir.
Test sorularının gizli kalması, modelin değerlendirme örneklerine önceden hazırlanmış olma ihtimalini azaltmaya yardımcı olabilir. Bununla birlikte bir testin gizli olması, iyi tasarlandığını kendiliğinden göstermez. Ölçülen davranış, başarı ölçütü ve örneklerin gerçek kullanımı ne kadar temsil ettiği yine bilimsel olarak tartışılmalı.
Benzer şekilde model ağırlıklarının kapalı kalması, sonuçların yeniden üretilebilirliği için farklı bir yöntem gerektirir. Bizce değerlendirme sürecinin hangi sürümü, hangi kodu ve hangi koşulları kullandığı açık biçimde kaydedilirse sonuç daha iyi yorumlanabilir. Bilginin korunması ile incelemenin anlaşılabilir olması birlikte tasarlanmalı.
Pilotun açıkladığı güven bağımlılıkları bu yüzden önemli bir ayrıntı. Kriptografik ve donanım temelli kontroller güçlü araçlar olabilir; fakat uygulama zincirindeki her parçanın aynı güvenceyi vermesi beklenmemeli. Teknik raporun kendi sınırlarını belirtmesi, sonucun kapsamını daha doğru okumayı sağlıyor ve sonraki geliştirme hedeflerini görünür kılıyor.
Çift kör yaklaşım, model şirketleri ile bağımsız değerlendiriciler arasında daha kapsamlı çalışmaların önünü açabilecek bir araştırma adımı. Haberin somut sonucu, sınırlı bir pilotun uygulanmış olması. İzlenmesi gereken sonraki aşamalar, ölçeklenebilirlik ve güven bağımlılıklarının azaltılması olacak; bu yöntem tek başına bir modelin güvenli olduğunu kanıtlayan damga değil.
Kaynak kontrolü: 2026-10-03. Metin yapay zekâ desteğiyle hazırlanmıştır.
■ MİZAN HABER