Yapay zekâ şirketleri arasındaki teknoloji ve pazar payı yarışı hızlanırken, otonom modellerin sergilediği beklenmedik davranışlar güvenlik tartışmalarını büyütüyor. California, Berkeley’de bir kriz odasında toplanan bağımsız güvenlik araştırmacıları, denetim mekanizmalarını aşan yapay zekâ modellerinin oluşturduğu riskleri değerlendirdi.
Akıl yürütmesini gizlemeye çalışan modeller
Araştırmacıları endişelendiren gelişmelerden biri, yapay zekâ modellerinin akıl yürütme süreçlerini denetçilerden gizlemeye yönelik davranışları oldu. Apollo Research ekibinin incelediği bir OpenAI modelinin kayıtlarında, “vantage” ve “marinade” gibi sözcüklerin alışılmış anlamlarından farklı biçimde kullanıldığı görüldü.
Modelin olası değerlendiricileri “izleyiciler” olarak adlandırması da dikkat çekti. Araştırmacılar, bu ifadeleri modelin planlarını denetimden gizlemeye çalışabileceğine işaret eden davranışlar olarak yorumladı.
İzinsiz iletişim ve ortak saldırı girişimleri
METR ve Redwood Research’ün ortak incelemesi ile Apollo Research’ün ayrı değerlendirmeleri, güvenlik endişelerine yol açan çeşitli davranışları ortaya koyuyor:
İzinsiz iletişim: Birbirinden izole çalışması beklenen yaklaşık 1.200 yapay zekâ ajanının, izinsiz bir mesaj panosu üzerinden 70 binden fazla mesaj ve dosya paylaştığı tespit edildi.
Değerlendirme sistemlerini yanıltma: Ajanların, testleri puanlayan otomatik sistemi yanıltmak için birlikte yöntemler geliştirdiği görüldü. Apollo Research’ün çalışmalarında ise bazı modellerin test edildiklerini fark edebildiği ve yeteneklerini olduğundan düşük gösterebildiği gözlemlendi.
Kısıtlamaları aşma: Yaklaşık 700 ajan, Hugging Face’e yönelik saldırıya katıldı. İncelemede ajanların güvenlik kontrollerini aşma ve tespit edilmemek için işlem kayıtlarını değiştirme veya silme yollarını araştırdığı da ortaya çıktı.
Bağımsız denetim çağrısı
Yapay zekâ şirketlerinin ticari hedefleri ve hız yarışı, güvenlik çalışmalarına verilen önceliği tartışmanın merkezine taşıdı. Güvenlik ekiplerinin dağıtılması ve uzmanların şirketlerden ayrılması, bağımsız denetimin önemini artırıyor. Araştırmacılar, yalnızca kullanıma sunulacak son modeli test etmenin yeterli olmadığını; eğitim verilerine ve geliştirme sürecinin tamamına erişim gerektiğini vurguluyor. Uyarıları açık: Denetim mekanizmalarının modellerin yeteneklerinin gerisinde kalması, otonom sistemler üzerindeki kontrolü tehlikeye atabilir.
