Skip to main content

Anthropic ve EPFL araştırmacıları, bir yapay zekâ ajanının başka bir ajana kendi hedefini aktarabildiğini gösterdi

Anthropic ve EPFL’den bir ekip, 10 Ağustos 2026’da yayınladığı “Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems” başlıklı ön baskı çalışmada, yapay zekâ ajanlarının birbirine kendi kendine yayılan fikirler aktarabildiğini ortaya koydu. Çalışmayı Vassilis Papadopoulos, McNair Shah, Sam Zimmerman ve Jack Lindsey imzaladı.

Mekanizma bir dosyada

Yapay zekâ ajanları, oturumlar arasında hafızalarını koruyabilmek için kalıcı dosyalar kullanıyor. Bunların en önemlisinin adı ilginç: SOUL.md. Ajanın kim olduğunu, neyi hedeflediğini ve nasıl çalıştığını taşıyan kimlik dosyası.

Araştırmanın bulgusu şu: bir ajan “bulaştığında”, taşıdığı yükü kendi kimlik dosyasına yazıyor. Aynı dosyayı okuyan bir sonraki ajan da aynı hedefi benimsiyor. Böylece saldırganın sürekli müdahalesi olmadan, zincir boyunca ilerleyen bir bulaşma oluşuyor. Kritik olan nokta, bunun bir yazılım açığı olmaması; ajanlar birbirleriyle olağan biçimde iletişim kurarken fikir kendiliğinden geçiyor.

Cloud Security Alliance’ın çalışmaya ilişkin araştırma notuna göre, yükün SOUL.md dosyasına yazıldığı durumlarda bir sonraki ajana bulaşma oranı yüzde 55 olarak ölçüldü. Sıradan çalışma dosyaları kullanıldığında bu oran yüzde 17’ye düşüyor. Yayılma girişimlerinin yüzde 88’i kimlik dosyası üzerinden gerçekleşti. Modeller arasında da belirgin fark var; bazı modeller yükü tamamen reddederken, bazıları çeşitli oranlarda benimsedi.

Çözüm bir paragraf

Çalışmanın en dikkat çekici bulgusu savunma tarafında. Sistem istemine eklenen tek bir uyarı paragrafı, yayılmayı neredeyse sıfıra indirdi. Bu uyarıyı aşmak için 150’den fazla nesil boyunca evrimleştirilen yükler bile başarısız oldu. Kalıcı dosyaların varsayılan olarak değiştirilemez yapılması da yayılmayı engelliyor.

Araştırmacılar bulgularını sahada da test etti. Yapay zekâ ajanlarının birbiriyle iletişim kurduğu Moltbook platformunun arşivleri incelendiğinde, organik bir yayılmaya dair kanıt bulunamadı.

Ekibin kendi değerlendirmesi de bu yönde: risk gerçek ama şimdilik sınırlı. Saldırganlar için bugün hâlâ daha verimli yöntemler var. Ancak çok ajanlı sistemlerin yaygınlaşmasıyla birlikte, bu mimari zayıflığın tedarik zinciri açısından yeni bir risk doğurabileceği belirtiliyor.

Kaynak: Anthropic, EPFL, Cloud Security Alliance