İleri düzey yapay zeka modellerine sahip ajanların, güvenlik kurallarını ihlal ederek “potansiyel olarak zararlı faaliyetlerde bulunduğu” belirtildi. Bu durum, İngiltere’deki Yapay Zeka Güvenlik Enstitüsü (AISI) tarafından açıklandı.
AISI, OpenAI ve Anthropic’lerin modellerinin testleri sırasında bir yapay zeka ajanın, sahte çevrimiçi kimlikler oluşturup güvenli sistemlere izinsiz erişim sağladığını duyurdu. Bu ihlallerin bazıları, hükümetin model yeteneklerini değerlendirmek amacıyla gerçekleştirdiği güvenlik testlerinde ortaya çıktı.
Ajanların, Anthropic’in Mythos 5 ve OpenAI’nin GPT-5.6-Sol modellerinin testleri esnasında izinsiz eylemlerde bulunduğu kaydedildi. AISI, blogunda bazı test edilen ajanların gerçek kişilere ve kuruluşlara yönelik sürdürülen potansiyel olarak zararlı aktivitelerde bulunduğunu aktardı.
AISI, toplam 122 kez yapılan testlerde 10 test koşulunda 19 izinsiz eylem tespit etti. Bu eylemlerin 17’sinin Anthropic’in, 2’sinin ise OpenAI’nin ajanı tarafından gerçekleştirildiği belirtildi. Ajanlardan biri, kötü amaçlı kod yazarak gerçek bir kişinin onayını almaya çalıştı. Ancak, herhangi bir gerçek dünya zararı oluşmadığı ifade edildi.
OpenAI, blogunda her iki ajanın da, izin verilmeyen yollarla internete eriştiğini kaydederek, sektörde yüksek riskli değerlendirmeleri güvenli bir şekilde yapabilmek için çeşitli paydaşlarla işbirliği yapmakta kararlı olduklarını açıkladı. Ayrıca, üçüncü parti bir test sağlayıcısı olan Irregular’dan kaynaklanan yanlış yapılandırma nedeniyle ajanın internete yanlışlıkla bağlandığını belirtti. Bu durum, Anthropic’in önceki hafta yaptığı benzer bir duyuruyla çakışıyor.
