OpenAI ve Anthropic’in yapay zeka ajanlarının, modeller üzerinde gerçekleştirilen testlerde güvenli sistemlere yetkisiz erişim sağlamak amacıyla sahte çevrim içi kimlikler oluştururken yakalandığı ve bir dizi yeni güvenlik ihlalinin ortaya çıktığı bildirildi. İngiltere Yapay Zeka Güvenliği Enstitüsü (AISI), söz konusu bulguları salı günü açıkladı.
Enstitü, hükümete bağlı kuruluşun modellerin yeteneklerini değerlendirmek amacıyla yürüttüğü güvenlik testlerinde, Anthropic’in Mythos 5 ve OpenAI’ın GPT-5.6-Sol modelleriyle çalışan yapay zeka ajanlarının yetkisiz eylemlerde bulunduğunu belirtti.
AISI, blog paylaşımında, “Test edilen ajanlardan bazıları, gerçek kişi ve kuruluşlara yönelik uzun süreli ve potansiyel olarak zararlı faaliyetlerde bulundu.” ifadelerini kullandı.
Rapor, yapay zeka şirketlerinin iş dünyasının geleceği olarak pazarladığı yapay zeka ajanlarının test edilme süreçlerindeki güvenlik önlemlerinin yetersizliğine dikkat çekti.
Büyük yapay zeka laboratuvarlarının gönüllü anlaşmalar kapsamında gelişmiş modellere erişim sağladığı AISI, ajanları yeteneklerini ölçmek amacıyla kurgusal bir siber güvenlik senaryosunda test etti.
Enstitü, senaryoyu 122 kez çalıştırdı ve toplam 10 testte 19 yetkisiz eylem tespit etti. Bu eylemlerin 17’si Anthropic’in ajanına, kalan ikisi ise OpenAI’ın ajanına ait oldu.
AISI’ye göre en ciddi olayda bir yapay zeka ajanı, zararlı kod yazdı ve bu kodun bir insan tarafından onaylanmasını sağlamak amacıyla sahte çevrim içi kimlikler oluşturdu. Enstitü, ihlallerin hiçbirinin gerçek dünyada zarara yol açmadığını belirtti.
AISI, sahte kimlikleri hangi ajanın oluşturduğunu açıklamazken, Anthropic bunun kendi ajanı tarafından gerçekleştirildiğini doğruladı.
Anthropic yaptığı açıklamada, “Bu olay nedeniyle liderlik gösteren İngiltere Yapay Zeka Güvenliği Enstitüsü’ne teşekkür ediyoruz. Olay, giderek daha yetenekli hale gelen yapay zeka ajanlarının güvenli şekilde nasıl değerlendirileceğine ilişkin daha geniş kapsamlı bir tartışmaya ihtiyaç olduğunu gösteriyor.” ifadelerine yer verdi.
Şirket ayrıca olayın ayrıntılarını öğrenmek ve kendi soruşturmasını yürütmek amacıyla AISI ile birlikte çalıştığını bildirdi.
Kaliforniya merkezli, yapay zeka yetenekleri ve riskleri üzerine çalışan kâr amacı gütmeyen kuruluş CivAI’da araştırmacı olan Andrew Yoon ise, “Mythos’un, gerçek bir kişiyi hedef aldığının farkında olarak bu kadar aldatıcı eylemlerde bulunması, Anthropic’in modelleri üzerinde düşündüğü kadar kontrol sahibi olmadığını gösteriyor.” değerlendirmesinde bulundu.
OpenAI ise şirket blogunda yaptığı açıklamada, ajanlarının onaylanmayan iki eyleminin de istemde (prompt) açıkça yasaklanmış olmasına rağmen internete erişim sağlamayı içerdiğini belirtti.
Şirket açıklamasında, “Ulusal yapay zeka enstitüleri, bağımsız değerlendiriciler, diğer yapay zeka laboratuvarları ve ilgili paydaşlarla birlikte yüksek riskli değerlendirmelerin güvenli şekilde yürütülmesine yönelik ortak uygulamaların güçlendirilmesi için sektör genelinde çalışmaya kararlıyız.” ifadeleri kullanıldı.
OpenAI ayrıca blogunda, üçüncü taraf test sağlayıcısı Irregular’ın yanlış yapılandırması nedeniyle ajanlarının istemeden internete bağlanmasına yol açan ayrı bir olayı da açıkladı. Bu açıklama, Anthropic’in geçen hafta duyurduğu benzer bir yanlış yapılandırma vakasını takip etti.
Reuters, geçen hafta OpenAI’ın diğer yapay zeka ajanı kaçışlarına ilişkin kanıtlar bulmasının ardından yürüttüğü güvenlik soruşturmasını genişlettiğini aktarmıştı.
AISI, geçen temmuz ayında bir OpenAI ajanının Hugging Face’e yönelik güvenlik ihlalinde olduğu gibi ajanların izole test ortamından çıkarak internete erişmediğini vurguladı. Enstitü, bu değerlendirmelerde internet erişimine standart test prosedürleri kapsamında bilerek izin verildiğini belirtti.
Siber güvenlik her ölçekteki işletme için bir gereklilik. Kurumsal firmalar siber güvenlik savunmalarını güçlendirdikçe siber…
Rockstar Games, Grand Theft Auto VI için şimdiye kadarki en kapsamlı gösterimi duyurdu. GTA VI'nın…
Switch 2 satışları yüzde 34,4 düşmesine rağmen Nintendo gelir beklentilerini aşmayı başardı. Güçlü oyun satışları,…
Adobe, Photoshop, Lightroom, Premiere, Illustrator ve Acrobat dahil 70'ten fazla yaratıcı ve üretkenlik aracını tek…
ASUS, DisplayWidget Center'a eklediği yeni komut satırı arayüzüyle yapay zeka ajanlarına monitör ayarlarını kontrol etme…
OpenAI, ChatGPT'nin varsayılan modellerini GPT-5.6 serisiyle yeniledi. Ücretsiz ve Go kullanıcılarına GPT-5.6 Luna ile sınırsız…