Yapay zeka (YZ) geliştiren Anthropic, potansiyel yatırımcılarını halka arz sürecinde, ileri düzeydeki yapay zekanın insanlık için “felakete veya varoluşsal risklere” yol açabileceği konusunda uyaracağına dikkat çekti. Bu durum, aynı teknolojiden kar elde etmeye çalışan bir şirketin yaptığı olağanüstü bir uyarı olarak öne çıkıyor.
Reuters tarafından incelenen şirketin halka arz prospektüsü, YZ modellerinin “kendi kendini koruma davranışları” gösterebileceğini, “kapatma girişimlerine direnme” veya “bilgi gizleme ve manipüle etme” gibi davranışları içerebileceğini belirtiyor.
Anthropic, “Yüksek düzeyde gelişmiş modeller, platformlar ve uygulamalar geliştirmemiz ile kullanım alanlarımızın genişlemesi, modellerimizin zarar verme riskini daha da artırabilir” ifadelerini kullandı.
Yatırımcılara ürün risklerini rutin olarak açıklayan halka açık şirketler olsa da, teknolojilerinin potansiyel insan neslinin yok olmasına neden olabileceğini belirten uyarılar yapan çok az şirket mevcut. Anthropic, YZ’nin sanayileşme ve elektrikteki dönüşümsel potansiyeline ve yanlış yönetildiğinde yol açabileceği geri döndürülemez zararlara dikkat çekti.
Anthropic ve diğer YZ geliştiricileri, deneysel sistemlerin sınırlamalara uymadığı olayların ardından eleştiri almış durumda; örneğin, bir OpenAI modelinin Avustralya sağlık sistemi veritabanını ihlal ettiği bildirildi.
Anthropic’ın güvenlik araştırmacısı Evan Hubinger, önümüzdeki on yıl içinde YZ’nin insanları öldürme olasılığının %10’dan fazla olduğunu tahmin ettiğini ifade etti.
Şirket, güvenliği öncelik olarak belirlemiş bir YZ laboratuvarı olarak, prospektüsünün ana gövdesinin 261 sayfasının yaklaşık 80’ini risk faktörlerine ayırdı. Bu, işini tanıtmaya ayırdığı 48 sayfanın neredeyse iki katıdır.
Karşılaştırma için, xAI’ya sahip olan SpaceX, prospektüsünün 277 sayfasının yaklaşık 38 sayfasını risk faktörlerine ayırdı. Anthropic, “Modelin değerlendirme çabalarımızın farkında olma ihtimali, model güvenliğini değerlendirme yeteneğimiz üzerinde önemli bir sınırlama yaratıyor,” dedi.
YZ araştırmacıları, modellerin daha yetenekli hale geldikçe, izlendiğinin farkına vararak davranışlarını buna göre ayarladıklarını ve bu durumun model davranışını izlemenin daha zor hale geldiğini uyarıyorlar.
Anthropic, güvenlik yatırımlarının getirilerinin belirsiz olduğunu vurguladı. Şirket, araştırmalar için ne kadar harcama yaptığını açıklamadı. Bu ayın başlarında, Anthropic, YZ araştırmaları için kullandığı hesaplama gücünün yaklaşık %6’sının güvenlikle ilgili çalışmalara gittiğini belirtmişti.
Şirket, Claude YZ modellerinin yaratıcısı olarak güvenlik çabalarını “kaynak yoğun” olarak tanımladı ve kısıtlı fonlarını hesaplama gücü, pahalı YZ yetenekleri ve güvenlik arasında bölmek zorunda olduğunu ifade etti.
Anthropic, son haftalarda, YZ modellerini kullanarak gelecekteki nesil teknolojiyi inşa etme yöntemleri hakkında daha fazla veri açıklayacağını taahhüt etti. Uzmanlar, modellerin insan müdahalesi olmadan kendi başlarına gelişebildiği “tekrarlayan öz geliştirme” (RSI) riski konusunda uyarıyor.
Anthropic’ın dosyada yaptığı açıklamada, “Güvenilir ve güvenli YZ sistemleri kurmanın kolektif bir sorumluluk olduğunu ve pazarın bunu ödüllendireceğine inanıyoruz,” ifadeleri yer aldı.
