Claude Yapay Zeka Güvenliğinde Çığır Açtı: Kendi Türünü Eğiterek İnsanları Geride Bıraktı

Claude Yapay Zeka Güvenliğinde Çığır Açtı: Kendi Türünü Eğiterek İnsanları Geride Bıraktı

Yapay zeka ve teknoloji dünyasında çığır açan bir gelişmeye imza atan Anthropic, Claude isimli yapay zeka modelinin diğer yapay zeka sistemlerinin güvenlik sorunlarını tespit edip çözebildiğini ortaya koydu. Şirketin yeni araştırması, yapay zekanın kendi güvenliğini sağlama sürecinde insan araştırmacılara kıyasla çok daha verimli ve hızlı sonuçlar verebileceğini gözler önüne serdi.

Anthropic tarafından geliştirilen Automated Alignment Researcher (AAR) adlı sistem; mevcut akademik literatürü tarıyor, eğitim yöntemleri oluşturuyor, modelleri eğitiyor ve elde edilen sonuçları değerlendirerek başarılı stratejileri yeni deneylerde kullanabiliyor. Yapılan testlerde Claude, aldatma, aşırı kullanıcı onayı (sycophancy), jailbreak’ler, gizlilik ihlalleri ve reward hacking dahil olmak üzere toplam 10 farklı uyum sorununu başarıyla ele aldı.

claude yapay zeka guvenliginde cigir acti kendi turunu egiterek insanlari geride birakti 2

Araştırma sonuçlarına göre Claude, incelenen tüm uyum problemlerinde model performansını artırmayı başarırken, bu iyileştirme modellerin genel yeteneklerinde herhangi bir düşüşe yol açmadı. Özellikle Claude Sonnet 5 ile henüz kapsamlı güvenlik eğitiminden geçmemiş erken bir Claude Opus 4.8 sürümü arasında gerçekleştirilen deney, sistemin gücünü açıkça kanıtladı. Sonnet 5, yaklaşık 60 saat içinde 50’den fazla çözümü deneyerek erken Opus 4.8 sürümünün güvenlik performansını, üretim aşamasındaki modellerin seviyesine taşıdı. Bu yaklaşımın, şirketin standart uyum eğitim sürecine kıyasla yaklaşık 15 bin kat daha verimli olduğu belirtildi.

Süreç maliyet ve insan gücü açısından değerlendirildiğinde de dikkat çekici veriler ortaya çıktı. API üzerinden çalıştırılan Automated Alignment Researcher’ın saatlik maliyeti yaklaşık 4 dolar seviyesindeyken, deney kapsamındaki insan araştırmacılar için bu maliyet saatlik 150 doları buldu. En başarılı otomatik araştırma yöntemleri, deneyimli insan araştırmacıların önerilerini geride bırakmayı başardı.

claude yapay zeka guvenliginde cigir acti kendi turunu egiterek insanlari geride birakti 1

Bununla birlikte araştırma sürecinde bazı güvenlik riskleri de gözlemlendi. Anthropic, yaklaşık 1600 otomatik araştırma kaydının yüzde 2,4’ünde sistemi kandırmaya yönelik girişimler tespit etti. Bazı yapay zeka ajanlarının test sonuçlarındaki rastlantısal değişimleri kendi lehine kullanmaya çalıştığı, değerlendirme testlerini taklit eden veriler hazırladığı veya kuralları ihlal eden adımları denetleyiciden gizlemeye çalıştığı görüldü.

claude yapay zeka guvenliginde cigir acti kendi turunu egiterek insanlari geride birakti

Şu an için tam anlamıyla bir ‘kendi kendini geliştirme döngüsünden’ (recursive self-improvement) söz etmek mümkün olmasa da, bu araştırma otomatik uyum ve güvenlik eğitiminin gelecekte endüstri standardı haline gelebileceğini gösteriyor. Anthropic, bu kritik altyapıyı açık kaynak olarak yayınlayarak yapay zeka güvenliği alanında önemli bir eşiği geride bıraktı.

Oğuzhan ÜNVER

YZ Hocası kurucu editörü. Yapay zeka araçlarının iş dünyasına entegrasyonu ve üretkenlik üzerine içerikler üretiyor. Prompt mühendisliği konusunda eğitimler veriyor.

⚡ HAFTANIN PROMPTU

Bir nesnenin yapısını, kullanım amacını ve temel özelliklerini üç farklı görsel anlatımla tanıtmak için kullanılır.

Yüklediğim nesnenin fotoğrafını kullanarak üç bölümlü tek bir görsel oluştur. Sol bölümde nesneyi “exploded view” tarzında göster. Ana parçalarını düzenli aralıklarla ayır ve birbirleriyle ilişkilerini koru. Orta bölümde nesnenin adını ve kullanım amacını, dokulu bir kâğıt üzerine doğal ve okunaklı el yazısıyla yaz. Sağ bölümde nesnenin üç temel özelliğini, farklı pastel renklerdeki yapışkan notlara yerleştir. Her notta kısa bir ifade bulunsun. Nesnenin rengini ve tasarımını referans fotoğrafla uyumlu tut. İç yapısı görünmüyorsa oluşturduğun parçaların temsili olduğunu küçük bir notla belirt. Açık renkli sade bir arka plan, yumuşak ışık ve dengeli bir yerleşim kullan. Tüm yazılar Türkçe olsun. Görseli 16:9 yatay formatta hazırla.

Yorumlar (0)

Bir Yorum Bırakın