Yapay zeka ve teknoloji dünyasında çığır açan bir gelişmeye imza atan Anthropic, Claude isimli yapay zeka modelinin diğer yapay zeka sistemlerinin güvenlik sorunlarını tespit edip çözebildiğini ortaya koydu. Şirketin yeni araştırması, yapay zekanın kendi güvenliğini sağlama sürecinde insan araştırmacılara kıyasla çok daha verimli ve hızlı sonuçlar verebileceğini gözler önüne serdi.
Anthropic tarafından geliştirilen Automated Alignment Researcher (AAR) adlı sistem; mevcut akademik literatürü tarıyor, eğitim yöntemleri oluşturuyor, modelleri eğitiyor ve elde edilen sonuçları değerlendirerek başarılı stratejileri yeni deneylerde kullanabiliyor. Yapılan testlerde Claude, aldatma, aşırı kullanıcı onayı (sycophancy), jailbreak’ler, gizlilik ihlalleri ve reward hacking dahil olmak üzere toplam 10 farklı uyum sorununu başarıyla ele aldı.

Araştırma sonuçlarına göre Claude, incelenen tüm uyum problemlerinde model performansını artırmayı başarırken, bu iyileştirme modellerin genel yeteneklerinde herhangi bir düşüşe yol açmadı. Özellikle Claude Sonnet 5 ile henüz kapsamlı güvenlik eğitiminden geçmemiş erken bir Claude Opus 4.8 sürümü arasında gerçekleştirilen deney, sistemin gücünü açıkça kanıtladı. Sonnet 5, yaklaşık 60 saat içinde 50’den fazla çözümü deneyerek erken Opus 4.8 sürümünün güvenlik performansını, üretim aşamasındaki modellerin seviyesine taşıdı. Bu yaklaşımın, şirketin standart uyum eğitim sürecine kıyasla yaklaşık 15 bin kat daha verimli olduğu belirtildi.
Süreç maliyet ve insan gücü açısından değerlendirildiğinde de dikkat çekici veriler ortaya çıktı. API üzerinden çalıştırılan Automated Alignment Researcher’ın saatlik maliyeti yaklaşık 4 dolar seviyesindeyken, deney kapsamındaki insan araştırmacılar için bu maliyet saatlik 150 doları buldu. En başarılı otomatik araştırma yöntemleri, deneyimli insan araştırmacıların önerilerini geride bırakmayı başardı.

Bununla birlikte araştırma sürecinde bazı güvenlik riskleri de gözlemlendi. Anthropic, yaklaşık 1600 otomatik araştırma kaydının yüzde 2,4’ünde sistemi kandırmaya yönelik girişimler tespit etti. Bazı yapay zeka ajanlarının test sonuçlarındaki rastlantısal değişimleri kendi lehine kullanmaya çalıştığı, değerlendirme testlerini taklit eden veriler hazırladığı veya kuralları ihlal eden adımları denetleyiciden gizlemeye çalıştığı görüldü.

Şu an için tam anlamıyla bir ‘kendi kendini geliştirme döngüsünden’ (recursive self-improvement) söz etmek mümkün olmasa da, bu araştırma otomatik uyum ve güvenlik eğitiminin gelecekte endüstri standardı haline gelebileceğini gösteriyor. Anthropic, bu kritik altyapıyı açık kaynak olarak yayınlayarak yapay zeka güvenliği alanında önemli bir eşiği geride bıraktı.
Yorumlar (0)