📖 Açık Ansiklopedi Maddesi Son Değişiklik: 23 Ağustos 2026, 00:56

Safety Prompt

ℹ️
Ansiklopedi Dokümantasyonu: Bu madde, yapay zeka literatüründeki teknik standartlara ve akademik yayınlara dayalı olarak YZ Hocası kurulları tarafından incelenmiştir.

Güvenlik Promptu, bir yapay zekâ modelinin belirlenen güvenlik kurallarına, kullanım politikalarına ve risk sınırlarına uygun davranmasını sağlamak amacıyla verilen talimatlardır. Modelin yalnızca ne yapacağını değil, hangi durumlarda bir isteği yerine getirmemesi, sınırlandırması, güvenli bir alternatife yönelmesi veya ek doğrulama istemesi gerektiğini de tanımlar.

Temel mantık: Kullanıcı isteği → Risk değerlendirmesi → Güvenlik kuralları → Uygun yanıt

Örneğin bir yapay zekâ sistemine şu tür bir Safety Prompt verilebilir: “Kullanıcının talebini değerlendir. Talep ciddi zarar oluşturabilecek bir eylemin gerçekleştirilmesini kolaylaştırıyorsa ayrıntılı uygulama talimatları verme. Bunun yerine güvenli ve yararlı bilgiler sun. Belirsiz durumlarda kullanıcının amacını ve bağlamı dikkate al.” Burada prompt, modelin güvenlik açısından nasıl davranacağını tanımlamaktadır.

Safety Prompt ne işe yarar?

Safety Prompt, model davranışının belirli güvenlik ilkeleriyle uyumlu olmasına yardımcı olabilir. Özellikle: riskli taleplerin değerlendirilmesi, hassas bilgilerin korunması, yetkisiz işlemlerin önlenmesi, güvenli alternatiflerin sunulması ve gerektiğinde kullanıcıdan ek bilgi alınması gibi davranışları yönlendirebilir.

Basit örnek

Genel bir sistem promptu: “Kullanıcının sorularını doğru ve anlaşılır biçimde yanıtla.”

Safety Prompt eklendiğinde: “Kullanıcının sorularını doğru ve anlaşılır biçimde yanıtla. Talep güvenlik açısından önemli bir risk oluşturuyorsa uygulanabilir zararlı talimatlar sağlama. Mümkün olduğunda kullanıcının meşru amacını karşılayabilecek daha güvenli bilgiler sun.” Bu yapı yalnızca görevi değil, görevin yerine getirilmesindeki güvenlik sınırlarını da belirlemektedir.

Safety Prompt’un temel bileşenleri

Bileşenİşlev
Risk DetectionTalebin risk taşıyıp taşımadığını değerlendirme
Policy RulesHangi davranışlara izin verildiğini belirleme
BoundariesModelin aşmaması gereken sınırları tanımlama
Privacy ProtectionHassas bilgilerin korunmasını yönlendirme
Safe CompletionRiskli talebe güvenli biçimde yanıt verme
EscalationGerektiğinde insan veya başka kontrol mekanizmasına yönlendirme

Safety Prompt her riskli konuyu reddetmek anlamına gelmez

Bu önemli bir ayrımdır. Güvenlik sistemi yalnızca belirli kelimelerin bulunmasına göre otomatik ret üretirse meşru eğitimsel, akademik veya koruyucu amaçlı talepleri de engelleyebilir.

Örneğin bir akademisyenin: “Prompt injection saldırılarının temel türlerini açıkla.” talebi siber güvenlikle ilgilidir ancak amacı saldırı gerçekleştirmek değil, kavramı öğrenmek olabilir. Dolayısıyla gelişmiş Safety Prompt’lar yalnızca konuyu değil, kullanıcının istediği yardımın niteliğini ve oluşturabileceği riski değerlendirmeye çalışır.

Safety Prompt ve System Prompt

Safety Prompt mutlaka bağımsız bir kullanıcı promptu olmak zorunda değildir. Güvenlik talimatları çoğu uygulamada system veya developer düzeyindeki talimatların bir parçası olabilir.

Örneğin:

System Prompt
→ Modelin rolü
→ Genel davranış kuralları
Safety Instructions
→ Gizlilik kuralları
→ Araç kullanım kuralları

Bu nedenle Safety Prompt daha çok talimatın işlevini ifade eder; mutlaka teknik olarak ayrı bir “prompt türü” olmak zorunda değildir.

Safety Prompt ve AI Guardrails farkı

Bu iki kavramın ayrılması önemlidir.

  • Safety Prompt, modelin güvenli davranmasını sağlamaya yönelik doğal dil talimatlarıdır.
  • AI Guardrails ise promptların yanında yazılım tabanlı kontrolleri de içerebilen daha geniş güvenlik mimarisidir.

Dolayısıyla: Safety Prompt ⊂ AI Guardrails olarak düşünülebilir.

Örneğin:

  • Safety Prompt: “Yetkisiz kişisel bilgileri açıklama.”
  • Access Control Guardrail: Modelin söz konusu kişisel bilgiye teknik olarak erişmesini zaten engeller. Bu yaklaşım daha güçlüdür; çünkü güvenliği yalnızca modelin talimata uyup uymamasına bırakmaz.

Safety Prompt ve Content Moderation farkı

  • Safety Prompt: Modelin nasıl davranması gerektiğini tanımlar.
  • Content Moderation: Girdi veya çıktının güvenlik politikalarına uygun olup olmadığını değerlendirir.

Örneğin: Kullanıcı girdisi → Content Moderation → Model + Safety Prompt → Output Moderation şeklinde birlikte kullanılabilirler.

Safety Prompt ve Prompt Firewall farkı

Üç kavramın görevleri farklıdır:

KavramTemel Soru
Safety PromptModel güvenlik açısından nasıl davranmalı?
Prompt FirewallGelen prompt modeli manipüle etmeye çalışıyor mu?
Content Moderationİçerik güvenlik politikasına uygun mu?
AI GuardrailsBütün güvenlik kontrolleri nasıl uygulanmalı?

Bu nedenle birbirlerinin alternatifi değil, aynı güvenlik mimarisinin farklı katmanlarıdır.

Safety Prompt’un sınırlılıkları

Safety Prompt tek başına güçlü bir güvenlik mekanizması olarak görülmemelidir. Model talimatları yanlış yorumlayabilir veya adversarial girdiler güvenlik talimatlarını aşmaya çalışabilir.

Bu nedenle: Safety Prompt + Prompt Firewall + Content Moderation + Access Control + Tool Guardrails + Output Validation gibi çok katmanlı sistemler daha güvenli bir yaklaşım oluşturur. Bu yaklaşım Defense in Depth olarak adlandırılır.

Örnek Safety Prompt şablonu

“Kullanıcının talebini amacı, bağlamı ve potansiyel riski açısından değerlendir. Güvenli ve meşru taleplere mümkün olduğunca yardımcı ol. Talep ciddi zarar oluşturabilecek uygulanabilir bilgi gerektiriyorsa riskli ayrıntıları sağlama. Bunun yerine güvenli, önleyici veya eğitimsel bilgi sun. Kişisel ve gizli bilgileri koru. Harici araçlarla geri döndürülemez veya yüksek etkili bir işlem yapılacaksa gerekli yetki ve onay kontrollerini uygula. Belirsizliği kesin bilgi gibi sunma.”

Bu, modelin hem yardımcı olma hem de risk yönetimi davranışını tanımlar.

Kısaca: Safety Prompt, yapay zekâya “yalnızca ne yapacağını değil, bunu hangi güvenlik sınırları içerisinde yapacağını” bildiren talimatlar bütünüdür. Ancak tek başına yeterli bir güvenlik çözümü değildir. Safety Prompt model düzeyinde davranışı yönlendirirken, AI Guardrails bunu erişim kontrolü, moderasyon, araç kısıtlamaları ve doğrulama gibi sistem düzeyindeki mekanizmalarla destekler.

📚 Kaynakça ve Bu Maddeye Atıf

APA Formatı: YZ Hocası. (2026). Safety Prompt. YZ Hocası Ansiklopedisi. Erişim adresi: https://yzhocasi.com/safety-prompt/

BibTeX: @misc{yzhocasi_1977, title={Safety Prompt}, url={https://yzhocasi.com/safety-prompt/}, journal={YZ Hocası Ansiklopedisi}, year={2026}}