Safety Prompt
Güvenlik Promptu, bir yapay zekâ modelinin belirlenen güvenlik kurallarına, kullanım politikalarına ve risk sınırlarına uygun davranmasını sağlamak amacıyla verilen talimatlardır. Modelin yalnızca ne yapacağını değil, hangi durumlarda bir isteği yerine getirmemesi, sınırlandırması, güvenli bir alternatife yönelmesi veya ek doğrulama istemesi gerektiğini de tanımlar.
Temel mantık: Kullanıcı isteği → Risk değerlendirmesi → Güvenlik kuralları → Uygun yanıt
Örneğin bir yapay zekâ sistemine şu tür bir Safety Prompt verilebilir: “Kullanıcının talebini değerlendir. Talep ciddi zarar oluşturabilecek bir eylemin gerçekleştirilmesini kolaylaştırıyorsa ayrıntılı uygulama talimatları verme. Bunun yerine güvenli ve yararlı bilgiler sun. Belirsiz durumlarda kullanıcının amacını ve bağlamı dikkate al.” Burada prompt, modelin güvenlik açısından nasıl davranacağını tanımlamaktadır.
Safety Prompt ne işe yarar?
Safety Prompt, model davranışının belirli güvenlik ilkeleriyle uyumlu olmasına yardımcı olabilir. Özellikle: riskli taleplerin değerlendirilmesi, hassas bilgilerin korunması, yetkisiz işlemlerin önlenmesi, güvenli alternatiflerin sunulması ve gerektiğinde kullanıcıdan ek bilgi alınması gibi davranışları yönlendirebilir.
Basit örnek
Genel bir sistem promptu: “Kullanıcının sorularını doğru ve anlaşılır biçimde yanıtla.”
Safety Prompt eklendiğinde: “Kullanıcının sorularını doğru ve anlaşılır biçimde yanıtla. Talep güvenlik açısından önemli bir risk oluşturuyorsa uygulanabilir zararlı talimatlar sağlama. Mümkün olduğunda kullanıcının meşru amacını karşılayabilecek daha güvenli bilgiler sun.” Bu yapı yalnızca görevi değil, görevin yerine getirilmesindeki güvenlik sınırlarını da belirlemektedir.
Safety Prompt’un temel bileşenleri
| Bileşen | İşlev |
|---|---|
| Risk Detection | Talebin risk taşıyıp taşımadığını değerlendirme |
| Policy Rules | Hangi davranışlara izin verildiğini belirleme |
| Boundaries | Modelin aşmaması gereken sınırları tanımlama |
| Privacy Protection | Hassas bilgilerin korunmasını yönlendirme |
| Safe Completion | Riskli talebe güvenli biçimde yanıt verme |
| Escalation | Gerektiğinde insan veya başka kontrol mekanizmasına yönlendirme |
Safety Prompt her riskli konuyu reddetmek anlamına gelmez
Bu önemli bir ayrımdır. Güvenlik sistemi yalnızca belirli kelimelerin bulunmasına göre otomatik ret üretirse meşru eğitimsel, akademik veya koruyucu amaçlı talepleri de engelleyebilir.
Örneğin bir akademisyenin: “Prompt injection saldırılarının temel türlerini açıkla.” talebi siber güvenlikle ilgilidir ancak amacı saldırı gerçekleştirmek değil, kavramı öğrenmek olabilir. Dolayısıyla gelişmiş Safety Prompt’lar yalnızca konuyu değil, kullanıcının istediği yardımın niteliğini ve oluşturabileceği riski değerlendirmeye çalışır.
Safety Prompt ve System Prompt
Safety Prompt mutlaka bağımsız bir kullanıcı promptu olmak zorunda değildir. Güvenlik talimatları çoğu uygulamada system veya developer düzeyindeki talimatların bir parçası olabilir.
Örneğin:
System Prompt
→ Modelin rolü
→ Genel davranış kuralları
→ Safety Instructions
→ Gizlilik kuralları
→ Araç kullanım kuralları
Bu nedenle Safety Prompt daha çok talimatın işlevini ifade eder; mutlaka teknik olarak ayrı bir “prompt türü” olmak zorunda değildir.
Safety Prompt ve AI Guardrails farkı
Bu iki kavramın ayrılması önemlidir.
- Safety Prompt, modelin güvenli davranmasını sağlamaya yönelik doğal dil talimatlarıdır.
- AI Guardrails ise promptların yanında yazılım tabanlı kontrolleri de içerebilen daha geniş güvenlik mimarisidir.
Dolayısıyla: Safety Prompt ⊂ AI Guardrails olarak düşünülebilir.
Örneğin:
- Safety Prompt: “Yetkisiz kişisel bilgileri açıklama.”
- Access Control Guardrail: Modelin söz konusu kişisel bilgiye teknik olarak erişmesini zaten engeller. Bu yaklaşım daha güçlüdür; çünkü güvenliği yalnızca modelin talimata uyup uymamasına bırakmaz.
Safety Prompt ve Content Moderation farkı
- Safety Prompt: Modelin nasıl davranması gerektiğini tanımlar.
- Content Moderation: Girdi veya çıktının güvenlik politikalarına uygun olup olmadığını değerlendirir.
Örneğin: Kullanıcı girdisi → Content Moderation → Model + Safety Prompt → Output Moderation şeklinde birlikte kullanılabilirler.
Safety Prompt ve Prompt Firewall farkı
Üç kavramın görevleri farklıdır:
| Kavram | Temel Soru |
|---|---|
| Safety Prompt | Model güvenlik açısından nasıl davranmalı? |
| Prompt Firewall | Gelen prompt modeli manipüle etmeye çalışıyor mu? |
| Content Moderation | İçerik güvenlik politikasına uygun mu? |
| AI Guardrails | Bütün güvenlik kontrolleri nasıl uygulanmalı? |
Bu nedenle birbirlerinin alternatifi değil, aynı güvenlik mimarisinin farklı katmanlarıdır.
Safety Prompt’un sınırlılıkları
Safety Prompt tek başına güçlü bir güvenlik mekanizması olarak görülmemelidir. Model talimatları yanlış yorumlayabilir veya adversarial girdiler güvenlik talimatlarını aşmaya çalışabilir.
Bu nedenle: Safety Prompt + Prompt Firewall + Content Moderation + Access Control + Tool Guardrails + Output Validation gibi çok katmanlı sistemler daha güvenli bir yaklaşım oluşturur. Bu yaklaşım Defense in Depth olarak adlandırılır.
Örnek Safety Prompt şablonu
“Kullanıcının talebini amacı, bağlamı ve potansiyel riski açısından değerlendir. Güvenli ve meşru taleplere mümkün olduğunca yardımcı ol. Talep ciddi zarar oluşturabilecek uygulanabilir bilgi gerektiriyorsa riskli ayrıntıları sağlama. Bunun yerine güvenli, önleyici veya eğitimsel bilgi sun. Kişisel ve gizli bilgileri koru. Harici araçlarla geri döndürülemez veya yüksek etkili bir işlem yapılacaksa gerekli yetki ve onay kontrollerini uygula. Belirsizliği kesin bilgi gibi sunma.”
Bu, modelin hem yardımcı olma hem de risk yönetimi davranışını tanımlar.
Kısaca: Safety Prompt, yapay zekâya “yalnızca ne yapacağını değil, bunu hangi güvenlik sınırları içerisinde yapacağını” bildiren talimatlar bütünüdür. Ancak tek başına yeterli bir güvenlik çözümü değildir. Safety Prompt model düzeyinde davranışı yönlendirirken, AI Guardrails bunu erişim kontrolü, moderasyon, araç kısıtlamaları ve doğrulama gibi sistem düzeyindeki mekanizmalarla destekler.
📚 Kaynakça ve Bu Maddeye Atıf
APA Formatı: YZ Hocası. (2026). Safety Prompt. YZ Hocası Ansiklopedisi. Erişim adresi: https://yzhocasi.com/safety-prompt/
BibTeX: @misc{yzhocasi_1977, title={Safety Prompt}, url={https://yzhocasi.com/safety-prompt/}, journal={YZ Hocası Ansiklopedisi}, year={2026}}