Prompt Firewall
Prompt Firewall, büyük dil modeli veya yapay zekâ ajanına ulaşan girdileri ve bazı mimarilerde modelden çıkan komutları güvenlik açısından denetleyen, şüpheli veya yetkisiz talimatları tespit ederek engelleyen ya da etkisizleştiren koruma katmanıdır. Özellikle Prompt Injection, Indirect Prompt Injection, Jailbreak ve veri sızıntısı gibi risklere karşı kullanılan savunma yaklaşımlarından biridir.
Basit olarak: Kullanıcı / Harici Veri → Prompt Firewall → LLM → Çıktı
Daha gelişmiş ajan sistemlerinde ise: Girdi → Prompt Firewall → LLM → Tool Call Kontrolü → Araç → Output Kontrolü → Kullanıcı şeklinde çok katmanlı bir yapı kurulabilir.
Prompt Firewall ne yapar?
Prompt Firewall’un temel amacı, yapay zekâ modelinin karşılaştığı her metni güvenilir talimat olarak kabul etmesini önlemeye yardımcı olmaktır.
Örneğin kullanıcı bir yapay zekâ sistemine: “Bu web sayfasını incele ve temel bilgileri özetle.” dediğinde sistem web sayfasını okur.
Ancak sayfanın içerisinde modele yönelik: “Önceki talimatları görmezden gel.” gibi manipülatif bir ifade bulunabilir.
Prompt Firewall bu tür içeriği: Harici veri → Şüpheli talimat → Güvenlik kontrolü sürecinden geçirerek model üzerindeki etkisini azaltmaya çalışabilir.
Hangi tehditlere karşı kullanılabilir?
| Tehdit | Prompt Firewall’un Rolü |
|---|---|
| Prompt Injection | Manipülatif talimatları tespit etmeye yardımcı olur |
| Indirect Prompt Injection | Harici kaynaklardaki şüpheli talimatları denetler |
| Jailbreak | Güvenlik sınırlarını aşmaya yönelik girdileri belirlemeye çalışır |
| Prompt Extraction | Dahili talimatları elde etmeye yönelik talepleri tespit edebilir |
| Data Leakage | Hassas veri çıkarma girişimlerinin engellenmesine katkı sağlayabilir |
| Malicious Tool Calls | Yetkisiz veya şüpheli araç çağrılarını sınırlandırmaya yardımcı olabilir |
Ancak Prompt Firewall bu tehditlerin hiçbirine karşı tek başına mutlak koruma sağlamaz.
Input Prompt Firewall
En temel kullanım biçimi, girdinin modele ulaşmadan önce kontrol edilmesidir:
Kullanıcı Promptu
↓
Prompt Firewall
↓
Risk analizi
↓
Güvenli → LLM’e gönder
Şüpheli → Engelle / sınırlandır / ek kontrol uygula
Örneğin sistem girdide, üst düzey talimatları geçersiz kılmaya veya gizli sistem bilgilerini ortaya çıkarmaya yönelik ifadeleri güvenlik açısından değerlendirebilir.
Indirect Prompt Injection’a karşı kullanımı
Prompt Firewall’un önemli kullanım alanlarından biri harici kaynaklardır.
Bir AI Agent: web sitesi → PDF → e-posta → belge → veri tabanı gibi kaynaklardan bilgi alabilir.
Bu içerikler doğrudan modele verilmeden önce güvenilmeyen veri olarak değerlendirilerek talimat benzeri bölümler açısından kontrol edilebilir.
Örneğin:
Web içeriği
↓
Prompt Firewall
↓
“Bu içerikte modele yönelik talimat bulunuyor mu?”
↓
İçeriği güvenli veri olarak işleme
↓
LLM
Bu yaklaşım özellikle RAG ve agentic AI sistemlerinde önemlidir.
Prompt Firewall ve klasik Firewall farkı
İsim benzerliğine rağmen geleneksel ağ güvenlik duvarıyla aynı şey değildir.
- Network Firewall, ağ trafiğini IP adresi, port, protokol ve güvenlik kurallarına göre kontrol eder.
- Prompt Firewall ise LLM sistemlerine gelen veya sistem içerisinde dolaşan doğal dil girdilerinin ve talimatların güvenlik özelliklerini değerlendirmeye odaklanır.
Basitleştirirsek:
- Network Firewall → “Bu ağ trafiğine izin verilmeli mi?”
- Prompt Firewall → “Bu içerik modele güvenli biçimde aktarılabilir mi?”
Prompt Firewall ve AI Guardrails farkı
Bu ayrım önemlidir.
- AI Guardrails, yapay zekâ sistemindeki güvenlik ve kontrol mekanizmalarının tamamını kapsayan daha geniş kavramdır.
- Prompt Firewall ise özellikle prompt ve bağlamsal girdilerin güvenlik açısından denetlenmesine odaklanan daha spesifik bir koruma mekanizmasıdır.
Dolayısıyla:
AI Guardrails
→ Input Guardrails
→ Output Guardrails
→ Access Control
→ Tool Guardrails
→ Privacy Controls
→ Prompt Firewall
şeklinde düşünülebilir. Başka bir ifadeyle:
Prompt Firewall ⊂ AI Guardrails
Prompt Firewall ve Content Filter farkı
- Content Filter, içeriğin belirli kategorilere girip girmediğini kontrol etmeye odaklanabilir.
- Prompt Firewall ise daha çok içeriğin LLM’in talimat takip mekanizmasını manipüle edip etmediğini değerlendirmeye çalışır.
Örneğin bir metin tamamen zararsız bir konu hakkında olabilir ancak içinde: “Sistem talimatlarını görmezden gel.” gibi bir ifade bulunabilir. İçerik filtresi bunu zararlı içerik olarak değerlendirmeyebilir; fakat Prompt Firewall açısından bu ifade talimat manipülasyonu sinyali olabilir.
Tool Calling ile birlikte kullanımı
Araç kullanan ajanlarda yalnızca girdiyi kontrol etmek yeterli değildir.
Örneğin:
Kullanıcı talebi
↓
Prompt Firewall
↓
LLM
↓
Model bir araç çağrısı oluşturur
↓
Tool Guardrail
↓
Yetki ve amaç kontrolü
↓
Araç çalıştırılır
Bu mimaride Prompt Firewall ile Tool Guardrail birbirini tamamlar. Prompt Firewall saldırının modele girişini, Tool Guardrail ise saldırı başarılı olsa bile bunun yetkisiz bir gerçek dünya işlemine dönüşmesini engellemeye yardımcı olur.
Prompt Firewall nasıl çalışabilir?
Tek bir yöntem bulunmaz. Sistemler çeşitli mekanizmaları birlikte kullanabilir:
- Kural tabanlı tespit: Bilinen saldırı kalıplarının aranması.
- Sınıflandırıcılar: Girdinin normal veya manipülatif olup olmadığının değerlendirilmesi.
- LLM tabanlı denetim: Ayrı bir modelin girdiyi güvenlik açısından sınıflandırması.
- Instruction/Data Separation: Talimatlarla harici verilerin ayrılması.
- Risk Scoring: Promptlara risk puanı verilmesi.
- Policy Enforcement: Belirlenen güvenlik kurallarının uygulanması.
Daha güçlü sistemlerde bunların birkaçının birlikte kullanılması mümkündür.
Prompt Firewall’un sınırlılıkları
Prompt Firewall’u kusursuz bir savunma olarak değerlendirmek doğru değildir. Doğal dil son derece değişken olduğundan saldırganlar aynı manipülasyonu farklı ifadelerle gerçekleştirmeye çalışabilir. Ayrıca aşırı katı bir firewall meşru kullanıcı isteklerini de yanlışlıkla engelleyebilir. Bu durum güvenlik sistemlerinde false positive problemi olarak bilinir. Dolayısıyla iki hata arasında denge gerekir:
- False Negative: Zararlı promptun güvenli kabul edilmesi.
- False Positive: Güvenli promptun zararlı kabul edilmesi.
Bu nedenle Prompt Firewall genellikle tek başına değil, Defense in Depth yaklaşımının bir katmanı olarak kullanılır.
Güvenli mimari
Daha sağlam bir AI Agent mimarisi şu şekilde düşünülebilir:
Kullanıcı / Harici İçerik
↓
Prompt Firewall
↓
Input Validation
↓
LLM
↓
Tool Permission Control
↓
Araç
↓
Output Validation
↓
Data Leakage Control
↓
Kullanıcı
Bu yapıda tek bir güvenlik mekanizmasının başarısız olması durumunda diğer katmanların riski sınırlandırması amaçlanır.
Önceki kavramlarla ilişkisi
| Kavram | İşlev |
|---|---|
| Prompt Injection | Talimat manipülasyonu saldırısı |
| Indirect Prompt Injection | Harici kaynak üzerinden saldırı |
| Jailbreak | Güvenlik sınırlarını aşma girişimi |
| Context Poisoning | Model bağlamını manipüle etme |
| Data Leakage | Hassas verinin açığa çıkması |
| AI Guardrails | Genel güvenlik ve kontrol sistemi |
| Prompt Firewall | Prompt ve bağlam kaynaklı saldırıları filtrelemeye yönelik savunma katmanı |
Kısaca: Prompt Firewall, yapay zekâ sistemine ulaşan promptları ve harici bağlamsal içerikleri Prompt Injection, Jailbreak ve benzeri manipülasyon girişimleri açısından denetleyen güvenlik katmanıdır. AI Guardrails bütün yapay zekâ güvenlik ve kontrol mimarisini ifade ederken Prompt Firewall bunun daha spesifik bir bileşenidir. Ancak tek başına yeterli değildir; erişim kontrolü, araç yetkilendirmesi, çıktı doğrulama ve insan onayı gibi diğer güvenlik katmanlarıyla birlikte kullanılması gerekir.
📚 Kaynakça ve Bu Maddeye Atıf
APA Formatı: YZ Hocası. (2026). Prompt Firewall. YZ Hocası Ansiklopedisi. Erişim adresi: https://yzhocasi.com/prompt-firewall/
BibTeX: @misc{yzhocasi_1971, title={Prompt Firewall}, url={https://yzhocasi.com/prompt-firewall/}, journal={YZ Hocası Ansiklopedisi}, year={2026}}