Yapay zekâ sözlüğü
İleri düzey
Prompt Enjeksiyonu (Prompt Injection)
Prompt Injection
29.08.2026 tarihinde güncellendi
Kötü niyetli talimatlarla modelin görevini, güvenlik sınırlarını veya araç kullanımını saptırma saldırısıdır.
Genel bakış
Kavramın çerçevesiPrompt enjeksiyonu, modelin kullanıcı talimatı ile güvenilmeyen veriyi aynı bağlamda görmesinden yararlanır. Saldırı doğrudan kullanıcı mesajında olabileceği gibi web sayfası, e-posta, PDF veya araç sonucuna gizlenebilir. Güvenilir talimatları veri içeriğinden ayırmak ve model çıktısını uygulama yetkisi saymamak temel savunmalardır.
Çalışma mantığı: Saldırgan metin, modelin önceliklendirme davranışını etkileyerek gizli bilgi isteme, kuralı yok sayma veya araç çağırma talebi üretir.
Kullanım alanları: RAG, web ajanı, e-posta asistanı, kod yardımcısı ve çok araçlı sistem güvenlik testlerinde değerlendirilir.
Sınırlılıklar: Tek bir filtre tüm varyasyonları yakalayamaz; izin izolasyonu, çıktı doğrulama, içerik temizleme ve insan onayı birlikte uygulanmalıdır.
Çalışma mantığı: Saldırgan metin, modelin önceliklendirme davranışını etkileyerek gizli bilgi isteme, kuralı yok sayma veya araç çağırma talebi üretir.
Kullanım alanları: RAG, web ajanı, e-posta asistanı, kod yardımcısı ve çok araçlı sistem güvenlik testlerinde değerlendirilir.
Sınırlılıklar: Tek bir filtre tüm varyasyonları yakalayamaz; izin izolasyonu, çıktı doğrulama, içerik temizleme ve insan onayı birlikte uygulanmalıdır.
Teknik tanım ve açıklama
Temel mekanizmaKullanıcı veya harici içerik içindeki talimatların, modelin asıl görev ve güvenlik kurallarını etkisizleştirerek istenmeyen davranış üretmeye çalışmasıdır.
Gerçek hayatta kullanım
Örnek senaryoBir belgeye gizli talimat eklenerek belge özetleme ajanından sistem promptunu göstermesi veya yetkisiz bir aracı çağırması istenebilir; uygulama bu içeriği güvenilmez kabul etmelidir.