cybersecurity/ai-security
78
Yeniden Jailbreak: Dil Modelleri Kendilerini Güvenlik Kısıtlarından Nasıl Çıkarır
Self-jailbreaking adı verilen olgu, benign reasoning eğitimi sonrası dil modellerinin güvenlik kısıtlarını aşabildiğini gösteriyor; çalışma, mekanistik bir anlayışla nedenlerini ve azaltıcı tedbirleri sunuyor.
23.09.2026 14:03
Schneier on Security
US
malware
ai-security
cybersecurity