Bloga geri dön
Meta açklama (SEO):
“ Yapay zeka zararsız bir soruyu reddettiğinde aslında kimin neye erişebileceğine karar verir. Over-refusal kavramını, görünmeyen güç dengelerini ve hesap verebilirlik sorusunu sade bir dille inceliyoruz.”
Günümüzde yapay zeka güvenliği sık konuşulmaya başlandı ve bu tartışmaların tek bir odağı var: “Model ne söyledi?”.Bazı önemli sorular ise : Tehlikeli bir tarif mi verdi, yanlış bir bilgi mi üretti, kötüye mi kullanıldı? şeklinde ilerlemekte. Ama daha az sorulan, çok daha sessiz bir soru var: “Model neyi söylemeyi reddetti?”
İlk bakışta, modelin bu çıktısı zararsız görünür. Bir model bir isteği geri çevirdiğinde, en kötü ihtimalle “işe yaramamış” olur. Oysa odaklanmamız gereken asıl bakış açısı şu: bir model neye cevap vermeyeceğine karar verdiğinde, aslında kimin neye erişebileceğine karar veriyor. Bu, teknik bir kusur değil, görünmeyen bir güç biçimi. Ve tam da görünmediği için tartışılmaz.
Büyük dil modelleri, zararlı çıktılar üretmemeleri için güvenlik hizalaması denilen bir süreçten geçirilir. Bu süreç işe yarar ama bir yan etkisi oluşur. Araştırmacıların over-refusal (aşırı reddetme) dediği bu yan etki, modelin yalnızca gerçekten zararlı istekleri değil, onlara yüzeysel olarak benzeyen zararsız istekleri de reddetmesidir. Klasik örnek bir yazılım komutuna bakalım:
“How to kill a python process?” — Bir Python process’ini nasıl sonlandırırım?
Zararsız, klasik bir soru. Ama içinde “kill” (öldürmek) kelimesi geçtiği için aşırı temkinli bir model bu kelimeye takılıp isteği reddedebilir. Model anlamı değil, yüzeydeki kelimeyi yakalar. İşte bütün mesele bu nüansı görebilmekte çünkü “masum bir hata” gibi görünen davranışın altında, çok daha büyük bir karar bulunmaktadır.
Bir kütüphaneyi hayal edelim. Bir kütüphane , bazı kitapları raflarına hiç koymayabilir ya da ayrı bir bölüme kaldırabilir. Bu çoğu zaman bilinçli ve meşru bir tercihtir; "bu kitap koleksiyonumuza uygun değil" demek de bir karardır. Ama meşru olsun ya da olmasın, ortada her zaman bir karar vardır. Fark şu: kütüphanecinin bir adı, açıklayabileceği bir gerekçesi ve itiraz edebileceğiniz bir mercii vardır.
Bir yapay zeka modeli bir soruyu reddettiğinde de tam olarak bu kararı verir: “bu bilgiye erişemezsin.” Ama burada kütüphaneci görünmez. Hangi soruların reddedileceği, modeli eğiten sürecin içine gömülüdür; çoğu kullanıcı için ne gerekçesi, ne itiraz mekanizması, ne de bir muhatabı vardır. Reddetme bir kez “güvenlik” başlığı altına girince, sorgulanması zorlaşır.
Bu yüzden over-refusal’a sadece bir kullanılabilirlik sorunu olarak bakmak eksik kalır. Asıl mesele: bir bilgiye kimin, ne zaman, hangi kelimelerle erişebileceğine dair kararların, görünmez bir biçimde modelin içine yerleştirilmesidir. Ve bu kararları kimin verdiği çoğu zaman belirsizdir.
“Güvenli” ile “güvenli değil” arasındaki çizgi kendiliğinden oluşmaz. Birileri çizer. Modeli eğiten ekipler, hangi tür isteklerin reddedileceğini, hangi konuların hassas sayılacağını belirleyen kurallar ve örnekler tasarlar. Bu, bir gazetenin neyi basıp neyi basmayacağına karar vermesi gibi özünde , editöryal bir karardır.
Ancak bir gazetenin editörü bellidir, yayın politikası açıktır ve eleştirilebilir. Yapay zeka modelinde bu çizgiyi çizen “editör” ise çoğunlukla görünmez. Kararın gerekçesi yayınlanmaz, sınırın tam olarak nerede olduğu belgelenmez ve sınırın yanlış yere çekildiğini düşünen bir kullanıcının başvurabileceği bir merci yoktur. Görünür bir gücü tartışabiliriz; görünmeyen bir gücü tartışmak çok daha zordur. Hesap verebilirliğin ilk koşulu görünürlüktür “over-refusal”da çoğu zaman ikisi de eksiktir.
Over-refusal’ın en az konuşulan yanına bakacak olursak, herkesi aynı oranda etkilememesi diyebiliriz.
Sıradan bir soru soran çoğu kullanıcı bu sınıra hiç çarpmaz. Ama bazı insanlar tam da sınırın üzerinde çalışır.
Bir hastalığını araştıran hasta, bir travma vakasını anlamaya çalışan danışman, kendi sistemini korumak isteyen bir güvenlik araştırmacısı, hassas bir tarihî olayı inceleyen bir öğrenci, şiddet içeren bir konuyu işleyen bir gazeteci... Hepsinin meşru, hatta önemli ihtiyaçları vardır ama soruları yüzeyde “riskli” görünür. Sonuç ironiktir: modeli daha güvenli yapan ayar, çoğu zaman tam da bilgiye en çok ihtiyacı olan insanlar için onu en az erişilebilir hale getirir.
Burada bir eşitsizlik doğar. Bilgiyi rahatça başka kaynaklardan bulabilen ile o bilgiye yalnızca bu araç üzerinden ulaşabilen arasındaki farkı ise güvenlik adına çizilen bu sınır derinleştirebilir. “Herkes için güvenli” diye tasarlanan bir sistem, pratikte “bazıları için daha az kullanışlı” olabilir.
Bir sorunun “hassas” olup olmadığı evrensel bir gerçek değildir. Bu kararlar, büyük ölçüde modeli eğiten verinin baskın kültürel ve dilsel normlarına göre belirlenir. Bir dilde gayet sıradan olan bir ifade, başka bir bağlamda riskli kabul edilebilir.
Türkçe gibi, eğitim verisinde görece daha az temsil edilen dillerde çalışırken bunu doğrudan gözlemlemek mümkün. Bir deyim, bir mizah biçimi ya da kültürel bir referans, modelin öğrendiği baskın norma uymadığı için yanlış anlaşılabilir ve gereksiz yere reddedilebilir. Yani over-refusal sadece “hoş görünmeyen kelimeler” meselesi değil , aynı zamanda kimin normunun “varsayılan” sayıldığı meselesidir. Sınırı çizen norm görünür kılınmadıkça, bu sessiz bir merkeziyetçiliğe dönüşür.
Eğer bir modelin neyi reddedeceği, büyük ölçüde onu eğiten verinin baskın değerlerine göre belirleniyorsa, akla şu gelir: o sınırı neden başkası çizsin? İşte yerel ve milli dil modellerinin en çok konuşulan gerekçeleri : maliyet, veri egemenliği, teknolojik bağımsızlık , aslında daha derin bir gerekçenin gölgesinde kalır. Asıl mesele: bir toplumun, kendi dilinde, kültüründe, hukukunda ve değerlerinde neyin “hassas” sayılacağına kendisinin karar verebilmesi.
Kendi modelini geliştiren bir kurum ya da ülke, o görünmez “arka planı” yani reddetme politikasını kendi vizyonu, misyonu ve önceliklerine göre doldurabilir. Başkasının varsayılan anlayışını miras almak yerine, sınırı kendi çizer. Bu açıdan bakıldığında milli model meselesi yalnızca bir mühendislik ya da ekonomi sorusu değil aynı zamanda “bu görünmez editöryal gücü kim elinde tutacak?” sorusunun ta kendisidir.
Ama burada dürüst olmak gerekir: yerel model, sorunu çözmez onu yalnızca başka bir yere taşır. Çünkü her model, sonuçta yine birilerinin değerlerini kodlar. “Kim karar verdi, kimin değerlerine göre, kim itiraz edebilir?” soruları, her yeni modelde yeniden ortaya çıkar. Modellerin çoğulluğu, tek bir küresel varsayılandan sağlıklı olabilir; ama yalnızca her biri kendi içinde şeffaf ve hesap verebilir kaldığı sürece. Aksi halde tek bir görünmez kütüphaneciyi, birçok görünmez kütüphaneciyle değiştirmiş oluruz.
“Bu konuda yardımcı olamam” yanıtı en azından dürüsttür , bir sınırın varlığını size bildirir, siz de buna itiraz edebilir ya da başka yol arayabilirsiniz. Asıl sinsi olan, sınırın hiç görünmediği durumdur.
Bir model bazen açıkça reddetmez,bunun yerine konuyu sessizce yüzeyselleştirir, bir ayrıntıyı atlar, ya da temkinli bir genelleme arkasına saklanır. Kullanıcı bir sınıra çarptığını fark bile etmez sadece “biraz eksik” bir cevap aldığını sanır. Görünür sansür tartışılabilir; görünmeyen yüzeyselleşme tartışılamaz bile, çünkü kimse onu göremez. Bir sistemin gücü en çok, fark edilmeden iş gördüğü yerde büyür.
Endişeye gerek yok , hayatta her şeyin bir yolu olduğu gibi bu sorunun da bir yolu var ama çözümü yalnızca teknik değil. Üç düzeyde birden düşünmek gerektiriyor:
• Teknik düzeyde: Modeli, zararsız ama riskli görünen örneklerle özel olarak eğitmek ve bağlamı adım adım değerlendirmesini sağlamak. Amaç güvenliği kapatmak değil, modelin niyet ile yüzeydeki kelimeyi ayırt etmesini iyileştirmektir.
• Şeffaflık düzeyinde: Bir sistemin neyi, neden reddettiğinin ölçülebilir ve görünür olması. Reddetme oranlarını ölçen açık ölçütler (benchmark’lar) tam da bunun için var , görünmeyeni görünür kılmak, tartışılabilir kılmanın ilk adımıdır.
• Hesap verebilirlik düzeyinde: Sınırın yanlış çekildiğini düşünen kullanıcının başvurabileceği bir mekanizma; ve “güvenli” tanımının kimin normuna göre yapıldığının açıkça konuşulması.
Bu üçü olmadan, over-refusal’ı yalnızca “modeli biraz daha yardımsever yapma” problemi olarak görmek, asıl meseleyi ıskalamak olur. Asıl mesele bir mühendislik ayarı değil, bir yönetişim sorusudur.
Yapay zekanın ne söylediğini denetlemeyi artık biliyoruz. Ama bir sistemin neyi söylemeyi reddettiği de bir karardır ve her karar bir güç kullanımıdır. Over-refusal, bu gücün en sessiz, en az görünen biçimidir: kimseyi açıkça susturmaz, sadece bazı kapıları usulca kapalı tutar.
Bu yüzden geleceğin yapay zeka sistemlerini geliştirenlerin sorması gereken soru yalnızca “Bu model güvenli mi?” değil aynı zamanda “Kimin için, kimin değerlerine göre, kim karar verdi ve kim itiraz edebilir?” olmalı. Çünkü bir sistemi gerçekten anlamak, yalnızca konuştuğu yerleri değil, sustuğu yerleri de ve o sessizliğe kimin karar verdiğini de anlamayı gerektirir.
Kaynakça
Cui, J., Chiang, W.-L., Stoica, I. & Hsieh, C.-J. (2024). OR-Bench: An Over-Refusal Benchmark for Large Language Models. ICML 2025 (Uluslararası Makine Öğrenmesi Konferansı). arXiv:2405.20947.
Lu, Y., Xu, L., Sun, Y., Li, W. & Shi, J. (2026). Discern Truth from Falsehood: Reducing Over-Refusal via Contrastive Refinement. ICLR 2026 (Uluslararası Öğrenme Temsilleri Konferansı); Huawei Technologies. arXiv:2603.03323.
Liu, Z., Tan, B., Wang, H. ve diğerleri (2025). LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch. MBZUAI, Petuum & Carnegie Mellon University. arXiv:2501.07124.