20 Eyl'de yayınlandı

Bir dil modeline bir soru sorduğunuzda, bazen var olmayan bir kaynak uydurduğunu fark edersiniz. Var olmayan bir tarih, var olmayan bir isim, hiç yazılmamış bir makale. Cümle akıcı, ton kendinden emin, ama içerik boş.
Dil modelleri uydurma bilgi üretiyor çünkü eğitim sürecinde doğru cevap değil, olası cevap ödüllendiriliyor. Model "bilmiyorum" demek yerine tahmin ettiğinde, sınav mantığıyla çalışan değerlendirme sistemlerinde daha başarılı görünüyor. Bunu OpenAI'de çalışan araştırmacılar 2025'te bir çalışmada matematiksel olarak gösterdi: emin olmayan öğrencinin boş bırakmak yerine tahmin etmesi gibi.
Bu cümle kulağa basit geliyor, sonuçları basit değil.
Zor bir sınavda, bilmediğiniz bir soruyla karşılaştığınızda ne yaparsınız. Boş mu bırakırsınız, yoksa en olası şıkkı mı işaretlersiniz. Çoğu insan işaretler, çünkü boş bırakmanın puanı sıfır, tahmin etmenin ihtimali var.
Aynı yayınlanmış çalışma, bir dil modelinin eğitiminde de buna benzer bir baskı olduğunu söylüyor. Modelin bir sonraki kelimeyi tahmin edecek şekilde eğitilmesi bir yana, sonrasında modeli değerlendiren testler de genelde ikili çalışıyor: doğru ya da yanlış. "Emin değilim" demenin ayrı bir puanı yok çoğu testte. O yüzden tahmin etmeyi öğrenen model, testte daha iyi görünüyor, gerçek dünyada daha sık hata yapsa bile.
Sınav benzetmesi burada bir yere kadar taşıyor. Sınavda tahmin eden öğrenci, tahmin ettiğini bilir. İçeride bir yerde "emin değilim" sinyali yanar, kâğıdı teslim ettikten sonra da o sinyal kaybolmaz.
Modelde böyle bir sinyal ya yok, ya da güvenilir değil. Anthropic'in 2025 baharında yayınladığı bir araştırma, model bir isme rastladığında iki mekanizmanın yarıştığını gösteriyor: biri varsayılan olarak "bu soruyu cevaplayamam" yönünde çalışıyor, diğeri "bu ismi tanıyorum" sinyali veriyor. İkincisi baskın çıktığında model cevap veriyor. Ama bir ismi tanımak, o kişi hakkında doğru bilgiye sahip olmakla aynı şey değil. Araştırmacılar, var olmayan bir kişiye gerçek bir sporcunun ismiyle aynı "tanıdık" sinyalini yapay olarak verdiklerinde, modelin o kişi için de uydurma bir biyografi yazdığını gösterdi.
Yani model, "emin değilim" ile "bu isim tanıdık geliyor"u güvenilir biçimde ayıramıyor. Sınav öğrencisinin ayırabildiği yeri, model ayıramıyor. Benzetme tam burada bozuluyor, ve bence yazının geri kalanını belirleyen de bu.
| Kaynak | Yıl | Ne gösteriyor |
|---|---|---|
| OpenAI araştırma ekibi, değerlendirme sistemleri üzerine çalışma | 2025 | Testler tahmini ödüllendiriyor, belirsizliği değil |
| Anthropic, model içi devre analizi | 2025 | "Tanıdık isim" sinyali ile gerçek bilgi ayrı mekanizmalar |
| Hesaplanabilirlik kuramına dayanan çalışma | 2024, güncelleme 2025 | Halüsinasyon matematiksel olarak tamamen önlenemiyor |
| Türkçe RAG halüsinasyon tespiti çalışması | 2025 | Türkçede otomatik tespit İngilizceden daha zor |
Model kendi bilmediğini güvenilir biçimde bilemiyor. SimpleQA adlı ölçüm çalışması, 4.326 kısa ve tek doğru cevabı olan soru üzerinden modelleri üç kategoriye ayırıyor: doğru, yanlış, cevap verilmemiş. Amaç şu: model bilmediği zaman susuyor mu, yoksa yine de bir şey mi söylüyor. Ölçüldüğünde çoğu modelin susma oranı düşük çıkıyor. Bilmediği konuda da bir cevap üretme eğilimi baskın.
Bunun bir başka anlamı da şu: cevaptaki kendinden emin ton, doğruluğun kanıtı değil. Model aynı akıcılıkla hem doğru hem yanlış cümle kuruyor, ikisi arasında biçim farkı yok.
Türkçede işler daha da karışık. Türkçe RAG uygulamaları için halüsinasyon tespiti üzerine yapılan bir çalışma, Türkçenin çekim eki bakımından zengin yapısının, bir cümlenin kaynağa sadık olup olmadığını otomatik tespit etmeyi zorlaştırdığını gösteriyor. Araştırmacılar, İngilizce hazırlanmış 17.790 örneklik bir veri setini makine çevirisiyle Türkçeye aktarıp kendi tespit modellerini eğitmiş, en iyi sonuç F1 ölçeğinde 0,73 civarında kalmış. Doğal Türkçe metin değil bu, çeviri metin üzerinden elde edilmiş bir sonuç, o yüzden temkinli okumak lazım.
Bu bana Türkçede halüsinasyonun İngilizceden daha sık olduğunu söylemiyor, kimse bunu henüz güvenilir biçimde ölçmedi. Söylediği şu: Türkçede bir cümlenin uydurma olup olmadığını otomatik yakalamak, İngilizceden daha zor. İkisi aynı iddia değil.
Bunun iki cevabı var, ikisi de doğru ve birbirini tamamlıyor.
Birincisi pratik. Yukarıda andığım çalışma, meselenin büyük ölçüde değerlendirme sisteminde olduğunu söylüyor. Model "bilmiyorum" dediğinde bugünün çoğu testinde sıfır puan alıyor, tahmin edip tutturduğunda tam puan alıyor. Test bu şekilde kurulduğu sürece, tahmin etmeyi öğrenen model daha başarılı görünüyor.
İkincisi teorik, ve daha az iç açıcı. 2024'te yayınlanıp 2025'te güncellenen bir çalışma, hesaplanabilirlik kuramını kullanarak halüsinasyonun yalnızca azaltılabileceğini, tamamen ortadan kaldırılamayacağını gösteriyor. Model, öğrenebileceği fonksiyonların sınırlı bir kümesiyle çalışıyor, gerçek dünyanın tamamı o kümeye sığmıyor. Bu, düzeltilebilecek bir mühendislik hatası değil, yapının kendisinden geliyor.
Altı yıldır model kuruyorum, bu ikisini bir arada tutmak bazen zor geliyor. Bir yandan ölçüm ve eğitim yöntemini düzeltince oran düşüyor, öbür yandan sıfıra inmeyeceğini gösteren bir kanıt elimizde duruyor. Oranın ne kadar düşebileceğini kimse net söylemiyor, ben de bilmiyorum.
Günlük kullanımda karşılığı şu: modelin ürettiği isim, tarih, rakam ya da alıntı, doğrulanmadan gerçek sayılmamalı. Özellikle model bunu düz ve akıcı bir dille söylüyorsa. Akıcılık ile doğruluk aynı şey değil, yukarıda gördük.
Model işe yaramaz demek değil bu. Yapılandırılmış görevlerde, yani modelin elindeki bir metne sadık kalması istenen görevlerde, hata oranı belirgin biçimde daha düşük çıkıyor, Türkçe çalışma da bunu gösteriyor. Sorun, model kendi hafızasından bir bilgiyi geri çağırdığında büyüyor. Soru "yapay zekâ güvenilir mi" değil. Soru şu: hangi görevde, hangi kaynağa dayanarak konuşuyor.
Yapay zekâ neden yalan söylüyor? Yalan demek doğru değil, çünkü yalan bilinçli bir seçim gerektirir. Model, olası bir cümleyi doğru bir cümleden güvenilir biçimde ayıramadığı için hatalı bilgi üretiyor. Niyet yok, istatistiksel bir hata var.
Halüsinasyon tamamen önlenebilir mi? Elimizdeki kanıtlara göre hayır. Oranı düşürmek mümkün, tamamen sıfırlamak matematiksel bir sınıra takılıyor.
Hangi modeller daha az uyduruyor? Bu yazı model karşılaştırması yapmıyor, çünkü o karşılaştırma birkaç ay içinde eskiyor. Genel eğilim zaman içinde oranların düştüğü yönünde, ama hiçbiri sıfıra inmiyor.
Türkçe kullanırken nelere dikkat etmeliyim? Modelin ürettiği isim, tarih ve sayıyı ayrıca doğrulayın, özellikle model kendi hafızasından bir bilgi geri çağırıyorsa. Türkçede bunu otomatik yakalayan araştırmalar da henüz yeni.
Model "bilmiyorum" diyebiliyor mu? Diyebiliyor, ama nadiren. Ölçümler, modellerin bilmediği durumda bile bir cevap üretme eğilimini gösteriyor.
YORUMLAR · 0
İlk yorumu sen yaz.
YORUMLAR · 0
İlk yorumu sen yaz.
İLGİLİ YAZILAR