Model: berturk_exp020 (Fine-Tuned dbmdz/bert-base-turkish-cased)
Türkçe RAG veri kümeleri üzerinde denetimli (supervised) olarak ince ayar yapılmıştır. Bağlam ve cevap arasındaki ilişkileri 5 sınıflı şemada hızlı bir şekilde sınıflandırır. Eğitim verisindeki alana özgü örüntüleri yakalamada etkilidir.
Shortcut Learning Analizi: Modeli sadece küçük/sentetik kümelerde eğitmenin, sentetik şablonları ezberleterek (shortcut learning) doğal test kümelerindeki doğruluğu düşürebildiği (örn: exp028'de %90'dan %55'e düşüş) gözlemlenmiştir. Bu yüzden model, genelleme yeteneğini koruyacak şekilde tasarlanmıştır.
Model: MoritzLaurer/mDeBERTa-v3-base-xnli-multilingual-nli-2mil7
Kaynak metin ile cevap arasındaki anlamsal çıkarımı (entailment, neutral, contradiction) zero-shot (sıfır-atışlı) olarak değerlendirir. Eğitim görmediği yeni alanlardaki mantıksal çelişkileri ve bilgi uyuşmazlıklarını genel dil bilgisiyle yakalamada son derece kararlıdır.
Hibrit Entegrasyon: Sistem, BERT'in alana özgü örüntü yakalama hızı ile NLI'ın zero-shot genelleme gücünü paralel veya ardışık (cascading) bir birleştirme (ensemble fusion) algoritmasıyla harmanlayarak çalışır.
Tez çalışmasının sonraki aşamalarında, bu hızlı hibrit mantıksal filtreyi (BERT + NLI) geçemeyen karmaşık veya şüpheli durumlar için LoRA/QLoRA ile ince ayar yapılmış Qwen2.5-7B-Instruct gibi üretici büyük dil modellerinin (LLM) entegrasyonu planlanmaktadır. Bu katman, sadece doğrulamakla kalmayıp kanıt çıkarma (evidence extraction) ve metin düzeltme önerisi sunacaktır.
Türkçe Doğal Dil İşleme (NLP) literatüründe halüsinasyon ve doğruluk denetimi için mevcut yaklaşımlar ve bu çalışmanın getirdiği yenilikçi farklar aşağıda özetlenmiştir:
| Yaklaşım / Rakip Çözümler | Mevcut Durum ve Limitasyonlar | Bizim Çözümümüz ve Farkımız |
|---|---|---|
| Turk-LettuceDetect (newmindai/ModernBERT-tr-uncased-stsb-HD) |
Token-level (kelime/token seviyesinde) çalışır. Hangi kelimenin halüsinasyon olduğunu etiketlese de, hatanın yapısını (çelişki mi, yetersiz bilgi mi, kısmi destek mi) sınıflandıramaz, karar politikası sunamaz ve açıklanabilirliği düşüktür. | Claim-level (İddia Seviyesinde) ve Hibrit Karar: Metni bağımsız mantıksal iddialara ayırırız. Her iddia için 4-sınıflı (ACCEPT, WARN, REVISE, INSUF) tanı koyar, detaylı açıklama ve eylem kararı üretiriz. |
| Büyük Dil Modeli API'leri (Örn: GPT-4o, Claude 3.5) |
Yüksek maliyet, API gecikme süreleri (latency), veri gizliliği ihlalleri ve Türkçe dil yapısı üzerinde bazen gözden kaçan detaylar. | Lokal ve Ultra-Hafif Altyapı: Tamamen yerel (on-premise) çalışabilen, CPU dostu 100M-300M parametreli modellerle sıfır maliyet ve yüksek hız sunarız. |
| Morfolojik ve Kelime Eşleşmeli Sistemler (Örn: Zemberek, ROUGE/BLEU) |
Sadece yüzeysel kelime ve n-gram benzerliği ölçerler. Anlamsal polarite değişimlerini (örn: "normal" ↔ "yüksek" zıtlığı) yakalayamazlar. | Derin Semantik Analiz: Metinlerin derin anlamsal temsillerini (contextual embeddings) kullanarak kelime benzerliğinden bağımsız anlamsal çelişki tespiti yaparız. |
Bu araştırma, Türkçe büyük dil modelleri ve metin üretim sistemlerinde "Hız, Maliyet ve Doğruluk" arasındaki optimum dengeyi aramaktadır. Bağlam uzunluğuna göre dinamik yönlendirme (routing) yapan hibrit yaklaşımımız, GPU/CPU işlem maliyetlerinde %70-80 oranında tasarruf sağlamakta ve doğruluk oranını en üst seviyede tutmaktadır.
NLI hipotezine soru kalıplarının eklenmesinin mantıksal genellemeyi bozduğu gözlemlenmiştir. Sadece iddia (claim_only) odaklı besleme, başarıyı dramatik olarak artırmıştır:
| Model | Girdi Şablonu | Test Kümesi | Doğruluk (Acc) |
|---|---|---|---|
| aniltepe/bert-base-nli-turkce | Soru + Cevap + İddia (Şablonlu) | Real20 | 30.0% |
| aniltepe/bert-base-nli-turkce | Yalnızca İddia (Claim Only) | Real20 | 90.0% (▲ 60.0%) Zero-Shot |
| mDeBERTa-v3-base-xnli | Soru + Cevap + İddia (Şablonlu) | Real20 | 45.0% |
| mDeBERTa-v3-base-xnli | Yalnızca İddia (Claim Only) | Real20 | 85.0% (▲ 40.0%) Zero-Shot |
| Strateji | Diag300 (Sentetik) | Real20 (Doğal) |
|---|---|---|
| Zero-Shot NLI (Untrained) | 76.0% | 90.0% Genelleme |
| Fine-Tuned NLI (exp028) | 87.7% | 55.0% Overfit |
| Metrik (Diag300) | Qwen-7B (EXP-012) | Llama-8B (EXP-013) |
|---|---|---|
| Macro F1 | 0.9925 Seçilen | 0.9419 |
| Kısmi Destek Recall | 1.0000 | 0.7600 (Zayıf ❌) |
| Çelişki Recall | 0.9700 | 0.9800 |
| JSON Geçerliliği | 100.0% | 97.9% |