H

EXP-048 Hibrit Hallucination Detector

Yüksek Lisans Araştırması · Engin Dalga
BERT :8001
NLI :8002
Hibrit :8003
API Adresi
Mod
NLI Eşik Parametreleri
Girdi
Hazır Test Setleri (JSON)
Tekli Test
Coklu Test
Proje & Metodoloji
Baglamı ve cevabı girin, Analiz Et'e tiklayin.
Ctrl+Enter ile hizli calistirin
JSON Satirlari (max 50)

Türkçe Büyük Dil Modelleri İçin Hibrit Halüsinasyon ve Doğruluk Denetim Hattı

Yüksek Lisans Tez Araştırma Projesi
Araştırmacı: Engin Dalga

Bileşen 1: İnce Ayarlı BERT Sınıflandırıcısı

Model: berturk_exp020 (Fine-Tuned dbmdz/bert-base-turkish-cased)

Türkçe RAG veri kümeleri üzerinde denetimli (supervised) olarak ince ayar yapılmıştır. Bağlam ve cevap arasındaki ilişkileri 5 sınıflı şemada hızlı bir şekilde sınıflandırır. Eğitim verisindeki alana özgü örüntüleri yakalamada etkilidir.

Shortcut Learning Analizi: Modeli sadece küçük/sentetik kümelerde eğitmenin, sentetik şablonları ezberleterek (shortcut learning) doğal test kümelerindeki doğruluğu düşürebildiği (örn: exp028'de %90'dan %55'e düşüş) gözlemlenmiştir. Bu yüzden model, genelleme yeteneğini koruyacak şekilde tasarlanmıştır.

Bileşen 2: Sıfır-Atışlı NLI Doğrulayıcısı

Model: MoritzLaurer/mDeBERTa-v3-base-xnli-multilingual-nli-2mil7

Kaynak metin ile cevap arasındaki anlamsal çıkarımı (entailment, neutral, contradiction) zero-shot (sıfır-atışlı) olarak değerlendirir. Eğitim görmediği yeni alanlardaki mantıksal çelişkileri ve bilgi uyuşmazlıklarını genel dil bilgisiyle yakalamada son derece kararlıdır.

Hibrit Entegrasyon: Sistem, BERT'in alana özgü örüntü yakalama hızı ile NLI'ın zero-shot genelleme gücünü paralel veya ardışık (cascading) bir birleştirme (ensemble fusion) algoritmasıyla harmanlayarak çalışır.

Gelecek Çalışmalar: Aşama 2 - Üretici LLM Katmanı (Roadmap)

Tez çalışmasının sonraki aşamalarında, bu hızlı hibrit mantıksal filtreyi (BERT + NLI) geçemeyen karmaşık veya şüpheli durumlar için LoRA/QLoRA ile ince ayar yapılmış Qwen2.5-7B-Instruct gibi üretici büyük dil modellerinin (LLM) entegrasyonu planlanmaktadır. Bu katman, sadece doğrulamakla kalmayıp kanıt çıkarma (evidence extraction) ve metin düzeltme önerisi sunacaktır.

Türkçe Çözümler ve Farkımız (Literatür & Karşılaştırma)

Türkçe Doğal Dil İşleme (NLP) literatüründe halüsinasyon ve doğruluk denetimi için mevcut yaklaşımlar ve bu çalışmanın getirdiği yenilikçi farklar aşağıda özetlenmiştir:

Yaklaşım / Rakip Çözümler Mevcut Durum ve Limitasyonlar Bizim Çözümümüz ve Farkımız
Turk-LettuceDetect
(newmindai/ModernBERT-tr-uncased-stsb-HD)
Token-level (kelime/token seviyesinde) çalışır. Hangi kelimenin halüsinasyon olduğunu etiketlese de, hatanın yapısını (çelişki mi, yetersiz bilgi mi, kısmi destek mi) sınıflandıramaz, karar politikası sunamaz ve açıklanabilirliği düşüktür. Claim-level (İddia Seviyesinde) ve Hibrit Karar: Metni bağımsız mantıksal iddialara ayırırız. Her iddia için 4-sınıflı (ACCEPT, WARN, REVISE, INSUF) tanı koyar, detaylı açıklama ve eylem kararı üretiriz.
Büyük Dil Modeli API'leri
(Örn: GPT-4o, Claude 3.5)
Yüksek maliyet, API gecikme süreleri (latency), veri gizliliği ihlalleri ve Türkçe dil yapısı üzerinde bazen gözden kaçan detaylar. Lokal ve Ultra-Hafif Altyapı: Tamamen yerel (on-premise) çalışabilen, CPU dostu 100M-300M parametreli modellerle sıfır maliyet ve yüksek hız sunarız.
Morfolojik ve Kelime Eşleşmeli Sistemler
(Örn: Zemberek, ROUGE/BLEU)
Sadece yüzeysel kelime ve n-gram benzerliği ölçerler. Anlamsal polarite değişimlerini (örn: "normal""yüksek" zıtlığı) yakalayamazlar. Derin Semantik Analiz: Metinlerin derin anlamsal temsillerini (contextual embeddings) kullanarak kelime benzerliğinden bağımsız anlamsal çelişki tespiti yaparız.

Metodoloji ve Hibrit Entegrasyon

Bu araştırma, Türkçe büyük dil modelleri ve metin üretim sistemlerinde "Hız, Maliyet ve Doğruluk" arasındaki optimum dengeyi aramaktadır. Bağlam uzunluğuna göre dinamik yönlendirme (routing) yapan hibrit yaklaşımımız, GPU/CPU işlem maliyetlerinde %70-80 oranında tasarruf sağlamakta ve doğruluk oranını en üst seviyede tutmaktadır.

Deney A: Girdi Gösterimi ve NLI Hipotez Şablonu (Hypothesis Representation)

NLI hipotezine soru kalıplarının eklenmesinin mantıksal genellemeyi bozduğu gözlemlenmiştir. Sadece iddia (claim_only) odaklı besleme, başarıyı dramatik olarak artırmıştır:

Model Girdi Şablonu Test Kümesi Doğruluk (Acc)
aniltepe/bert-base-nli-turkce Soru + Cevap + İddia (Şablonlu) Real20 30.0%
aniltepe/bert-base-nli-turkce Yalnızca İddia (Claim Only) Real20 90.0% (▲ 60.0%) Zero-Shot
mDeBERTa-v3-base-xnli Soru + Cevap + İddia (Şablonlu) Real20 45.0%
mDeBERTa-v3-base-xnli Yalnızca İddia (Claim Only) Real20 85.0% (▲ 40.0%) Zero-Shot

Deney C: Eğitim Stratejisi (Unlearning)

Strateji Diag300 (Sentetik) Real20 (Doğal)
Zero-Shot NLI (Untrained) 76.0% 90.0% Genelleme
Fine-Tuned NLI (exp028) 87.7% 55.0% Overfit

Deney D: Stage 2 LLM Karşılaştırması

Metrik (Diag300) Qwen-7B (EXP-012) Llama-8B (EXP-013)
Macro F1 0.9925 Seçilen 0.9419
Kısmi Destek Recall 1.0000 0.7600 (Zayıf ❌)
Çelişki Recall 0.9700 0.9800
JSON Geçerliliği 100.0% 97.9%