deney · olgun

Kullan-at deney

MiniLM, 30 soru: sembollerde BM25 dense'i geçti, fusion ikisine de yenildi, Türkçe 0.04 aldı.

Gerçek sistemden önce bir kullan-at sistem vardı: MiniLM-L6-v2, küçük bir Milvus, 30 soru. Neredeyse her konuda yanılıyordu ve amaç da zaten buydu.

recall@5sembol query'sidüz cümle
dense (MiniLM)0.600.62
BM250.800.36
ikisinin RRF'i0.600.52

Gerçek sisteme ne taşındı

  • Semboller BM25 ister. Bir embedding'in QUEUE_NAMES hakkında söyleyecek hiçbir şeyi yok; leksik bir index'in ise her şeyi var.
  • Her zaman birleştirmek bedava değil. RRF, kaybeden kanalın en iyi tahminini tam güçle öne çıkardı ve iki kanalın da tek başına aldığı sonucun altında kaldı.
  • Türkçe soru, İngilizce kod: 0.04. Bir retrieval hatası değil — eşleşecek Türkçe metin yoktu, o kadar. İki çözüm ileri taşındı: çok dilli bir embedder ve seçenek olarak LLM'in yazdığı açıklamalar.
  • Yerel modeller kayar. qwen2.5 yük altında cümle ortasında Çinceye geçti ve bunu söylemedi. O günden beri üretilen her açıklamanın alfabesi kontrol ediliyor.
#baseline #bm25 #multilingual

Bu notu beyaz tahtada gör →