deney · büyüyor
Türkçe soru, İngilizce kod
Çok dilli bir embedder TR düzyazıyı 0.04'ten 0.684'e taşıdı; LLM'in yazdığı açıklamalar MRR'ı 0.93'e çıkardı.
Kullanıcılar Türkçe soruyor; kod, yorumlar ve commit mesajları İngilizce. Metin o köprüyü kurmadıkça bir bi-encoder'da bu boşluğu kapatacak hiçbir şey yok.
Birinci adım: çok dilli bir embedder
Tek başına BGE-M3, Türkçe düzyazıyı 0.04'ten 0.684'e taşıdı. Aynı corpus'ta İngilizce düzyazı 0.842'de; yani ~16 puanlık bir fark kaldı.
İkinci adım: eksik metni yaz
Contextual retrieval, koda uygulanmış hâli: dosya başına bir LLM çağrısı, her chunk için 2–3 cümlelik Türkçe bir açıklama döndürüyor. Açıklama yalnızca embed edilen / BM25'e giren metne giriyor — modele gösterilen chunk gerçek kaynak olarak kalıyor. chunk hash'i + model ile cache'leniyor; bir re-index asla iki kez ödemiyor.
| Aynı 46 dosya / 423 chunk | Recall@8 | MRR | TR düzyazı MRR | yanlış weak-match |
|---|---|---|---|---|
| enrichment yok | 0.929 | 0.839 | 0.778 | 0.119 |
| enriched (yerel qwen3.5:9b) | 1.000 | 0.912 | 0.932 | 0.048 |
Negatifler değişmedi (abstain iki durumda da 0.923) — açıklamalar alakasız sorularda güven üretmedi — ve skor kalibrasyonu yerinden oynamadı.