deney · olgun

AST chunk'ları vs. düz pencereler

Aynı repo, aynı sorular: bir soruluk recall, MRR +0.09 — neredeyse tamamı sembol sıralaması.

Sözdizimi farkında chunking gerçekte ne kazandırıyor? Aynı repo'yu iki kez index'ledik — bir kez tree-sitter birimleriyle, bir kez aynı boyutta boş satır pencereleriyle — ve aynı 42 soruyu çalıştırdık.

ChunkerRecall@8MRREN düzyazıTR düzyazısembol R / MRR
tree-sitter birimleri0.7860.6900.842 / 0.7440.684 / 0.5701.0 / 1.0
boş satır pencereleri0.7620.5980.895 / 0.7370.632 / 0.5180.75 / 0.32

Dürüstçe okumak

  • Recall bir soru kadar oynadı. MRR 0.09 oynadı — ve neredeyse tamamı sembol query'leri (0.32 → 1.0) artı Türkçe dilim.
  • İngilizce düzyazıda düz pencereler eşit ya da daha iyiydi.
  • Yani AST chunking daha fazlasını bulmuyor. Doğru parçayı tepeye koyuyor ve adını biliyor. Bu sahip olmaya değer; ama 20 puanlık bir kaldıraç değil.

Literatür de aynı fikirde

cAST makalesi aynı boyuttaki satır pencerelerine karşı +1 ila +4 puan bildiriyor. Bağımsız kontrollü bir tekrar ≈ 0 buldu; bir üçüncüsü sabit pencereleri hafif önde buldu. Naif "fonksiyon başına bir chunk" ise güvenilir biçimde daha kötü (−4 ila −6 puan) — değer, küçük kardeşleri birleştirmekte ve boyutu sınırlamakta; sözdizimsel sınırın kendisinde değil. Reranking ve LLM'in yazdığı bağlam retrieval'ı 3–10 kat daha fazla oynatıyor.

#ablation #chunking #cast

Bu notu beyaz tahtada gör →