Tek vektör yetmez.

Dense–sparse hibrit retrieval, ColBERT türü late interaction, vektör quantization ve reranking ile güvenilir kurumsal RAG mimarisini inceliyoruz.

FIG / 01 — RETRIEVAL UZAYISorgudan kanıta: üç geri getirme geometrisi
q
LEXICALSEMANTICTOKEN
Aday kapsama
88
İnce eşleşme
79
Hesap yükü
48

Değerler karşılaştırmalı tasarım göstergesidir; benchmark sonucu değildir.

ÖZ / ABSTRACT

2026 itibarıyla üretime uygun retrieval tek bir model değil; yüksek recall ile başlayan, kanıtı token düzeyinde sınayan ve pahalı kararı yalnız dar aday kümesinde veren bir hunidir.

Kurumsal bilgi erişiminde en iyi mimari her şeyi tek embedding’e çevirmek değildir. Exact-match, anlamsal benzerlik, token düzeyi etkileşim, kaynak yetkisi ve pahalı yeniden sıralama; ölçülebilir bir retrieval hunisinde farklı görevler üstlenir. Bu çalışma modern retrieval sistemini model seçimi değil, recall–precision–latency–bellek arasında doğrulanan bir karar sistemi olarak ele alır.

ANAHTAR KAVRAMLARmodern retrieval mimarilerihibrit aramadense retrievalsparse retrievalColBERTlate interaction
01 / RETRIEVAL SYSTEMS

Recall önce, precision sonra: retrieval problemini ikiye ayırmak

Retrieval-augmented bir sistemde üretici model yalnız retriever’ın getirdiği kanıtı görebilir. İlgili belge ilk aşamada elenirse daha güçlü LLM, daha uzun context veya daha iyi prompt bu kaybı geri alamaz. Bu yüzden aday üretiminin hedefi ilgili kanıtı top-k havuzuna sokmak; sıralamanın hedefi ise karar için en yararlı, güncel ve yetkili kanıtı üste taşımaktır. DPR, dense bi-encoder yaklaşımının open-domain QA’de güçlü bir aday üreticisi olabileceğini gösterdi; ancak raporlanan kazanımlar kendi veri kümeleri ve deney düzeniyle sınırlıdır. [01]

Dense retrieval eşanlam, paraphrase ve kavramsal yakınlıkta güçlüdür. Fakat ürün kodu, mevzuat numarası, kişi adı, model adı, nadir beceri ve olumsuzluk gibi ayrıntılar tek vektörde zayıflayabilir. Sparse retrieval exact-match sinyalini korur; SPLADE gibi learned sparse modeller transformer tabanlı term expansion’ı ters indeks ekonomisiyle birleştirir. [02] BEIR değerlendirmesinin temel uyarısı hâlâ geçerlidir: domain shift altında tek bir yöntem bütün veri kümelerinde üstün değildir; late interaction ve reranking çoğu zaman daha güçlü fakat daha pahalıdır. [12]

s_dense(q,d) = E_q(q) · E_d(d)
  • ATS: beceri adı ile transfer edilebilir deneyim aynı sinyal değildir.
  • Documents: madde numarası lexical, yükümlülük anlamı semantic kanaldır.
  • Procurement: SKU ve para birimi exact-match; muadil ürün ilişkisi semantic/graph sorusudur.
  • Studio: hata kodu lexical, benzer çözüm örüntüsü semantic sinyaldir.
02 / RETRIEVAL SYSTEMS

Dense + sparse hibrit: iki sinyali aynı puana zorlamamak

Hibrit retrieval’da BM25 veya learned sparse kanal ile dense ANN kanalı ayrı aday listeleri üretir. Ham puanları sabit bir katsayıyla toplamak kırılgandır; BM25 ve iç çarpım skorları aynı ölçeğe sahip değildir, dağılımları corpus ve sorgu uzunluğuyla değişir. Reciprocal Rank Fusion puan ölçeklerini değil sıraları birleştirir. Orijinal çalışma TREC düzeninde bireysel sıralamalara kıyasla ortalama MAP kazanımı bildirmiştir; bu tarihsel kanıt her yeni corpus’ta aynı oranın tekrarlanacağı anlamına gelmez. [03]

Üretimde query router bir kanalı tamamen kapatmamalı; aday bütçesini sorgu tipine göre ayarlamalıdır. Tam sipariş numarası, sertifika veya hata kodu lexical bütçeyi; doğal dille anlatılan niyet semantic bütçeyi büyütebilir. Tenant, ACL, dil, belge sürümü ve tarih filtresi relevance sıralamasından sonra değil, adayın sisteme girebildiği en erken güvenli noktada uygulanmalıdır. Post-filtering, kullanıcıya gösterilmese bile yetkisiz belgenin reranker veya üretici model context’ine taşınmasına yol açabilir.

RRF(d) = Σᵣ 1 / (k + rankᵣ(d))
SİSTEM MİMARİSİAday üretiminden kanıt sırasına
01 / QUERYSorguterim + niyet
02A / DENSEAnlamsal adayembedding uzayı
02B / SPARSELexical adaynadir terimler
03 / FUSIONAday birleşimikalibre skor
04 / RERANKToken düzeyi eşleşmekanıt sırası
03 / RETRIEVAL SYSTEMS

Late interaction: tek vektör ile cross-encoder arasındaki verimli orta katman

Bi-encoder belgeyi tek vektörde özetler; cross-encoder query ve belge token’larını birlikte işleyerek daha zengin etkileşim kurar ama her çift için yeniden inference gerektirir. ColBERT ayrı kodlamanın indeksleme avantajını korurken sorgu anında her query token’ını belgedeki en yakın token ile eşleştirir. Böylece ‘ISO 27001’, ‘fesih’ veya ‘React’ gibi ayrı kanıt parçaları tek bir global ortalamada kaybolmaz. [04]

ColBERTv2 residual compression ile token indeksinin alan ihtiyacını azaltır; PLAID centroid interaction ve pruning ile düşük skorlu pasajları erken eler. [05] [06] XTR ve WARP, retrieval ile scoring maliyetini daha da daraltmayı; MUVERA ise multi-vector benzerliğini sabit boyutlu temsillere indirip özgün benzerlikle refine etmeyi önerir. [07] [08] [09] Bu çalışmaların hızlanma oranları farklı donanım ve veri düzenlerinde ölçülmüştür; Nekibu performans tahmini değildir. Mimari karar kendi Türkçe–İngilizce corpus’unda kalite, latency ve bellek Pareto eğrisiyle verilmelidir.

s_late(q,d) = Σᵢ maxⱼ (Qᵢ · Dⱼ)
  • Doğru belge bulunuyor ama doğru pasaj üste çıkmıyorsa late interaction adaydır.
  • Birden çok ayrı kavramın aynı belgede karşılanması gerekiyorsa token düzeyi kanıt değerlidir.
  • Küçük corpus veya düşük trafikte hybrid + cross-encoder daha sade olabilir.
04 / RETRIEVAL SYSTEMS

Vektör sıkıştırma ve ANN: depolama kararı relevance kararıdır

N adet d boyutlu float32 vektörün yalnız ham belleği yaklaşık 4Nd bayttır. Multi-vector mimaride belge başına onlarca token vektörü bu maliyeti büyütür. Boyut azaltma, scalar quantization, product quantization ve binary/randomized quantization farklı hata profilleri üretir. Matryoshka Representation Learning bilginin embedding prefix’lerinde farklı ayrıntı düzeylerinde taşınmasını; Product Quantization alt uzayların codebook kimlikleriyle saklanmasını; RaBitQ ise teorik hata sınırı olan binary kodlamayı araştırır. [10] [11] [13]

ANN indeksi de kaliteyi belirler. Flat arama ground truth için yararlıdır; HNSW graph traversal ile yüksek recall sunar fakat bağlantı belleği tüketir; IVF yalnız seçilen centroid hücrelerini tarar; IVF-PQ büyük corpus için belleği düşürür; DiskANN veri RAM’i aştığında SSD ölçeğini hedefler. [14] [15] En güvenli desen çoğu zaman compressed retrieve → full-precision refine’dır: geniş aday kümesi ucuz indeksle gelir, daha küçük küme tam temsil veya güçlü modelle yeniden skorlanır. Yine de quantization hatasının hangi sorgu diliminde adayı kaybettiği ayrıca ölçülmelidir.

05 / RETRIEVAL SYSTEMS

Reranking: pahalı relevance kararını yalnız gereken yerde çalıştırmak

Cross-encoder query ve belgeyi ortak attention içinde değerlendirerek bi-encoder’dan daha ince bir relevance kararı verebilir. Ancak her aday için inference gerektiğinden ilk retriever değil, huninin son katmanı olmalıdır. monoT5 relevance’i üretilen token logit’leri üzerinden sıralama problemi olarak kurdu. [16] Üretimde üç ayrı derinlik izlenir: fusion depth ilgili kanıtın havuza girip girmediğini, rerank depth güçlü modelin yeterli adayı görüp görmediğini, context depth ise üreticiye kaç parçanın hangi token bütçesiyle taşındığını belirler.

k büyüdükçe recall artabilir ama kullanıcı faydası monoton artmaz. Benzer chunk’lar context’i tekrarlarla doldurabilir, alakasız fakat yüzeysel ikna edici parçalar modeli saptırabilir. Reranking sonrası deduplication, parent grouping, source diversity ve token-budget packing gerekir. BRIGHT çalışması, MS MARCO’da eğitilmiş reranker’ın reasoning-intensive veri üzerinde bazı ayarlarda kaliteyi düşürebildiğini gösterir. [17] ‘Reranker her zaman iyileştirir’ varsayımı yerine, relevance tanımı ürün görevine göre ölçülmelidir.

KARAR ÇERÇEVESİTek bir retrieval modu her sorguya yetmez
MİMARİSEMANTİKNADİR TERİMHESAP
Dense bi-encoderyüksekortadüşük
Sparse retrievalortayüksekdüşük
Hybrid fusionyüksekyüksekorta
Late interactionçok yüksekyüksekyüksek
06 / RETRIEVAL SYSTEMS

Nekibu için referans mimari: retrieval’dan karar kanıtına

Ortak hat belge alma ile başlar: yapı-aware chunking, tenant/ACL/sürüm/tarih metadata’sı, dense ve sparse temsiller, yeniden üretilebilir indeks sürümü. Sorguda önce hard filters uygulanır; lexical ve dense kanallar paralel aday üretir; RRF veya öğrenilmiş fusion adayları birleştirir; gerekli sorgularda late interaction ve küçük aday kümesinde cross-encoder çalışır. Son aşama kaynak çeşitliliği, parent-document grouping ve token bütçesiyle kanıt paketi üretir. Her cevap retrieval trace, indeks/model sürümü ve kaynak kimlikleriyle bağlanır.

ATS’de rol kriteriyle ilişkili doğrudan CV kanıtı; Documents’ta geçerli belge sürümü ve madde kapsamı; Procurement’da birim, para birimi, teslimat ve teknik eşdeğerlik; Studio’da workflow state, connector izni ve aksiyonun geri alınabilirliği relevance tanımının parçasıdır. Buna karşın erişim kontrolü ve geçerlilik yalnız neural skor içinde eritilmemeli; hard constraint olarak kalmalıdır. Ölçüm katmanı Recall@k ve nDCG yanında citation correctness, evidence coverage, ACL ihlali, p95 latency, indeks belleği ve üretici token maliyetini birlikte izlemelidir.

  • Baseline: BM25 + dense + RRF.
  • Ablation: kanalları tek tek kapatarak sorgu dilimi etkisini ölç.
  • Late interaction ve reranker’ı yalnız recall tavanı kanıtlandıktan sonra ekle.
  • Her embedding/quantizer sürümünü indeksle birlikte versionla; blue–green geçiş yap.
07 / RETRIEVAL SYSTEMS

Araştırma gündemi: kendi corpus’un olmadan kazanç iddiası yok

MS MARCO web aramasını, BEIR zero-shot transferi, SIFT1B görüntü descriptor’larını temsil eder; hiçbiri Nekibu’nun Türkçe–İngilizce, yetki kontrollü, sürekli güncellenen kurumsal corpus’unun vekili değildir. Relevance çoğu iş görevinde ikili de değildir: belge konuyla ilgili fakat karar için yetersiz, eski sürüm, dolaylı kaynak veya çelişkili olabilir. Etiket şeması ilgili / kanıtlayıcı / güncel / yetkili / çelişkili boyutlarını ayırmalıdır.

Embedding modeli, tokenizer, learned sparse vocabulary ve quantizer codebook indeksle birlikte sürümlenmelidir. Model değişiminde eski ve yeni embedding uzayları sessizce karıştırılmamalı; replay edilebilir ingestion ve karşılaştırmalı shadow index kullanılmalıdır. Yayınlanabilir Nekibu benchmark’ı ancak corpus snapshot’ı, sorgu seti, donanım, indeks parametreleri, recall noktası ve ölçüm tarihiyle yeniden üretilebildiğinde anlamlıdır.

KAYNAKLAR / ŞEFFAFLIK

Birincil ve resmî kaynaklar

Bu makale Nekibu Lab’in bağımsız teknik sentezidir. Dış çalışmalardaki bulgular Nekibu ürün sonucu veya performans garantisi değildir; her kaydın türü ve kullanım bağlamı görünür tutulur.

  1. [01] EMNLP 2020Dense Passage RetrievalDense bi-encoder ile open-domain QA retrieval.
  2. [02] PAPERSPLADELearned sparse retrieval ve term expansion.
  3. [03] SIGIR 2009Reciprocal Rank FusionPuan ölçeği yerine sıraları birleştiren fusion yöntemi.
  4. [04] SIGIR 2020ColBERTContextualized late interaction ve MaxSim.
  5. [05] NAACL 2022ColBERTv2Residual compression ile multi-vector retrieval.
  6. [06] PAPERPLAIDLate-interaction retrieval için pruning engine.
  7. [07] PAPERXTRMulti-vector retrieval’da token retrieval objective.
  8. [08] PAPER 2025WARPXTR tabanlı verimli multi-vector engine.
  9. [09] NEURIPS 2024MUVERAMulti-vector retrieval için fixed-dimensional encodings.
  10. [10] NEURIPS 2022Matryoshka Representation Learningİç içe embedding boyutları.
  11. [11] IEEE TPAMIProduct QuantizationYaklaşık nearest-neighbor için PQ temeli.
  12. [12] BENCHMARKBEIRHeterojen zero-shot retrieval benchmark’ı.
  13. [13] SIGMOD 2024RaBitQTeorik hata sınırlı randomized binary quantization.
  14. [14] RESMÎ DOKÜMANTASYONFaiss index guidanceFlat, HNSW, IVF ve PQ indeks seçim rehberi.
  15. [15] NEURIPS 2019DiskANNSSD ölçekli ANN mimarisi.
  16. [16] EMNLP 2020monoT5Sequence-to-sequence model ile document reranking.
  17. [17] BENCHMARKBRIGHTReasoning-intensive retrieval benchmark’ı.