Ne duyuruldu
Perplexity, pplx-embed-v2-late adlı iki modelli bir gömme (embedding) ailesini yayınladı. Modeller, ColBERT tarzı "geç etkileşim" (late interaction) yaklaşımını kullanıyor: bir belgeyi tek vektöre sıkıştırmak yerine her token için 128 boyutlu bir vektör saklıyor.
İki sürüm var:
- 0,6B: Dizüstü, uç cihaz veya küçük GPU'da çalışacak şekilde tasarlandı; canlı sorgu kodlayıcı olarak kullanılıyor.
- 9B: Veri merkezi veya yüksek belleğe sahip GPU'lar için; belge dizini oluşturmada kullanılıyor.
Neleri arayabiliyor
Her iki model de metin, görüntü ve görüntüye dönüştürülmüş PDF sayfalarını aynı vektör uzayında arayabiliyor. Sayfalar görüntü olarak kodlandığı için OCR adımına gerek kalmıyor. Modeller Hugging Face'te MIT lisansıyla paylaşıldı; ticari kullanıma izin veriliyor. Perplexity'nin barındırılan API uç noktası planlanıyor ancak henüz açık değil.
Öne çıkan sonuçlar
Perplexity'nin paylaştığı rakamlara göre 9B model, ajan tabanlı PDF soru-cevap testi MADQA'da %92,4 doğruluğa ulaşıyor. 0,6B model ise aynı testte %90,1 alıyor. Şirket, 9B ile oluşturulan bir dizinin 0,6B sorgularla aranabildiğini ve metin tarafında kalite farkının yaklaşık yarısının bu şekilde geri kazanıldığını belirtiyor.
Sınırlamalar
- Token başına bir vektör saklandığı için dizin boyutu belge uzunluğuyla büyüyor.
- Görüntü aramada (ViDoRe v3) birinci değil; Tencent'in EVIE modeli daha yüksek puan alıyor.
- Tek bir girdi metin ve görüntüyü karıştıramıyor.
- Tüm puanlar şirketin kendi açıklamasına dayanıyor ve teknik rapor henüz yayınlanmadı.



