Die Modelle nutzen eine ColBERT-Architektur und bilden Text- und Bildinhalte in einem gemeinsamen Embedding-Raum ab. Das kleinere Modell ist laut Perplexity für schnelle Abfragen und den Einsatz auf Edge-Geräten ausgelegt. Das 9B-Modell soll vor allem beim Erstellen hochwertiger Indizes zum Einsatz kommen. Eine einzelne Eingabe kann jedoch nicht gleichzeitig Text und Bilder enthalten.
Anders als dichte Embedding-Modelle, die ein Dokument in einem Vektor zusammenfassen, speichert pplx-embed-v2-late pro Token einen 128-dimensionalen Vektor. Die Suche vergleicht die Token-Vektoren von Anfrage und Dokument. Dadurch wächst der Index mit der Länge der Dokumente. Bei PDFs werden Seiten als Bilder verarbeitet; ein separater OCR-Schritt ist laut der Beschreibung nicht erforderlich.
Perplexity nennt 92,4 Prozent Genauigkeit auf dem Benchmark MADQA als bestes Ergebnis des 9B-Modells. Das niedrigste angegebene Resultat sind 61,2 Prozent auf ViDoRe v3 Markdown mit dem 0,6B-Modell. Die Werte stammen laut dem Unternehmen aus dessen eigener Ankündigung. Bei einer gemischten Nutzung kann das 9B-Modell den Index erstellen, während das kleinere Modell die Suchanfragen verarbeitet. Auf ViDoRe v3 bei der Bildsuche erreichte diese Kombination 63,5 Prozent; das 0,6B-Modell auf beiden Seiten kam auf 62,3 Prozent.
Beide Modelle stehen auf Hugging Face unter der MIT-Lizenz und können selbst gehostet werden. Für ihre Nutzung werden sentence-transformers ab Version 6.0.0 und transformers ab Version 5.4.0 benötigt; die veröffentlichten Modellgewichte liegen im F32-Format vor. Einen gehosteten API-Endpunkt hat Perplexity angekündigt, er ist derzeit aber noch nicht verfügbar.
