Reranking ist der zweite Filter in anspruchsvollen RAG-Systemen: Eine schnelle Vektorsuche ruft zunächst die zwanzig ähnlichsten Textstellen ab. Ein spezialisiertes Reranker-Modell liest diese Treffer nochmals genau durch und sortiert sie präzise nach ihrer tatsächlichen Aussagekraft für die Frage.
Reine Vektorsuchen lassen sich leicht durch verwandte Begriffe täuschen und übersehen feine Bedeutungsunterschiede oder Verneinungen. Ein Reranker erkennt den genauen Sinnzusammenhang und bringt die wirklich entscheidenden Absätze auf die Spitzenplätze.
Dadurch gelangt nur erstklassiger, hochrelevanter Kontext in das Sprachmodell. Das steigert die Qualität der finalen Antwort spürbar, senkt die Latenz und spart Token-Kosten, da unnötiger Textballast vorher herausgefiltert wird.