Den løgnaktige rerankeren
Automatisk oversatt fra italiensk · les originalen
Kapittel 3 — Den løgnaktige rerankeren
I den tekniske sjargongen innen RAG er det en nøkkelfigur, lite glamorøs og lite fortalt: rerankeren. Se for deg bedriftsøket som inngangen til en nattklubb. Vektordatabasen er dørvakten: den ser raskt på folkemengden og slipper inn tretti kandidater som, ved første øyekast, ligner det du leter etter. Rerankeren er den interne vakten: den tar de tretti, ser nøye på dem, velger fem – de som LLM faktisk vil lese for å konstruere svaret – og sender de andre tjuefem tilbake. Det er en liten, men enorm funksjon: hvis han tar feil, tar alle feil. Hvis vakten ikke kan lese ansikter, fylles lokalet med feil folk, og ingen vil noen gang forstå hvorfor kvelden gikk dårlig.
I 2025 dukket det opp flere cloud-tjenester på markedet som tilbød rerankere som API-er. Du sender et spørsmål og en liste over dokumenter, og de returnerer poengsummer. Praktisk, skalerbart, ingen GPU-er å kjøpe, ingen modeller å laste ned. En kjent europeisk modellleverandør – uten å nevne navn, men du vet hvilke navn vi unngår – eksponerte en lovende modell fra Qwen-familien, med fire milliarder parametere, merket "Reranker". Prisen var rimelig, latensen akseptabel. Alle, på det tidspunktet, ville valgt den. Mange valgte den.
Med mindre poengsummene var feil. Ikke "lett" feil, som kan skje med enhver modell: feil i strukturen. Dokumenter som åpenbart var relevante fikk 0,2, dokumenter som var utenfor tema fikk 0,8. De første mistankene, som alltid i disse tilfellene, ble rettet mot de vanlige skyldige: embedding-modellen, chunking, formuleringen av spørringen, forbehandlingen av dokumentene. Uker med etterforskning på feil spor. Først ved systematisk å sammenligne svarene fra den skybaserte rerankeren med en lokal referanse-reranker – samme input, de samme dokumentene, poengsummer satt side om side i et Excel-ark – kom den ubehagelige sannheten frem: modellen som ble eksponert via API-et var ødelagt. Kanskje en deployeringsfeil, kanskje en feil versjon lastet opp ved en feil, kanskje en feil i serialiseringen av poengsummene. Leverandøren har aldri formelt innrømmet det. Problemet forsvant imidlertid bare en dag, etter en stille oppdatering og ingen endringsnotater.
Poenget med denne historien er ikke "skytjenester tar feil" — alle tar feil, selv lokale modeller tar feil. Poenget er mer subtilt: i en seriøs RAG, er rerankeren en del du må kunne se inn i. Hvis det er en betalt sort boks, og hvis dens utdata er tall som virker plausible selv når de er tilfeldige — og poengsummene fra en reranker virker alltid plausible, fordi de er tall mellom null og en med noen desimaler — har du ingen måte å forstå hva som er galt i systemet ditt. Og siden rerankeren er "mot slutten" av pipelinen, forurenser dens feil enhver evaluering oppstrøms: søket virker tregt, spørringen feil, embeddings dårlige. I virkeligheten er det vakten som ikke kan lese ansikter, og du stiller spørsmål ved dørens glass.
Valget mot strømmen for noen team de siste månedene – i stedet for å gå mer mot skyen, å gå tilbake – har vært å bringe rerankeren hjem. En åpen kildekode-modell fra BGE-familien, ikke gigantisk, kjørt på lokal GPU (også på Apple Silicon, med litt forsiktighet rundt driverne). Mer administrasjonsarbeid, det er sant. Men muligheten til å gjøre kontrollerte eksperimenter, forstå når den feiler, sammenligne versjoner, holde en historikk. Og – ikke minst – å ikke betale API-en en brøkdel av en cent for hvert enkelt brukersøk. En brøkdel som, multiplisert med titusenvis av spørringer i måneden, raskt slutter å være en brøkdel og blir en budsjettpost.
Når en komponent er så kritisk at dens feilfunksjon ødelegger din evne til å måle alt annet, er det å delegere den til en sort boks ikke effektivitet. Det er en trosgjerning. Og trosgjerninger, i produksjon, betales med renters rente.
Har du en kommentar? Skriv til oss
Meldingen kommer kun til oss. Hvis kommentaren din er interessant kan vi publisere den nederst i artikkelen, men først etter vurdering.
Mens du skriver, løser nettleseren din et lite regnestykke – vår måte å hindre automatisk spam uten tredjepartstjenester eller «velg semafor»-oppgaver. Du trenger ikke gjøre noe, og ingen data forlater dette nettstedet.