← Till artiklar
Quando l'AI aziendale non sa quello che sa Kapitel 2 av 6
AI 2026-04-16 ProtoMedia

Tabellerna som inte fanns

Maskinöversatt från italienska · läs originalet

Kapitel 2 — Tabellerna som inte fanns

En tekniker från ett mekaniskt företag i nordöstra Italien berättade det för oss framför en espresso, med den där lugnet som är typiskt för venetianare och som föregår en katastrof: "Vår chatbot visste allt om motorn. Utom motorns data." Sedan förklarade han. Deras interna AI-assistent kunde beskriva produktserierna, användningsområdena, varumärkets historia och konkurrensfördelarna. Ett underverk, ur ett narrativt perspektiv. Men när en kund frågade efter det nominella vridmomentet för modellen CMP50L — det tekniska värdet som får folk att öppna katalogen, det nummer som får en att köpa en motor — svarade chatboten vagt, ibland trovärdigt, ibland inte. Fem månaders utveckling, en alltmer förbryllad verkställande direktör, och ingen som visste varför.

Diagnosen kom av en slump, nästan av tristess, när jag manuellt inspekterade databasen efter ännu ett resultatlöst möte. PDF-katalogen innehöll 342 tekniska tabeller. I databasen hade noll anlänt. Inte en handfull: noll. Inga. Koden som extraherade tabellerna från PDF-filerna sparade data i fält som heter columns och data, medan koden som sedan indexerade dem förväntade sig fält som heter headers och rows. En "synonym" som inte respekterades. En intern konvention som hade hoppats över i en bortglömd refaktorering. Resultatet, under fem tysta månader: hela den numeriska intelligensen i katalogen — par, effekter, diametrar, vikter, beställningskoder, matningsspänningar — hade runnit ur kranen utan att någonsin hällas i glaset. Trehundratvå tabeller, förlorade en efter en i tyst liturgisk form.

Det här är den typen av bugg som inte skriker. Den höjer inga undantag, får inget att krascha och dyker inte upp i några loggar. Helt enkelt upphör en del av världen att existera för ditt system, och ingen märker det förrän en användare – vanligtvis en arg användare – ställer tillräckligt många envisa frågor för att visa hålet. Och det är ett tecken på ett mycket större problem än fältnamn: generiska RAG-ramverk är optimerade för löpande text – artiklar, webbsidor, stycken av berättande text – och behandlar tabeller som medborgare av andra klassen, när de behandlar dem. Men italienska företagsdokument är ofta tabeller. Tekniska kataloger, prislistor, produktspecifikationer, säkerhetsdatablad, beställningssedlar: den värdefulla delen, för den som konsulterar dessa dokument, är den tabellbaserade. Den som går sönder först och som ingen märker.

Lektionen är inte "var uppmärksam på fältnamnen". Den är mer besvärlig: i ett seriöst RAG behöver varje typ av innehåll — tabeller, bilder, alfanumeriska koder, styckrubriker, fotnoter — en dedikerad, designad och testad behandling. Och funktionalitetstestet är inte "chatboten svarar på banala frågor" — även trasiga system svarar på dem, eftersom det finns tillräckligt med flytande data för att bygga något plausibelt. Det verkliga testet är "chatboten svarar på frågor som tvingar den att röra vid varje enskild del av pipelinen". Specifika, numeriska, verifierbara frågor. Frågor för vilka det finns ett rätt och enda svar, och om systemet gör fel vet du det omedelbart.

Om du inte gör det här testet vet du inte om ditt RAG fungerar. Du vet bara att det inte klagar. Och "klagar inte" är ett mycket lågt kvalitetskriterium för ett system som människor kommer att använda för att fatta beslut.

Lektionen i korthet: Lita inte på automatisk tabellutvinning: testa den med specifika och numeriska frågor.

Har du en synpunkt? Skriv till oss

Meddelandet når endast oss. Om din kommentar är intressant kan vi publicera den längst ner i artikeln, men först efter godkännande.

Medan du skriver löser din webbläsare ett litet beräkningsproblem – vårt sätt att hålla ute automatiska inlägg utan tredjepartstjänster eller semafor-verifiering. Du behöver inte göra något och inga data lämnar denna sida.