← Zpět k článkům
Quando l'AI aziendale non sa quello che sa Kapitola 2 z 6
AI 2026-04-16 ProtoMedia

Tabulky, které neexistovaly

Přeloženo automaticky z italštiny · přečíst originál

Kapitola 2 — Tabulky, které neexistovaly

Technik z jedné strojírenské firmy ze severovýchodu nám to pověděl u espressa, s tím klidem, který je pro lidi z Benátska typický a předznamenává katastrofu: "Náš chatbot věděl o motoru všechno. Kromě dat o motoru." Pak to vysvětlil. Jejich interní AI asistent uměl popisovat produktové řady, kontext použití, historii značky, konkurenční výhody. Zázrak, z narativního hlediska. Ale když se zákazník zeptal na jmenovitý točivý moment modelu CMP50L – tedy na technické údaje, kvůli kterým lidé otevírají katalog, číslo, za které se kupuje motor – chatbot odpovídal vágně, někdy věrohodně, někdy ne. Pět měsíců vývoje, provozní ředitel stále zmatenější a nikdo nevěděl proč.

Diagnóza přišla náhodou, téměř z nudy, při ruční kontrole databáze po další neskončené schůzce. PDF katalog obsahoval 342 technických tabulek. V databázi se jich objevilo nula. Ne hrstka: nula. Žádná. Kód, který extrahoval tabulky z PDF, ukládal data do polí s názvy columns a data, zatímco kód, který je následně indexoval, očekával pole s názvy headers a rows. Nerespektovaný "synonymum". Vnitřní konvence, která se vytratila v zapomenutém refaktoringu. Výsledek, po pěti měsících ticha: celá numerická inteligence katalogu – páry, výkony, průměry, váhy, objednávací kódy, napájecí napětí – vytékala z kohoutku, aniž by byla někdy nalita do sklenice. Tři sta čtyřicet dvě tabulek, ztracených jedna po druhé v liturgickém tichu.

Toto je typ chyby, která nekřičí. Nevyvolává výjimky, nezpůsobuje pády, neobjevuje se v žádných protokolech. Jednoduše, část světa přestane pro váš systém existovat a nikdo si toho nevšimne, dokud uživatel – obvykle rozzlobený uživatel – nepoloží dostatečně vytrvalé otázky, aby ukázal propast. A to je symbolické pro mnohem větší problém než názvy polí: generické frameworky RAG jsou optimalizovány pro běžný text – články, webové stránky, odstavce beletrie – a zacházejí s tabulkami jako s občany druhého řádu, když s nimi zacházejí vůbec. Ale italské firemní dokumenty jsou často tabulky. Technické katalogy, ceníky, specifikace produktů, bezpečnostní listy, objednávkové formuláře: cenná část, pro ty, kteří tyto dokumenty konzultují, je tabulková. Ta, která se rozbije jako první a které si nikdo nevšimne.

Lekce není "dej si pozor na názvy polí". Je to nepříjemnější: v seriózním RAG (Retrieval-Augmented Generation) potřebuje každý typ obsahu – tabulky, obrázky, alfanumerické kódy, nadpisy odstavců, poznámky pod čarou – specializované zpracování, které je navrženo a otestováno. A funkční test není "chatbot odpovídá na triviální otázky" – na ty odpovídají i rozbité systémy, protože existuje dostatek dat, aby se dalo sestavit něco věrohodného. Skutečný test je "chatbot odpovídá na otázky, které ho nutí oslovit každý jednotlivý díl pipeline". Specifické, číselné, ověřitelné otázky. Otázky, na které existuje jedna správná odpověď, a pokud systém udělá chybu, hned to poznáte.

Pokud tento test neprovedete, nevíte, zda váš RAG funguje. Víte jen, že se nestěžuje. A "nestěžuje si" je velmi nízké kritérium kvality pro systém, který lidé budou používat k rozhodování.

Lekce v kostce: Nedůvěřujte automatické extrakci tabulek: otestujte ji specifickými a číselnými otázkami.

Máte připomínku? Napište nám

Zpráva je určena pouze nám. Pokud bude váš komentář zajímavý, můžeme ho zveřejnit na konci článku, ale až po posouzení.

Zatímco píšete, váš prohlížeč řeší drobný výpočet – to je náš způsob, jak zabránit automatické poště bez použití externích služeb a bez nutnosti rozpoznávat semafory. Nic se vás neptáme a žádná data toto místo neopustí.