La kaŝita kosto de la nubo
Aŭtomata traduko el la itala. · legu la originalon
Ĉapitro 5 — La kaŝita kosto de la nubo
La reganta rakonto de la lastaj kvin jaroj diras, ke la nubo estas ekonomia, skalebla kaj simpla. Por multaj laborkargoj tio estas perfekte vera. Por entreprenaj RAG-aplikoj, ĉiam pli ofte, tio ne estas la kazo. Kaj la momento, kiam vi rimarkas tion, estas kutime la fino de la unua trimonestro, kiam alvenas la fakturo.
Prenu la plej subestimatan voĉon de la konto: la API-oj de la modeloj por bildovizio. Kiam entrepreno enigas sian fotoarkivon en modernan RAG, ĉiu foto devas esti "priskribita" de multmodela modelo, kiu elprenas enhavon, objektojn, kuntekston, eventualajn supermetitajn tekstojn, humoron, komponon. Granda eŭropa provizanto de modeloj — ankoraŭ sen nomo — ofertis, en 2025, elstaran modelon de la familio Qwen kun 32 miliardoj da parametroj, je interesa prezo por bildo. La problemo, malkovrita nur surloke kaj post monatoj da produktado: sub ŝarĝo, la provizanto tronkis la respondojn. Ne ĉiam, ne antaŭvideble, ne kiam la testa teamo estis antaŭe: hazarde. Unu foto el dek, foje unu el kvin, revenis kun JSON tranĉita duone, parse malbone, kun partaj aŭ nulaj metadatumoj. La tempoj ekflamis de dek sekundoj al ducent sekundoj por bildo, sen ŝablono. La fakturo de la reŝarĝo — ĉar la reŝarĝoj estas pagitaj, ĉiu vokado, eĉ tiu, kiun la servilo tronkas — estis pli alta ol atendite. La datumbazo estis malomogenea: iuj fotoj riĉaj je metadatumoj, aliaj stumpaj. Kaj la teamo ne povis reprodukti la problemon en testaj medioj, ĉar en testoj la ŝarĝo estis malalta kaj ĉio funkciis.
La solvo venis en tri partoj: pli kompakta peto (pli mallongaj respondoj malpli ofte tranĉiĝas), inteligenta logiko de ripetado (se la respondo daŭras pli ol kvindek sekundojn kaj revenas malplena, retribuu tuj) kaj — kiam la volumeno pravigas ĝin — la ebleco tute saltigi la nubon kaj funkciigi la modelon de vidado sur loka GPU, pli malrapida sed determinisma. La ĝusta arkitekturo, el ĉi tiu sperto, ne estas "ĉiam en la nubo" nek "ĉiam loka". Ĝi estas "elektu por ĉiu voko, laŭ kio bezonatas en tiu momento".
Tiam estas la ĉapitro de la serĉoj. Ĉiu serĉo de uzanto, en klasika RAG naskita en la nubo, elvokas kaskadon de pagendaj API-vokoj. Unu por la enmetado de la demando. Unu por la intenca klasifiko (de kiu tipo estas la demando?). Unu por la reordigo de la dokumentoj. Unu por la generacio de la fina respondo. Ĉiu kostas frakcion de cendimo. Por interna servo kun kvindek uzantoj kaj dek mil serĉoj tage — kio ne estas malmulto sed ankaŭ ne granda nombro por mezgranda entrepreno — la monata konto atingas ciferojn, kiuj eĉ indulgantan financdirektoron malĝojigus. Kaj la kresko estas lineara: duobligu la uzantojn, duobligu la konton. Ne ekzistas skalaj ekonomioj en la konsumitaj tokenoj, ne por vi.
Ekzistas ankaŭ problemo, kiu en 2025 estis subtila kaj en 2026 fariĝis centra: ĉiu ununura peto sendas erojn de entreprenaj dokumentoj — foje konfidencaj, foje kovritaj de NDA, foje submetitaj al branĉaj reguloj — al la serviloj de ekstera provizanto, en jurisdikcioj, kiuj ne ĉiam koincidas kun via, kun politiko pri konservado de logoj ne ĉiam klaraj. Pli ol unu eŭropa firmao, dum la lastaj dek ok monatoj, malkovris nur dum revizio — kutime instigita de zorgema kliento aŭ de ISO-kontrolo — ke ĝiaj kontraktoj, prezlistoj kaj teknikaj specifoj estis procesitaj (kaj eble logitaj por celoj de "plibonigo de servo") de infrastrukturoj ekster EU. La surprizo, kutime, kostis pli ol la ŝparoj sur la loka aparataro, kiun oni volis eviti.
La alternativo ne estas la kontraŭa dogmo. "Nubo ne, loka jes" estas tiel erara kiel "Ĉiam nubo". La alternativo estas arkitekturo kiu permesas al vi elekti, por ĉiu aparta parto de la pipeline — enmetado, klasifiko, reordigo, vidado, fina generacio — ĉu uzi nuban modelon aŭ lokan, kaj ŝanĝi opinion en unu tago, ne en unu trimonon. Ĉi tio postulas desegno en kiu la provizantoj estas interŝanĝeblaj, kie neniu parto estas fiksita al la nomo de specifa firmao, kie la transiro de Regolo al Ollama (aŭ inverse) estas linio de konfigurado, ne reskribo. Kaj ĉi tio, ĝis antaŭ nelonge, estis malofta. La popularaj framework-oj, malgraŭ la vizaĝo de "provizanto-nekunligita", fakte estis tre edziĝintaj kun iu.
Vi havas observon? Skribu al ni
La mesaĝo venas nur al ni. Se via komento estas interesa, ni povus publikigi ĝin ĉe la fino de la artikolo, sed nur post taksado.
Dum vi skribas, via retumilo solvas etan malgrandan kalkulan problemon: tio estas nia maniero forteni aŭtomatajn mesaĝojn sen uzi servon de tria persono kaj sen peti vin rekoni semaforojn. Vi ne ricevas demandon, kaj neniu dato forlasas ĉi tiun retejon.