ตัวจัดอันดับใหม่ที่โกหก
แปลโดยอัตโนมัติจากภาษาอิตาลี · ดูต้นฉบับ
บทที่ 3 — ตัวจัดอันดับใหม่ที่โกหก
ในศัพท์เฉพาะทางของ RAG มีบุคคลสำคัญที่ไม่ค่อยมีเสน่ห์และไม่ค่อยมีการเล่าถึง นั่นคือ ตัวจัดอันดับใหม่ ลองจินตนาการถึงการค้นหาข้อมูลขององค์กรเหมือนทางเข้าสู่ไนต์คลับ ฐานข้อมูลเวกเตอร์คือพนักงานรักษาความปลอดภัย: มองดูฝูงชนอย่างรวดเร็วและให้ผู้สมัครสามสิบคนเข้ามา ซึ่งดูเหมือนสิ่งที่คุณกำลังมองหา ตัวจัดอันดับใหม่คือพนักงานรักษาความปลอดภัยภายใน: หยิบผู้สมัครสามสิบคนนั้น มองพวกเขาอย่างใจเย็น เลือกห้าคน—คนที่ LLM จะอ่านจริงๆ เพื่อสร้างคำตอบ—และส่งผู้สมัครยี่สิบห้าคนอื่นๆ กลับไป มันเป็นฟังก์ชันเล็กๆ แต่ยิ่งใหญ่: ถ้าเขาทำผิดพลาด ทุกคนก็จะทำผิดพลาด ถ้าพนักงานรักษาความปลอดภัยไม่สามารถอ่านสีหน้าได้ สถานที่นั้นก็จะเต็มไปด้วยคนที่ไม่ถูกต้อง และไม่มีใครจะเข้าใจได้เลยว่าทำไมคืนนั้นถึงแย่
ในปี 2025 มีบริการคลาวด์หลายแห่งปรากฏขึ้นในตลาด ซึ่งนำเสนอตัวจัดอันดับใหม่ในรูปแบบ API คุณส่งคำถามและรายการเอกสาร และพวกเขาจะส่งคืนคะแนน สะดวก ปรับขนาดได้ ไม่ต้องซื้อ GPU ไม่ต้องดาวน์โหลดโมเดล ผู้ให้บริการโมเดลชื่อดังในยุโรป—โดยไม่ระบุชื่อ แต่คุณรู้ว่าเรากำลังหลีกเลี่ยงชื่อใด—ได้เปิดตัวโมเดลที่น่าสนใจจากตระกูล Qwen ซึ่งมีพารามิเตอร์สี่พันล้านตัว และติดป้ายกำกับว่า "ตัวจัดอันดับใหม่" ราคาเหมาะสม ความหน่วงยอมรับได้ ใครๆ ในช่วงเวลานั้นก็จะเลือกมัน หลายคนเลือกมัน
ยกเว้นว่าคะแนนนั้นผิดพลาด ไม่ใช่ผิดพลาดเพียงเล็กน้อยอย่างที่อาจเกิดขึ้นกับโมเดลใดๆ แต่ผิดพลาดในเชิงโครงสร้าง เอกสารที่เกี่ยวข้องอย่างชัดเจนได้รับคะแนน 0.2 ในขณะที่เอกสารที่ไม่เกี่ยวข้องได้รับคะแนน 0.8 ความสงสัยเบื้องต้นเช่นเดียวกับในกรณีเหล่านี้มักจะมุ่งไปที่ผู้ต้องสงสัยรายเดิมๆ: โมเดลการฝังตัว การแบ่งส่วน การกำหนดสูตรคำค้นหา การประมวลผลเอกสารล่วงหน้า สัปดาห์แห่งการสืบสวนตามเส้นทางที่ผิด เพียงแค่เปรียบเทียบคำตอบของ reranker บนคลาวด์กับ reranker อ้างอิงในเครื่องอย่างเป็นระบบ—อินพุตเดียวกัน เอกสารชุดเดียวกัน คะแนนที่วางเคียงข้างกันบนสเปรดชีต Excel—ความจริงที่ไม่น่าพอใจก็ปรากฏขึ้น: โมเดลที่เปิดเผยผ่าน API นั้นเสีย อาจเป็นข้อผิดพลาดในการปรับใช้ อาจเป็นเวอร์ชันที่ไม่ถูกต้องที่อัปโหลดโดยไม่ได้ตั้งใจ หรืออาจเป็นข้อบกพร่องในการจัดลำดับคะแนน ผู้ให้บริการไม่เคยยอมรับอย่างเป็นทางการ ปัญหาหายไปเองในวันหนึ่งหลังจากการอัปเดตแบบเงียบๆ และไม่มีการเปลี่ยนแปลงในบันทึกการเปลี่ยนแปลง
ประเด็นสำคัญของเรื่องนี้ไม่ใช่ "บริการคลาวด์ผิดพลาด"—ทุกคนผิดพลาด แม้แต่โมเดลในเครื่องก็ผิดพลาดได้ ประเด็นสำคัญนั้นละเอียดอ่อนกว่า: ใน RAG ที่จริงจัง ส่วน reranker คือส่วนที่คุณต้องสามารถมองเข้าไปได้ หากเป็นกล่องดำแบบเสียเงิน และหากผลลัพธ์ของมันเป็นตัวเลขที่ดูสมเหตุสมผลแม้ว่าจะเป็นแบบสุ่ม—และคะแนนของ reranker ดูสมเหตุสมผลเสมอ เพราะเป็นตัวเลขระหว่างศูนย์ถึงหนึ่งที่มีทศนิยม—คุณจะไม่มีทางรู้ได้ว่าระบบของคุณมีอะไรผิดปกติ และเนื่องจาก reranker อยู่ "ใกล้ส่วนท้าย" ของไปป์ไลน์ ข้อผิดพลาดของมันจะปนเปื้อนการประเมินทั้งหมดก่อนหน้า: การค้นหาดูเหมือนจะช้า คำถามผิดพลาด การฝังตัว (embedding) ไม่ดี ที่จริงแล้วคือพนักงานรักษาความปลอดภัยที่ไม่รู้วิธีอ่านใบหน้า และคุณกำลังตั้งคำถามกับกระจกของประตู
การตัดสินใจที่สวนกระแสของบางทีมในช่วงไม่กี่เดือนที่ผ่านมา — แทนที่จะมุ่งไปสู่คลาวด์มากขึ้น กลับหันหลังกลับมา — คือการนำ reranker กลับมาไว้ที่บ้าน โมเดลโอเพนซอร์สจากตระกูล BGE ที่ไม่ได้มีขนาดใหญ่มากนัก รันบน GPU ในเครื่อง (แม้กระทั่งบน Apple Silicon โดยต้องระมัดระวังเรื่องไดรเวอร์) งานด้านการจัดการอาจจะมากขึ้นจริง แต่ก็มีความเป็นไปได้ที่จะทำการทดลองที่ควบคุมได้ เข้าใจว่ามันผิดพลาดเมื่อใด เปรียบเทียบเวอร์ชันต่างๆ และเก็บประวัติไว้ได้ และ—ที่สำคัญ—ไม่ต้องจ่ายแม้แต่เศษสตางค์เดียวสำหรับการค้นหาของผู้ใช้แต่ละราย เศษส่วนที่เมื่อคูณด้วยจำนวนคำค้นหาหลายหมื่นรายการต่อเดือน จะไม่เป็นเศษส่วนอีกต่อไป แต่จะกลายเป็นรายการในงบประมาณ
เมื่อส่วนประกอบใดส่วนประกอบหนึ่งมีความสำคัญมากจนทำให้ความสามารถในการวัดผลทุกอย่างของคุณเสียหาย การมอบหมายให้มันเป็นกล่องดำไม่ใช่ประสิทธิภาพ เป็นการแสดงศรัทธา และการแสดงศรัทธาในการผลิต จะต้องจ่ายดอกเบี้ยทบต้น
มีข้อเสนอแนะ? แจ้งให้เราทราบ
ข้อความนี้จะส่งถึงเราเท่านั้น หากความคิดเห็นของคุณน่าสนใจ เราอาจนำไปเผยแพร่ต่อท้ายบทความ แต่จะเผยแพร่เมื่อได้รับการอนุมัติเท่านั้น
ขณะที่คุณพิมพ์ เบราว์เซอร์ของคุณกำลังแก้ปัญหาทางคณิตศาสตร์เล็กน้อย นี่เป็นวิธีที่เราป้องกันอีเมลอัตโนมัติโดยไม่ต้องใช้บริการภายนอกหรือให้คุณระบุรูปภาพ คุณไม่จำเป็นต้องทำอะไร และไม่มีข้อมูลใดออกจากเว็บไซต์นี้