GitHub 用戶 myyang19770915 開源了 Hybride_pageindex_RAG,這是一個結合多種技術的 RAG(Retrieval-Augmented Generation)系統,目標是突破傳統文件切塊方式的限制,提升問答精準度。

重點

  • MiniU 文件解析:使用 MiniU 工具擷取 PDF 等格式的文件內容,能保留原始文件的結構資訊
  • Qdrant 混合搜尋:結合向量語意搜尋(Dense)與關鍵字搜尋(Sparse)的混合策略,兼顧語意理解與精確詞彙匹配,提升召回率
  • Pageindex 章節樹索引:將文件依目錄層次組織成章節樹(Chapter Tree)結構,讓檢索能沿文件層次精準定位,而非僅靠固定大小的 chunk

編輯按

RAG 系統最常見的痛點是「切塊切壞了」——傳統固定大小的 chunk 容易截斷語意,導致回答缺乏上下文。Hybride_pageindex_RAG 以章節樹索引的概念補足這個缺陷,架構思路值得自建文件問答系統的工程師參考。目前專案仍在早期階段,文件與範例持續更新中。

本文由 AI 整理,原文:GitHub - myyang19770915/Hybride_pageindex_RAG