基于本地大语言模型的个人知识库系统。Markdown 文档管理、语义检索、RAG 智能问答, 全程离线运行,数据不出本机。
从文档管理到智能问答,构建完整的本地知识引擎
基于本地文件系统的 Markdown 知识库,支持 Frontmatter 元数据、文档导入/编译/分类,多种文档类型(概念、实体、摘要、分析)。
BM25 关键词检索 + 向量语义检索双通道,RRF 融合算法合并排序,LLM 驱动的重排序,精准命中所需知识。
基于检索增强生成的对话式问答,支持上下文引用标注([1] [2] 格式)、多轮对话、流式响应输出。
语义分块、按章节分块、按段落分块、固定大小分块。智能 Markdown 清洗,代码块/表格/引用识别,chunk 级向量存储。
可视化索引状态监控,SSE 流式索引构建进度,在线切换分块策略,一键重建索引。
无任何云端依赖。Ollama 本地推理,FAISS 本地向量存储,所有数据留在本机,隐私安全有保障。
模拟真实的 RAG 问答流程,体验检索增强生成的完整过程
前端 React → 后端 FastAPI → FAISS 向量库 + BM25 索引 → Ollama 本地推理
精心设计的检索增强生成管道,每个环节都追求最优
Reciprocal Rank Fusion 将 BM25 与向量检索结果按排名倒数加权融合,无需调参即可实现高质量的混合检索排序。
语义分块基于内容相似度切分,按章节/段落分块保留文档结构,固定大小分块确保均匀。智能识别代码块、表格、引用区域避免误切。
索引构建进度、LLM 对话响应均通过 Server-Sent Events 实时推送,用户无需等待即可看到逐步生成的结果。
向量存储以 chunk 为粒度,检索结果自动聚合到文档级别,既保证检索精度又提供完整的上下文视图。
Ollama 本地运行 bge-m3 嵌入模型和 qwen2.5:7b 对话模型,无需 GPU 集群,普通笔记本即可运行。
分块前自动清洗 Markdown 文本,保留语义完整性。识别代码块边界、表格结构、引用段落,确保切分不破坏内容结构。
支持私有化部署,可根据需求定制知识库结构、检索策略与问答模型。