AI知识治理与智能检索平台
整体架构
- 多模态文档智能解析与入库模块:负责将企业海量、复杂的 PDF、Word 等文档转化为大模型可理解的高质量结构化数据。
- 元数据动态注入与轻量分类模块:在文档切块(Chunking)阶段,为每个数据块动态注入行业标签和属性,用于后续的混合检索过滤。
- 智能路由与多路工具调度模块:解析用户复杂的自然语言提问,并动态选择最佳的检索策略(Tool Use)。
- 纠错、反思与自适应生成模块:大模型生成初步答案后,不直接输出,而是流转到 Critic 节点。
- 自动化量化评估模块:利用独立的大模型作为裁判,批量对系统的四项核心指标进行打分。
文档解析使用现有工具,数据使用API生成,再次训练一个标签模型。
数据接入层:将各种知识源统一导入系统,后续可拓展为网络来源。
文档解析使用MinerU和Docling,切分
数据采用公开数据集
知识治理层:自动生成标签(Prompt + LLM)和摘要并评分(LLM Judge),检测重复文档(BGE-M3),数据库采用Milvus。
知识检索层:Embedding(BGE模型),向量库使用Milvus,查找top20再重排序选出top5
Agent层:Planner拆解问题(ReAct),调用搜索工具(Tool Calling),短期存储在Redis,长期存储在mongo
Workflow层:DAG,参考LangGraph
MCP层:只做MCP Client,接入GitHub MCP
管理后台:Springboot,管理配置
转载请注明来源,欢迎对文章中的引用来源进行考证,欢迎指出任何有错误或不够清晰的表达。