1. AI知识治理与智能检索平台
    1. 整体架构

AI知识治理与智能检索平台

整体架构

  1. 多模态文档智能解析与入库模块:负责将企业海量、复杂的 PDF、Word 等文档转化为大模型可理解的高质量结构化数据。
  2. 元数据动态注入与轻量分类模块:在文档切块(Chunking)阶段,为每个数据块动态注入行业标签和属性,用于后续的混合检索过滤。
  3. 智能路由与多路工具调度模块:解析用户复杂的自然语言提问,并动态选择最佳的检索策略(Tool Use)。
  4. 纠错、反思与自适应生成模块:大模型生成初步答案后,不直接输出,而是流转到 Critic 节点。
  5. 自动化量化评估模块:利用独立的大模型作为裁判,批量对系统的四项核心指标进行打分。

文档解析使用现有工具,数据使用API生成,再次训练一个标签模型。

  1. 数据接入层:将各种知识源统一导入系统,后续可拓展为网络来源。

    文档解析使用MinerU和Docling,切分

    数据采用公开数据集

  2. 知识治理层:自动生成标签(Prompt + LLM)和摘要并评分(LLM Judge),检测重复文档(BGE-M3),数据库采用Milvus。

  3. 知识检索层:Embedding(BGE模型),向量库使用Milvus,查找top20再重排序选出top5

  4. Agent层:Planner拆解问题(ReAct),调用搜索工具(Tool Calling),短期存储在Redis,长期存储在mongo

  5. Workflow层:DAG,参考LangGraph

  6. MCP层:只做MCP Client,接入GitHub MCP

  7. 管理后台:Springboot,管理配置


转载请注明来源,欢迎对文章中的引用来源进行考证,欢迎指出任何有错误或不够清晰的表达。