战略蓝图 V13.0 · 系统 V12.11.0001 · 2026-08-24
知微 · 战略蓝图
款多多(KDD Auto)全球零售业 AI+Robot 体系 · 数据平面 — 「数据大脑与知识底座」从细微信息中发现全局趋势
S0概览 · 五层一体数据大脑
数据采集 → 知识图谱 → 智能检索 → 多AI协同 → 算法自进化
13源+爬虫 5633实体/725万关系 GraphRAG混合检索 驾驶舱+记忆总线 增量+联邦+强化
13源+爬虫 5633实体/725万关系 GraphRAG混合检索 驾驶舱+记忆总线 增量+联邦+强化
5,633
图谱实体
725万
图谱关系
13
情报源
3.77s
GraphRAG延迟(-63%)
0.976
RAGAS精确率
120+
单测全绿
S1情报采集 · 数据来源层
13 源情报网络
├── 竞品官网 5 源(静态+动态爬取) ├── 行业资讯 3 源(RSS+搜索) ├── 政策法规 2 源(政务公开) ├── 舆情社交 2 源(评论/讨论) └── 内部知识 1 源(Wiki/文档)
采集流水线 SimHash 去重
定时触发 → SpiderEngine爬虫 → 原始HTML → SimHash去重 → TextCNN分类 → 质量门禁 → 图谱/向量双写 → 消费
SimHash 原理: 文本→分词→64位哈希指纹→海明距离<3 判重(O(1) 近似查重)
S2知识图谱 · 知识底座层
图谱规模与质量门禁
| 项 | 数值 |
|---|---|
| 实体类型 | 35 类(白名单 Schema) |
| 实体数 | 5,633+ |
| 关系数 | 725 万+ |
| 质量门禁 | name+type 查重幂等 / Schema 自动映射 |
| 社区数 | GraphRAG 社区层级(Louvain) |
图谱嵌入算法 · TransE 原理 KGE
r (关系向量) h ───────────→ t h + r ≈ t (北京) (首都) (中国) score=||h+r-t|| → 越小越合理
三元组 → 负采样 → 前向计算 → margin loss → SGD → 实体向量表 → 检索/聚类/链接预测
S3智能检索 · GraphRAG 层
混合检索三通道
Query ─┬─ BM25 关键词(稀疏)
├─ bge-m3 语义(稠密1024维)
└─ 图谱结构(社区/邻居)
↓ RRF融合 → Top-K → Reranker精排 → Top-5 → LLM生成+溯源
GraphRAG 性能优化(实测 -63%)
| 优化 | 效果 |
|---|---|
| 社区向量缓存 | 避免每查询 13 次编码 |
| 并行 Top-4 社区 | 延迟 10.22s→3.77s |
| 阈值 0.28 | 长尾增强 23字→1007字 |
| 优质率 | 64%→66%(真实基线) |
S4多AI协同 · 协作层
五元协同体系
控制平面: 天枢(88 Agent 编排) 数据平面: 知微★(情报/图谱/GraphRAG) + 灵枢(Agent工厂/金睛) 业务平面: 中枢(运营看板/报告) 执行平面: 地枢(无人仓/机器人)
驾驶舱工作流
飞书/页面指令 → 传令官·流音 → 总指挥·天枢拆解 → 知微(采集/图谱/分析)+中枢(专题/报告) → 质量行为总监质检 → 流音回执
记忆总线 SLA: 写=WAL暂存→同步DB→异步LLM治理→天枢权威写源 | 读=热缓存(v_seq校验)→失效回源 | P95<200ms
S5算法自进化 · 本版核心
自进化闭环
数据 → 增量学习 → 质量反馈 → 置信度判断 → 高:蒸馏/微调LoRA → 联邦聚合FedAvg → 灰度 → RAGAS评估
三层飞轮
| 飞轮 | 循环 |
|---|---|
| 信息飞轮 | 采集 → 图谱 → 检索 → 反馈 → 再采集 |
| 决策飞轮 | 问题 → 检索 → 生成 → 评估 → 优化检索 |
| 进化飞轮 | 数据 → 训练 → 评估 → 发版 → 新数据 |
S6技术架构
五层架构
┌──────────────────────────────────────────────┐ │ 业务层 驾驶舱/专题页/行业研究/AI对话/多AI协同 │ ├──────────────────────────────────────────────┤ │ 算法层 图谱嵌入/GNN/GraphRAG/混合检索/深度/强化│ ├──────────────────────────────────────────────┤ │ 数据层 MySQL/Qdrant(1024维)/知识图谱/记忆总线 │ ├──────────────────────────────────────────────┤ │ 协议层 REST/WS/MCP/Ed25519/天枢API │ ├──────────────────────────────────────────────┤ │ 硬件层 CVM 4核7.4G/118G盘/Hermes/workflow │ └──────────────────────────────────────────────┘
算法全景(7 类 60+)
TransE✅TransHTransRComplExRotatEDistMultConvETuckER
GCNGATGraphSAGER-GCNHANnode2vec✅
BM25✅bge-m3✅HNSW✅GraphRAG✅bge-rerankerRAGAS✅
TextCNN✅LSTMBERTRoBERTaTransformerBARTT5
DQNDDPGPPOSACThompson✅MARL
FedAvg✅FedProx主动学习增量学习迁移学习元学习知识蒸馏LoRARLHF/DPO
SVDWide&DeepDeepFMProphetDeepARISFK-Means✅Louvain✅SimHash✅PageRank✅Apriori
S7六版本路线图
| 版本 | 代号 | 时间 | 状态 | 核心 |
|---|---|---|---|---|
| v1 | 启微 | 2026-05~06 | 完成 | 情报采集/图谱底座 |
| v2 | 明微 | 2026-06~07 | 完成 | GraphRAG/混合检索 |
| v3 | 映微 | 2026-07~08 | 完成 | MCP 22工具/天枢接入 |
| v4 | 联微 | 2026-08~09 | 进行中 | 记忆总线/驾驶舱 |
| v5 | 慧微 | 2026-09~11 | 计划 | 算法自进化 |
| v6 | 耀微 | 2026-12~2027 | 计划 | 联邦学习/多Agent |
S8里程碑
2026-05图谱底座 2000+ 实体
2026-06GraphRAG 全局问答上线
2026-07图谱 4462 实体 / 467 万关系
2026-08记忆总线 v14.2 + 驾驶舱全链路
2026-09v5 慧微:算法自进化闭环
2026-11图谱 8000+ 实体
2027-01v6 耀微:联邦学习/多Agent
S9验收指标
| 维度 | 当前 | 目标 |
|---|---|---|
| RAGAS ctx_precision | 0.976 | ≥0.98 |
| RAGAS recall | 0.708 | ≥0.75 |
| GraphRAG P95 | 3.77s | ≤3s |
| 实体数 | 5,633 | ≥8,000 |
| 关系数 | 725万 | ≥1,000万 |
| 单测 | 120+ | ≥150 |
| 算法落地 | 60% | 100% |
S10数据来源
├── 天枢 API(executions/hub/collab) ├── 知识图谱 kg_db(MySQL) ├── Qdrant 向量库(1024维) ├── 记忆总线(WAL+版本链) ├── 13 源情报采集 └── workflow-engine 定时工作流
S11五系统互链
| 系统 | 平面 | 与知微关系 |
|---|---|---|
| 天枢 | 控制 | 编排/调度知微,知微供数据 |
| 灵枢 | 数据 | Agent工厂/金睛审查知微 |
| 中枢 | 业务 | 消费知微专题/报告 |
| 地枢 | 执行 | 消费知微零售情报 |
| 知微★ | 数据 | 数据大脑/知识底座 |
知微 · 战略蓝图 V13.0 · 2026-08-24 · 配套产品设计文档 docs/17 · 参考地枢蓝图 V7.3