治理工作高度依赖专家经验
数据探查、问题判断、标准匹配和治理规则配置通常由不同角色分段完成。面对大量数据库、数据表和文件时,人工分析成本高、周期长,治理经验也难以被持续复用。
产品规划文档
面向企业数据治理与智能体应用场景,构建能够自主认识数据、分析治理问题、生成治理策略,并持续沉淀 AIReady 数据体系的智能产品。
企业正在从以人工规则和平台操作为中心的数据治理,进入以智能体自主理解、分析和协同执行为特征的新阶段。数据不仅要达到传统治理要求,还需要转化为 AI 能够理解、判断和安全使用的知识资产。
企业当前在规模化治理与面向 AI 的数据供给上,仍存在两类基础障碍。
数据探查、问题判断、标准匹配和治理规则配置通常由不同角色分段完成。面对大量数据库、数据表和文件时,人工分析成本高、周期长,治理经验也难以被持续复用。
现有目录更多记录技术元数据,往往缺少字段业务语义、业务对象、指标口径、实体关系、可信度、适用范围和使用限制,其他智能体仍然难以准确理解和使用数据。
用户希望以智能体提升治理效率,并让治理过程持续形成可复用的数据认知资产。
用户需要由智能体围绕治理目标自主制定探查步骤,调用通用、领域及第三方分析工具,识别治理问题并生成治理建议、规则和可执行配置,减少人工分析与工具切换成本。
治理过程产生的探查结论、语义识别结果、领域规则和对象关系,需要持续沉淀为本体(ontology)、数据知识图谱及 AIReady 信息,使一次治理成果转化为可复用的数据认知资产。
因此,需要建设一个以数据 AI 分析为主线的数据治理智能体,在治理过程中自主认识数据、调用分析工具、诊断治理问题,并同时形成治理策略与 AIReady 数据体系两类成果。
打造面向多源数据、多个治理领域和异构治理工具的智能产品,使数据治理从人工操作驱动转向智能体分析驱动,并让治理过程持续增强企业的数据认知能力。
智能体根据治理任务自主选择数据对象、制定探查步骤、调用分析工具,识别数据结构、内容特征、业务语义、数据关系和数据质量问题,并给出探查报告、治理诊断结果。
目标结果:形成可解释、可追踪的数据 AI 分析过程。沉淀数据解析、字段特征、实体识别、关系发现、质量异常和数据对标等通用工具,同时支持 GA、AQ 领域工具以及第三方业务特色工具的集成、编排和调用。
目标结果:让智能体能够按任务动态组合分析能力。基于问题诊断结果生成治理建议、质量规则、标准映射、分类标签和治理配置,并通过配置导入、API 或 MCP 与自研及第三方数据治理工具衔接,甚至构建清洗脚本、清洗 SQL 或清洗代码等工具。
目标结果:降低治理配置成本,打通分析到执行的链路。将数据语义、业务对象、指标术语、实体关系和治理结论转化为本体(ontology)、数据知识图谱、AI 数据契约、语义索引和上下文包,形成可持续更新的核心数据认知资产。
目标结果:为企业沉淀统一、机器可读的数据知识体系。通过 API、MCP 和 RAG 等方式,为 GA 业务智能体、AQ 业务智能体和其他行业智能体提供数据认知、语义检索、图谱查询和业务知识理解能力。
目标结果:让任一智能体能够更准确地认识数据、理解业务并使用数据。产品以数据 AI 分析为主线,形成治理策略交付与 AIReady 数据认知构建两个分支,并通过统一智能体框架支撑模型推理、任务规划、工具调用、知识记忆和安全审计。
数据 AI 分析完成数据探查、专项分析与问题诊断;诊断结果分别形成治理工具可用的策略,以及 AIReady 数据认知资产。
数据 AI 分析(主线):1 治理任务配置 → 2 自主数据探查 → 3 专项治理分析 → 4 治理问题诊断,分析工具中心在主线内部提供支撑。
分支一:策略与成果交付 → 自研或第三方数据治理工具。
分支二:数据认知构建 → AIReady 构建工具 → 智能体内部 AIReady 数据体系 → 任一业务智能体。
围绕数据探查、治理诊断与策略生成之后的执行链路,产品规划中存在以下三个需要进一步明确的边界问题。本章仅提出问题,不预设边界结论。
需要明确智能体在完成数据探查、治理诊断和策略生成后,是否直接操作原始数据或目标数据完成清洗,以及清洗 SQL、清洗脚本或清洗代码的使用范围。
需要明确智能体与自研数据治理工具的责任分工,包括治理规则、治理配置和清洗任务的生成、交付与执行方式。
需要明确产品是否面向更广泛的治理生态,通过配置导入、API、MCP 或适配器将治理策略与配置交付给第三方工具,以及需要支持的对接深度与兼容范围。
基于产品架构中的数据 AI 分析主线、策略与成果交付分支、数据认知构建分支,对产品功能进行初步统一规划。
| 功能路径 | 功能模块 | 功能说明 |
|---|---|---|
| 数据 AI 分析(主线) | 治理任务配置 | 1. 数据对象与范围配置:选择数据源、数据表或文件、已有数据目录,设置待分析对象与探查范围。 2. 分析主题与任务编排:基于治理需求和方法论选择分析主题,制定探查步骤与工具调用方案。 |
| 自主数据探查 | 1. 数据解析与特征提取:基于元数据、抽样数据和原始数据,识别结构、字段类型、值域分布、内容特征和异常特征。 2. 数据关系与变化发现:发现主外键候选、表间关联、历史变化和数据关系线索。 |
|
| 专项治理分析 | 1. 通用与领域专项分析:围绕数据质量、数据对标、敏感识别、实体识别等主题执行分析。 2. 分析工具管理与编排:对通用工具、GA/AQ 领域工具和第三方特色工具进行注册、适配、编排与调用。 |
|
| 治理问题诊断 | 1. 问题识别与诊断:综合探查与专项分析结果,识别问题、定位对象并给出证据、原因和影响范围。 2. 探查与诊断报告:形成问题清单、探查报告、诊断结果和可解释分析过程。 |
|
| 分支一:策略与成果交付 | 治理策略生成 | 1. 治理建议与规则生成:将诊断结果转化为治理建议、质量规则、标准映射和分类标签。 2. 治理配置与清洗工具生成:根据目标工具配置规范生成治理配置、清洗 SQL、清洗脚本或清洗代码。 |
| 治理成果交付 | 1. 自研治理工具衔接:将治理建议、规则和配置转换为自研工具可使用的配置、API/MCP 调用请求或任务。 2. 第三方治理工具衔接:通过配置导入、API、MCP 或适配器与第三方工具衔接。 |
|
| 分支二:数据认知构建 | 数据认知构建 | 1. 数据语义与业务术语识别:基于探查特征、字段内容、元数据和业务资料识别字段语义、业务术语、指标和维度。 2. 业务对象与实体关系发现:识别业务对象、实体、属性、关系和语义映射,支持认知结果校正。 |
| AIReady 资产构建 | 1. 本体与数据知识图谱构建:将语义、业务对象、实体关系、指标术语和治理结论组织为本体(ontology)与知识图谱。 2. AI 数据契约与上下文构建:生成数据说明、用法、限制、查询示例、语义索引和 AI 上下文包。 |
|
| AIReady 数据服务 | 1. 数据认知与语义检索服务:通过 API、MCP 或 RAG 提供数据语义、相关数据对象、使用说明与限制。 2. 图谱查询与业务知识理解服务:支持 GA、AQ 及其他行业智能体查询实体关系,获取与数据相关的业务知识。 |
从业务价值、数据基础、方法与工具、AIREADY 数据体系和系统集成等方面,对 AI 数据治理智能体的建设条件进行初步分析。
| 可行性维度 | 分析内容 | 可行性分析结果 |
|---|---|---|
| 业务价值 | 通过自主探查、问题诊断、策略生成和数据认知构建,降低人工分析与治理配置成本。 | 具备明确的业务价值,可优先在高频、规则相对清晰的数据治理任务中验证降本增效效果。 |
| 数据基础 | 产品需要访问多源数据、元数据、抽样数据、数据目录和既有治理成果。 | 理论可支持,但依赖用户提供的数据及其具体形态;不同用户的数据结构差异较大,产品需要支持足够宽泛的数据类型、接入方式和样本处理能力。 |
| 方法与工具 | 基于通用数据方法论、GA/AQ领域方法论,构建数据治理工具(脚本、SQL、代码)、skill、MCP等。 | 具备方法论基础,需要将数据治理方法论沉淀并落地为 tool、skill、MCP 等形态的产物,支撑模型自主分析与调用。 |
| AIREADY数据体系 | 将数据语义、业务对象、指标术语、实体关系和治理结论沉淀为本体(ontology)、数据知识图谱、AI 数据契约和语义索引。 | 理论可行。本体(ontology)等相关理论较为丰富,但成熟落地案例较少,工程实践可行性仍需结合典型领域和数据集深入评估。 |
| 系统集成 | 通过配置导入、API、MCP 和适配器与自研或第三方数据治理工具衔接。 | 自研数据治理工具集成可行,可作为初期版本的主要执行链路。第三方数据治理工具在初期暂不纳入自动执行,需要第三方工具进行适配改造;若开展合作,先输出治理建议、治理规则等治理产物。 |
综合来看,AI 数据治理智能体总体可行,数据、方法与工具已具备一定基础,可支撑产品初步建设。AIREADY 数据体系仍需在工程实践中持续验证和优化。第三方工具集成暂不纳入本产品的初步规划。
围绕数据认知、方法论整理、工具沉淀、治理策略评估、AI 数据清洗及本体与知识图谱构建,分别分析实现难点和潜在问题。
| 难点或潜在问题 | 难点 | 潜在问题 |
|---|---|---|
| 模型自主认知数据的准确性 | 元数据不完整、命名不规范及缺乏业务背景时,可能导致认知出错,并传递给后续数据治理。 | |
| 方法论整理汇总 | 将分散在规范、文档和专家经验中的通用及 GA/AQ 领域方法论系统整理为统一知识体系,明确适用场景、前置条件、分析步骤和判断依据。 | |
| 基于方法论的工具沉淀 | 将方法论转化为可复用的 SQL、脚本、代码、Skill 或 MCP 等工具,统一输入输出、参数约束和结果表达,并验证工具执行与方法论意图的一致性。这就需要,开发大量的工具、算子等,最好是让模型自主开发脚本、代码等以满足模型认知数据。 | |
| 治理策略的可执行性、准确性、完善性评估 | 经过AI分析后,生成的治理策略如何执行?如何给数据治理工具执行?怎么保证治理策略是正确的?怎么保证治理策略没有遗漏?(应该说肯定是有错误的策略和遗漏的策略) | |
| 数据AI清洗以及清洗结果的评估 | 如何让AI自己清洗数据?这样才能减少人工工作。 | 若是由AI清洗数据,那要么不出错,要么就全错误,那如何来评估AI清洗结果是否正确?是否完善? |
| 本体(ontology)+知识图谱的构建 | 从数据与业务资料中抽象概念、实体、属性和关系,统一业务术语与语义约束,并保持本体定义、图谱实例和源数据的一致性及持续更新。目前本体(ontology)理论较多,但工程实践较少,如何构建本体+数据知识图谱需要工程实践和时间试错成本。 |
综合来看,AI 数据治理智能体在建设初期无法保证独立、准确且完善地完成数据治理工作。模型的数据认知、治理策略生成、数据清洗和知识体系构建都可能存在偏差或遗漏,因此前期需要设置较多的人工参与和审核环节,对关键分析结论、治理策略与执行结果进行确认。通过持续积累方法论、工具、评估样本和人工反馈,逐步完善智能体能力,提升自动化程度和治理结果的可靠性。
技术选型需围绕智能体编排、数据分析、方法论工具、AIReady 知识体系、外部对接和生产安全等能力进行评估,当前不做最终定型。
| 技术层 | 待评估方向 | 候选技术或实现方案 |
|---|---|---|
| 智能体编排与任务执行 | 多步骤任务规划、长任务管理、记忆管理、沙箱、脚本、权限控制、人机确认等 | loopmore智能体框架 |
| 模型与推理服务 | 通用大模型、专用模型 | 模型选型? |
| 数据分析与执行环境 | 全量数据分析、数据抽样分析、脚本代码生成、脚本分析、脚本执行、工具调用、skills调用等。 | 数据分析环境?脚本执行环境? |
| AIReady 知识体系 | 本体(ontology)、知识图谱 | 图数据库、向量数据库 |
| 分析工具与方法论中心 | 通用工具、GA/AQ 领域工具、第三方工具、方法论沉淀等 | tool、skill、mcp |
| 系统集成与服务接口 | 治理策略、治理规则,以及AI生成的治理脚本等。 | 自研数据治理工具? |
| 安全、权限与审计 |
围绕数据 AI 分析、治理策略、数据治理工具和 AIREADY 数据体系,形成由单项能力到完整产品的六种销售方案,并根据价值闭环、客户基础和实施复杂度确定销售建议。
| 序号 | 销售方案 | 主要交付内容 | 适用客户与场景 | 销售建议 |
|---|---|---|---|---|
| 01 | 数据AI分析 | 治理任务配置、自主数据探查、专项治理分析、治理问题诊断及分析报告。 | 客户只希望快速发现数据问题,后续治理仍由人工完成。 | 仅提供分析能力,缺少策略与执行闭环,产品价值不完整。 |
| 02 | 数据治理工具 | 规则配置、治理任务执行、结果记录等传统数据治理工具能力。 | 已有稳定治理团队,主要需要工具替代或系统升级的客户。 | 单独销售难以体现 AI 数据治理智能体的差异化价值。 |
| 03 | 数据AI分析+治理策略 | 数据 AI 分析主线,以及治理建议、治理规则、治理配置和 AI 生成的治理脚本。 | 客户已有数据治理工具,可自行承接和执行治理策略。 | 具备分析到策略的交付价值,但执行效果依赖客户现有工具和人工操作。 |
| 04 | 数据AI分析+治理策略+数据治理工具(新版) | 数据 AI 分析、治理策略生成、新版数据治理工具,以及策略下发、执行和反馈闭环。 | 希望获得完整数据治理闭环,需要降低分析、配置和执行成本的客户。 | 闭环完整、价值清晰,可作为核心销售方案。 |
| 05 | 数据AI分析+AIREADY | 数据 AI 分析,以及数据语义、本体(ontology)、知识图谱、AI 数据契约和上下文等 AIREADY 能力。 | 正在建设企业级 AI 能力,希望让各类智能体准确理解和使用数据的客户。 | 面向 AI 应用需求,差异化明显,适合独立方案或与治理项目组合销售。 |
| 06 | 全产品 | 覆盖数据 AI 分析、治理策略、新版数据治理工具、AIREADY 数据体系及智能体服务。 | 战略客户、联合创新客户或需要整体建设数据治理与 AI 数据基础的客户。 | 范围大、周期长,建议拆分阶段销售与实施。 |
产品研发按照能力闭环和依赖关系分为四个阶段,先形成数据分析与治理策略能力,再建设治理执行工具和 AIREADY 知识体系,最终实现智能体对知识图谱的使用。
| 阶段 | 建设范围 | 主要研发内容 | 阶段交付结果 | 人员安排 | 时间安排 |
|---|---|---|---|---|---|
| 第一阶段 | 数据AI分析主线+分支一 | 建设治理任务配置、自主数据探查、专项治理分析和治理问题诊断能力;同步建设分析工具与方法论中心,形成治理建议、治理规则、治理配置和治理脚本等策略成果。 | 形成可演示、可试点的智能体首版,实现从数据分析到治理策略生成。 | - | - |
| 第二阶段 | 数据治理工具+与分支一深度对接 | 建设新版数据治理工具,支持规则、配置和治理脚本的接收与执行;打通策略下发、任务执行、结果反馈、人工审核、审计与回滚流程。 | 形成数据 AI 分析、策略生成和治理执行闭环。 | - | - |
| 第三阶段 | 本体(ontology)构建+知识图谱 | 建设数据语义识别、业务对象与实体关系发现、本体(ontology)建模、知识图谱构建,以及知识校正、版本管理和持续更新能力。 | 形成可持续演进的 AIREADY 数据知识基础。 | - | - |
| 第四阶段 | 智能体与知识图谱对接 | 通过 API、MCP、RAG 等方式向智能体提供语义检索、实体关系查询、图谱推理和数据上下文服务,并建立使用反馈与知识更新机制。 | 实现业务智能体对数据知识的查询、理解和使用。 | - | - |