文章目录
-
- 第一章:项目概述与背景
-
- 1.1 什么是Knowledge Catalog
- 1.2 项目背景与动机
-
- 1.2.1 数据资产爆炸式增长
- 1.2.2 知识孤岛问题
- 1.2.3 元数据管理的局限性
- 1.2.4 AI时代的新需求
- 1.3 核心价值主张
-
- 1.3.1 开放性 (Openness)
- 1.3.2 可验证性 (Verifiability)
- 1.3.3 AI原生 (AI-Native)
- 1.3.4 双向同步 (Bidirectional Sync)
- 1.3.5 可组合性 (Composability)
- 1.4 适用场景
-
- 1.4.1 数据治理与合规
- 1.4.2 AI/ML项目支持
- 1.4.3 数据平台运营
- 1.4.4 企业知识管理
- 第二章:技术架构总览
-
- 2.1 整体架构图
- 2.2 核心组件关系
- 2.3 技术栈详解
-
- 2.3.1 后端技术栈 (Python)
- 2.3.2 前端/CLI技术栈 (TypeScript)
- 2.3.3 AI/ML技术栈
- 2.4 数据流分析
-
- 场景1:知识发现流程 (Discovery Flow)
- 场景2:Catalog同步流程 (Sync Flow)
- 第三章:Open Knowledge Format (OKF) 规范深度解析
-
- 3.1 OKF设计哲学
-
- 3.1.1 人机共读 (Human-Machine Readable)
- 3.1.2 上下文优先 (Context First)
- 3.1.3 渐进式信任 (Progressive Trust)
- 3.1.4 可演化性 (Evolvability)
- 3.2 文档结构规范
-
- 3.2.1 整体结构
- 3.2.2 Frontmatter必需字段
- 3.2.3 Frontmatter可选字段
- 3.3 Frontmatter元数据体系
-
- 3.3.1 Identity族 (身份识别)
- 3.3.2 Provenance族 (来源追踪)
- 3.3.3 Trust族 (信任机制)
- 3.3.4 Lifecycle族 (生命周期)
- 3.4 Body内容规范
-
- 3.4.1 结构偏好
- 3.4.2 约定标题 (Conventional Headings)
- 3.4.3 示例:绑定到资源的概念
- 3.4.4 示例:未绑定到资源的概念
- 3.5 Provenance、Trust和Lifecycle机制
-
- 3.5.1 协同工作流程
- 3.5.2 实现细节
- 3.6 Cross-linking与路径系统
-
- 3.6.1 链接形式
- 3.6.2 链接语义
- 3.6.3 断链容忍
- 3.6.4 Path-valued字段
- 3.6.5 The `references/` 约定
- 3.7 Actor约定
-
- 3.7.1 三种Actor类型
- 3.7.2 Actor在信任系统中的作用
- 第四章:Reference Agent(参考代理)核心实现
-
- 4.1 Agent架构设计
-
- 4.1.1 整体架构
- 4.1.2 核心文件结构
- 4.1.3 Agent初始化 (agent.py)
- 4.2 工具系统(Tools)
-
- 4.2.1 Bundle Tools (bundle_tools.py)
- 4.2.2 Source Tools (source_tools.py)
- 4.2.3 Web Tools (web_tools.py)
- 4.3 Bundle管理系统
-
- 4.3.1 Bundle概念模型
- 4.3.2 Document对象模型 (document.py)
- 4.3.3 Synthesizer合成器 (synthesizer.py)
- 4.4 Source数据源抽象
-
- 4.4.1 基础抽象类 (base.py)
- 4.4.2 BigQuery实现 (bigquery.py)
- 4.5 Web Fetcher网络获取器
- 4.6 Runner执行引擎
- 4.7 CLI命令行接口
- 第五章:Catalog Sync同步机制深度解析
-
- 5.1 Pull操作详解
-
- 5.1.1 Pull流程图
- 5.1.2 代码实现分析
- 5.1.3 错误处理策略
- 5.2 Push操作详解
-
- 5.2.1 Push流程图
- 5.2.2 代码实现分析
- 5.2.3 Update Mask构建
- 5.3 Manifest清单文件
-
- 5.3.1 Manifest结构
- 5.3.2 Scope格式
- 5.3.3 Manifest示例
- 5.4 Snapshot快照管理
-
- 5.4.1 Snapshot的作用
- 5.4.2 Snapshot目录结构
- 5.4.3 Snapshot API
- 5.5 冲突处理策略
-
- 5.5.1 可能的冲突场景
- 5.5.2 设计中的解决方案
- 第六章:GCP API客户端层深度解析
-
- 6.1 CatalogClient目录客户端
-
- 6.1.1 接口设计
- 6.1.2 错误处理模式
- 6.2 Dataplex API集成
-
- 6.2.1 Dataplex Catalog核心概念
- 6.2.2 API调用示例
- 6.3 BigQuery集成
-
- 6.3.1 集成方式
- 6.3.2 BigQuery Source实现
- 6.4 认证与授权机制
-
- 6.4.1 认证方式
- 6.4.2 权限要求
- 第七章:Toolbox工具箱深度解析
-
- 7.1 mdcode CLI工具
-
- 7.1.1 命令结构
- 7.1.2 主入口实现
- 7.1.3 命令实现
- 7.2 Enrichment增强代理
-
- 7.2.1 与Reference Agent的区别
- 7.2.2 Agent实现
- 7.2.3 MD工具
- 7.3 布局系统(Layouts)
-
- 7.3.1 标准布局 (Standard Layout)
- 7.3.2 文档布局 (Documents Layout)
- 7.4 Source类型系统
-
- 7.4.1 支持的源类型
- 7.4.2 EntryGroup源
- 第八章:Viewer可视化系统
-
- 8.1 HTML生成器
- 8.2 站点地图生成
- 8.3 导航结构
- 第九章:Bundle系统完整解析
-
- 9.1 Bundle概念模型
-
- 9.1.1 定义
- 9.1.2 特征
- 9.1.3 Bundle vs 其他概念
- 9.2 Bundle目录结构
-
- 9.2.1 标准结构
- 9.2.2 最小Bundle
- 9.3 Index索引文件
-
- 9.3.1 Index结构
- 9.3.2 Index的作用
- 9.4 Document文档对象
- 9.5 Synthesizer合成器
- 第十章:Attested Computation认证计算
-
- 10.1 认证计算概念
-
- 10.1.1 问题背景
- 10.1.2 OKF的解决方案
- 10.2 Executor执行器
-
- 10.2.1 Executor类型
- 10.2.2 Executor配置
- 10.3 Attester验证器
-
- 10.3.1 验证策略
- 10.3.2 Attester实现示例
- 10.4 实际应用案例
-
- 案例:ACME Retail月度收入指标
- 第十一章:示例代码深度分析
-
- 11.1 Discovery发现代理示例
-
- 11.1.1 项目结构
- 11.1.2 Skill定义 (SKILL.md)
- 11.1.3 Agent实现 (agent.py)
- 11.1.4 工具实现 (tools.py)
- 11.1.5 工具函数 (utils.py)
- 11.2 Enrichment增强代理示例
-
- 11.2.1 项目结构
- 11.2.2 MCP配置 (mcp.json)
- 11.2.3 Agent指令 (instructions.md)
- 11.3 ACME Retail零售示例Bundle
-
- 11.3.1 Bundle结构
- 11.3.2 示例文档 (orders.md)
- 11.4 StackOverflow示例Bundle
-
- 11.4.1 Bundle结构
- 11.4.2 数据集文档 (stackoverflow.md)
- 第十二章:配置系统与部署
-
- 12.1 pyproject.toml配置
- 12.2 环境变量
- 12.3 部署架构
-
- 12.3.1 本地开发环境
- 12.3.2 Cloud Run部署
- 12.3.3 GKE部署
- 第十三章:测试与质量保证
-
- 13.1 测试框架
-
- 13.1.1 测试结构
- 13.1.2 测试示例
- 13.2 测试覆盖范围
- 13.3 质量门禁
- 第十四章:扩展性与集成模式
-
- 14.1 插件架构
-
- 14.1.1 扩展点
- 14.1.2 插件示例:Snowflake数据源
- 14.2 自定义Source开发
- 14.3 第三方集成
-
- 14.3.1 与Apache Atlas集成
- 14.3.2 与Collibra集成
- 第十五章:总结与展望
-
- 15.1 项目核心价值回顾
- 15.2 适用场景总结
- 15.3 最佳实践建议
- 15.4 学习路径建议
第一章:项目概述与背景
1.1 什么是Knowledge Catalog
Knowledge Catalog是Google Cloud Platform (GCP)开源的一个企业级知识目录管理系统,旨在解决现代企业在数据资产管理、知识组织和AI辅助决策方面的核心挑战。该项目基于Open Knowledge Format (OKF) 规范,提供了一套完整的工具链用于:
- 自动化知识发现:通过AI代理自动发现、提取和组织企业数据资产的知识
- 结构化知识表示:使用标准化的Markdown格式存储和管理知识条目
- 可验证的知识信任链:内置provenance(来源追踪)、trust(信任评级)和lifecycle(生命周期)机制
- 双向同步能力:支持从GCP Dataplex Catalog拉取元数据和推送本地知识到云端
- AI原生设计:深度集成了Google的ADK (Agent Development Kit),使AI代理能够理解和操作知识库
根据项目的README.md文件[1],该项目的核心理念是:“A reference agent that discovers, extracts, organizes, and maintains knowledge about your da
网硕互联帮助中心


评论前必须登录!
注册