跳到正文

数据湖

把分散资料沉淀为可查询、可追溯的数据。

查看 Markdown

当前定位

本人最近正在搭建的数据湖项目。现有 README 描述的是面向 Agent 查询的社交数据 Lakehouse MVP:原始响应、整理后的数据和目录元数据分层维护。

分层思路

  • Bronze:保留原始来源响应,支持追溯。
  • Silver:用 DuckLake 管理规范化 Parquet 数据。
  • Catalog:保存表与文件的目录元数据。
  • Query:由 DuckDB 完成查询与分析。

数据存储和元数据有不同职责,不把“存下来了”等同于“业务定义正确、可以可信分析”。

本次核对

读取了本地 README 和脚本入口。该目录目前不是 Git 仓库,不能记录不存在的远程地址或提交。

下一步

先补齐当前阶段、数据合同和查询验收。原始业务数据、访问凭据和内部资源地址不进入公开站点。

关联:Data Agent 的业务上下文。

Navigation

输入关键词开始搜索…

↑↓ 移动↵ 打开Esc 关闭