PocketLakehouse 产品特性

覆盖数据入湖、分层建模、实时采集、流处理、任务调度、AI 协作、可视化交付全链路

Iceberg数据流抽象插画
🔌多源接入

一行代码,即刻连接

支持 MySQL、PostgreSQL、Trino、MinIO、Elasticsearch、Kafka 等数据源。Portal 统一配置,自动同步到 JupyterLab,无需手动写连接串。

亮点

9 个内置数据源模板(meta-postgres-catalog / biz-tpch / gmall / biz-minio ...),增删改立刻生效

MySQL
PostgreSQL
MinIO
Kafka
Elasticsearch
Portal
统一管理面板
🔍双引擎 SQL

Spark 写、Trino 读,同一份 Iceberg

Spark SQL 负责数据写入(INSERT / MERGE / DELETE)+ 时间旅行,Trino 负责联邦查询(跨 Iceberg × MySQL × TPC-H 一条 SQL)。同一张 Iceberg 表,两个引擎无缝读写。

亮点

SHOW CATALOGS 起点 → 7 个 Trino catalog 一览无余;SHOW DATABASES 起点 → Iceberg 仓库结构一目了然

-- Trino:SHOW CATALOGS 起点,联邦查询
SELECT c.name, SUM(l.extendedprice)
FROM tpch.tiny.customer c          -- TPC-H 内置生成器
JOIN tpch.tiny.orders o ...
JOIN demo.minio.orders o2 ...       -- 跨到 Iceberg 表
GROUP BY c.name
💻数据开发工作台

6 个 Tab,一站式操作

Portal 工作台集成 📁 文件管理 / 📡 数据源 / 🔍 SQL 查询 / 📊 数据表 / 🕸 血缘 DAG / 🖥 Jobs 管理,无需切工具。.ipynb 测试运行 + .sql 提交 Flink 双路径;DS 调度一键配置 cron+重试;文件树目录/文件字母序排列

文件管理
数据源
SQL 查询
数据表
血缘 DAG
Jobs 管理

文件树 + SQL 查询结果

Job 状态列表 Mockup

🧊湖仓核心

Iceberg 时间旅行 + MERGE + 多引擎统一

Apache Iceberg v2 表格式,支持行级 UPDATE/DELETE/MERGE INTO。时间旅行(FOR VERSION AS OF)回溯任意历史快照;多引擎共享同一 Catalog,Spark/Trino/Flink 统一视图。

亮点

FOR VERSION AS OF {snapshot_id} 秒级恢复删除数据;GROUPING SETS Cube 表支持中国式报表多维下钻

# Python: 时间旅行回到删除前
spark.sql("""
  SELECT * FROM demo.minio.employees
  FOR VERSION AS OF 7366396013613443220  -- 回到删除前
""").toPandas()
任务调度

Notebook 一键提交到 DolphinScheduler

JupyterLab 开发的 .ipynb 或 .sql,通过 Portal 一键创建 DolphinScheduler 工作流 DAG。配置 cron 表达式、失败重试、超时告警,自动上线。Supervisor 进程管理(启动/停止/重启/查看日志);DAG 依赖编排(ods → dim → dwd → dws → ads)

JupyterLab Notebook

.ipynb / .sql 文件

Portal 调度配置

cron + 重试策略

DolphinScheduler DAG

7 节点串联工作流

🤖AI Agent

自然语言操作数据

内置 MCP Server(22 个 Tool),覆盖数据源浏览、Schema 探索、SQL 查询、Notebook 执行、Job 管理。一句话分析数据趋势,AI 自动发现表结构 → 生成 SQL → 返回结果。CodeBuddy / Cursor / Claude 直接接入

亮点

analyze_table 一键返回结构+样例+统计;ask_data("上周哪个客户订单最多?") → SQL → 自然语言结论

# 22 个 MCP Tool 之一:ask_data
# 用户:"上周哪个客户订单最多?"
# → AI 自动:search_tables → analyze_table → NL2SQL → 结论
# ask_data tool invocation
result = mcp.ask_data("上周哪个客户订单最多?")
print(result.conclusion)
🚀一键部署

5 个 Compose,5 个阶段,递进增长

从 MVP 湖仓到全栈双平台,5 个 docker-compose 文件逐层叠加。1 台机器、1 条命令、15 分钟完成全栈部署。全链路部署/卸载脚本,开箱即用

Phase 1核心湖仓

MinIO + Iceberg

Phase 2离线中台

+ Spark + Trino

Phase 3实时采集

+ Kafka

Phase 4流处理

+ Flink

Phase 5AI 接入层

+ Portal + MCP

技术栈总览

开源组件全景,构建企业级数据平台的坚实基石

Apache Iceberg
Apache Spark
Trino
MinIO
Docker
Kafka
Apache Flink
DolphinScheduler
DuckDB
JupyterLab
Streamlit
Superset
FastAPI
React