PocketLakehouse 产品特性
覆盖数据入湖、分层建模、实时采集、流处理、任务调度、AI 协作、可视化交付全链路

一行代码,即刻连接
支持 MySQL、PostgreSQL、Trino、MinIO、Elasticsearch、Kafka 等数据源。Portal 统一配置,自动同步到 JupyterLab,无需手动写连接串。
亮点
9 个内置数据源模板(meta-postgres-catalog / biz-tpch / gmall / biz-minio ...),增删改立刻生效
Spark 写、Trino 读,同一份 Iceberg
Spark SQL 负责数据写入(INSERT / MERGE / DELETE)+ 时间旅行,Trino 负责联邦查询(跨 Iceberg × MySQL × TPC-H 一条 SQL)。同一张 Iceberg 表,两个引擎无缝读写。
亮点
SHOW CATALOGS 起点 → 7 个 Trino catalog 一览无余;SHOW DATABASES 起点 → Iceberg 仓库结构一目了然
SELECT c.name, SUM(l.extendedprice) FROM tpch.tiny.customer c -- TPC-H 内置生成器 JOIN tpch.tiny.orders o ... JOIN demo.minio.orders o2 ... -- 跨到 Iceberg 表 GROUP BY c.name
6 个 Tab,一站式操作
Portal 工作台集成 📁 文件管理 / 📡 数据源 / 🔍 SQL 查询 / 📊 数据表 / 🕸 血缘 DAG / 🖥 Jobs 管理,无需切工具。.ipynb 测试运行 + .sql 提交 Flink 双路径;DS 调度一键配置 cron+重试;文件树目录/文件字母序排列
文件树 + SQL 查询结果
Job 状态列表 Mockup
Iceberg 时间旅行 + MERGE + 多引擎统一
Apache Iceberg v2 表格式,支持行级 UPDATE/DELETE/MERGE INTO。时间旅行(FOR VERSION AS OF)回溯任意历史快照;多引擎共享同一 Catalog,Spark/Trino/Flink 统一视图。
亮点
FOR VERSION AS OF {snapshot_id} 秒级恢复删除数据;GROUPING SETS Cube 表支持中国式报表多维下钻
spark.sql("""
SELECT * FROM demo.minio.employees
FOR VERSION AS OF 7366396013613443220 -- 回到删除前
""").toPandas()Notebook 一键提交到 DolphinScheduler
JupyterLab 开发的 .ipynb 或 .sql,通过 Portal 一键创建 DolphinScheduler 工作流 DAG。配置 cron 表达式、失败重试、超时告警,自动上线。Supervisor 进程管理(启动/停止/重启/查看日志);DAG 依赖编排(ods → dim → dwd → dws → ads)
JupyterLab Notebook
.ipynb / .sql 文件
Portal 调度配置
cron + 重试策略
DolphinScheduler DAG
7 节点串联工作流
自然语言操作数据
内置 MCP Server(22 个 Tool),覆盖数据源浏览、Schema 探索、SQL 查询、Notebook 执行、Job 管理。一句话分析数据趋势,AI 自动发现表结构 → 生成 SQL → 返回结果。CodeBuddy / Cursor / Claude 直接接入
亮点
analyze_table 一键返回结构+样例+统计;ask_data("上周哪个客户订单最多?") → SQL → 自然语言结论
# ask_data tool invocation
result = mcp.ask_data("上周哪个客户订单最多?")
print(result.conclusion)5 个 Compose,5 个阶段,递进增长
从 MVP 湖仓到全栈双平台,5 个 docker-compose 文件逐层叠加。1 台机器、1 条命令、15 分钟完成全栈部署。全链路部署/卸载脚本,开箱即用
MinIO + Iceberg
+ Spark + Trino
+ Kafka
+ Flink
+ Portal + MCP
技术栈总览
开源组件全景,构建企业级数据平台的坚实基石