夜雨聆风学习资料网

ARTICLE · 1113341

客户真题讲解|趁手好用,AllData搭建数据开发平台,集成开源项目AirFiow/NiFi/DataCap,涵盖离线调度/可视化实时开发/数据中枢(二)

客户真题讲解|趁手好用,AllData搭建数据开发平台,集成开源项目AirFiow/NiFi/DataCap,涵盖离线调度/可视化实时开发/数据中枢(二)

如果你是数据业务人员,每天最怕的就是多类数据开发工具零散割裂、实时离线任务管理混乱,数据源接入繁琐,跨系统数据流转需要多平台来回切换。

业务场景:每天既要处理交易流水实时对账、又要跑每日离线报表,还要对接十多类异构数据库,工具分散、运维复杂,问题定位耗时漫长。

AIIData数据中台分2篇解析这6大功能,看整套数据开发平台如何一站式解决这个老问题!接着看离线开发平台、可视化数据开发、数据中枢平台解析。

数据开发平台模块,6大功能拆解

注:实时开发IDE(Dinky)、实时开发平台(StreamPark)、离线开发平台(DolphinScheduler)在 数据开发平台(一) 中介绍。

一、离线开发IDE (AirFIow)

离线开发IDE基于Apache AirFlow构建,面向离线批处理的Web可视化任务调度开发环境。可视化编排DAG工作流,配置任务依赖与调度策略,支持手动触发、重跑、历史补数;配套大盘监控、日志查询、审计追溯,统一管理连接、变量、资源池,完成离线数据抽取清洗加工,实现离线任务开发、调度、运维全生命周期管理。

AirFlow 开源项目:https://github.com/apache/airflow

AirFlow 官方文档:https://airflow.apache.org/docs/apache-airflow/stable/index.html

可视化DAG工作流编排支持可视化配置离线DAG工作流,灵活定义任务上下游依赖与调度周期,可手动触发、重跑、补数,快速搭建各类离线数据加工处理流程。

工作流管理页面:统一管理全部DAG工作流,支持启停、触发执行,直观查看工作流调度执行状态

项目详细页面:展示单个DAG的执行统计与运行指标,可查看任务执行记录、代码、审计日志等多维信息

单个项目详细页面:支持查看单任务实例完整运行日志,快速定位报错原因

1、任务全链路监控与资源统一管控

提供任务全局概览、运行监控、日志查询、操作审计,支持资源池、数据源连接、全局变量及插件统一管理,保障大批量离线任务稳定、可追溯运行。

运维管理页面:完整记录平台调度与用户操作记录,便于问题回溯,满足离线作业审计合规需求

二、可视化数据开发 (NiFi)

可视化数据开发基于Apache NiFi构建,是AllData数据中台低代码数据流集成模块。依托Web画布拖拽组件快速搭建端到端数据流,完成多源异构数据采集、转换、路由分发。

支持MySQL、Kafka、文件、接口等数据源,具备失败重试、背压限流、数据溯源、分组管理,实现实时同步与流转加工,适配数据库同步、日志、物联网数据流场景。

Apache NiFi 开源项目:https://github.com/apache/nifi
Apache NiFi 官方文档:https://nifi.apache.org/nifi-docs/overview.html

1、拖拽式可视化数据流编排

通过Web画布拖拽处理器组件,无需大量编码,可配置数据源连接、数据转换规则与节点链路,快速搭建数据库、消息队列等多源异构数据集成流水线。

流程画布页面:可视化流程画布,可拖拽处理器、流程组等组件,快速搭建数据流管道

流程设置弹窗:对流程组进行参数配置,设置背压阈值、并发策略等,实现数据流分组管控

2、零代码可视化拖拽编排,快速构建实时数据同步链路

无需编写业务代码。通过流程组隔离任务,将公共连接服务、业务算子统一封装在独立画布内;只需拖拽算子组件、配置参数、连线定义数据流转关系,即可完成「数据读取‑格式转换‑消息推送」完整流水线搭建。

同时支持可视化配置异常处理策略,失败数据流可直接终止,开发、调试、问题排查均在图形界面完成,大幅降低实时数据集成的开发门槛与实施周期。

先将整套同步流程封装在独立流程组内,实现任务隔离管理,所有连接、算子均在流程组画布内配置

在可视化开发画布中拖拽创建流程组,命名mysql2kafka_demo,作为整套 MySQL 到 Kafka 同步任务的独立隔离容器

进入流程组内部,通过右键菜单打开控制器服务配置,统一创建MySQL、Kafka、数据序列化等公共连接能力

在流程组画布内添加处理器(算子),可检索并选取数据读取、转换、消息推送等各类业务算子,编排数据流转链路。JsonRecordSetWriter、GenerateTableFetch、 ExecuteSQLRecord、PublishKafka处理器都可以在这里创建添加。

3、支持增量抽取+公共连接复用,兼顾同步效率与资源可控

增量数据抓取:依靠GenerateTableFetch算子记录同步位点,基于主键/更新时间字段只抓取新增、变更的数据,避免每次全表扫描,减轻 MySQL 源库压力,适配业务库持续新增数据的实时同步场景Apache NiF。

公共控制器服务资源复用:数据库、Kafka、JSON格式化能力统一作为公共服务配置,多个算子直接引用复用连接池,不用每个算子重复填写账号、地址等连接信息,实现连接资源集中管控,减少重复配置,便于后期维护修改,提升资源利用率。

✅ 核心业务算子编辑:算子按顺序串联完成数据读取‑转换‑推送全流程:

✅ GenerateTableFetch:增量读取MySQL,自动记录上次同步位置,只抓取新增/变更数据,输出查询指令

✅ ExecuteSQLRecord:执行数据库查询,读取表数据,转换为JSON格式数据流

✅PublishKafka:接收JSON数据,推送消息到指定Kafka主题Topic

将算子进行按顺序串连:数据处理成功向下流转,在读取、转换、发送任意环节出现异常,自动终止当前数据流;也可配置异常数据留存,便于问题排查

流程一键启动,MySQL产生新增业务数据后,自动增量同步,下游Kafka消费者即可实时接收到JSON格式业务数据

4、可靠数据流管控与全流程可观测

支持节点级失败策略配置、流量背压保护,提供完整的数据流转溯源,实现数据流运行监控、故障处理,保障大批量数据传输稳定可追溯。

三、数据中枢平台 (DataCap)

数据中枢平台基于DataCap构建,是AllData数据中台多源查询、集成分析可视化综合平台。支持40+异构数据源接入,统一SQL跨源查询;插件化扩展数据源,一站式完成数据接入、清洗、工作流、数据集、报表仪表盘;配套细粒度权限、操作审计、任务调度,降低业务用数门槛,支撑企业数据分析决策。

DataCap项目地址:https://github.com/devlive-community/datacap

1、多源数据统一查询与集成加工

兼容四十余种异构数据源,以统一 SQL 完成跨库查询,支持可视化工作流编排,实现多源数据清洗、转换、整合,快速构建标准化数据集。

✅ 关系型数据库:MySQL、Oracle、PostgreSQL、SQL Server、MariaDB、H2、SQLite、TiDB、OceanBase、达梦DM、人大金仓KingbaseES;

✅ OLAP数据仓库/分析型数据库:Doris、ClickHouse、StarRocks、Greenplum、MonetDB、Kyuubi、Presto、Trino;

✅ 消息队列(实时流):Kafka、RocketMQ、RabbitMQ;

✅ 存储&文件类:HDFS、OSS对象存储、Excel、Iceberg、Paimon、Hudi;时序/图数据库:InfluxDB、TDengine、IoTDB、Neo4j;大数据生态&计算引擎:Hive、Flink、FlinkCDC、Atlas元数据;通用接入协议:JDBC 通用数据源、HTTP

插件市场:插件化应用市场,按需安装数据源插件,灵活扩展平台数据连接能力

数据源添加选项:提供丰富数据源类型,可视化配置连接参数,完成多源数据接入

工作流详细页面:拖拽式画布编排数据流水线,配置取数、转换、通知等节点实现自动化数据处理

2、低门槛数据可视化与企业级安全管控

查询结果可一键生成报表、仪表盘,业务人员快速产出分析图表;配套插件化扩展、细粒度权限控制与完整操作审计,保障数据访问合规安全。

数据报表页面:集中管理业务报表,实现周期性规范报表的创建与维护

数据报表查看弹窗

编辑仪表盘页面:仪表盘编辑页面:可视化配置各类图表,拖拽组装业务监控仪表

3大功能核心定位与场景选型

 1、离线开发IDE(AirFlow)

核心定位:Python代码驱动的工作流编排IDE,以代码即工作流,灵活自定义任务逻辑,适合代码化编排复杂 DAG。

适合场景:需要自定义Python脚本、复杂逻辑DAG;数据科学、自定义脚本任务;高度定制化流程。

煤矿勘探GIS数据处理场景(场景举例):Airflow用Python编排自定义脚本,依次完成测绘文件解析、坐标转换、空间数据入库,处理非标准化测绘数据。

 2、可视化数据开发(NiFi)

核心定位:可视化拖拽式数据流流转工具,专注数据采集、传输、转换,不侧重复杂计算,主打异构数据源之间数据流转ETL。

适合场景:多源异构数据采集、数据路由、简单清洗;文件、数据库、API之间的数据搬运;无代码拖拽式数据流转。

多系统数据汇聚场景(场景举例):NIFI拖拽配置,自动从多业务系统数据库、日志文件、API接口采集数据,清洗后统一写入数据中台ODS层。

 3、数据中枢平台(DataCap)

核心定位:统一数据源管理、查询、元数据探查平台,统一连接各类数据源,提供统一查询、元数据浏览、数据预览。

适合场景:统一管理全平台所有数据源;跨数据源即席查询;数据源连通测试、元数据采集探查。

数据中台统一数据源管理场景(场景举例):DataCap统一接入MySQL/Doris/IoTDB等几十种数据源,统一做连接测试、数据预览,给上层开发平台提供数据源能力。

选型快速总结

▶Python自定义复杂脚本编排 → 选用Airflow

▶异构数据源采集、无代码数据流转 → 选用NiFi

▶统一数据源接入、元数据探查、跨源查询 → 选用DataCap

相关学习资料