夜雨聆风学习资料网

ARTICLE · 1080919

客户真题讲解|趁手好用,AllData搭建数据汇聚平台,集成开源项目DBSwithch/Tis/Transport/Seatunnel,涵盖数据全量/增量/离线/实时同步

客户真题讲解|趁手好用,AllData搭建数据汇聚平台,集成开源项目DBSwithch/Tis/Transport/Seatunnel,涵盖数据全量/增量/离线/实时同步

在数据汇聚同步时最怕的就是多业务系统数据分散、同步配置繁琐、存量迁移与实时增量割裂,数据不同步影响业务对账统计。

业务场景:财务、生产两套业务库相互独立,需要一次性迁移历史存量数据,还要持续同步每日新增业务单据,手动建表、分开发布同步任务,不仅工作量大,还容易出现数据延迟、漏同步问题。

接下来,AllData数据中台通过拆解数据汇聚平台中数据库同步平台、数据集成平台、数据集成管理、数据同步平台4大功能,如何将数据分散、同步配置繁琐等“老问题”逐一击破!


数据汇聚平台模块,四大功能拆解

一、数据库同步平台(DBswitch)

实现国内外主流及信创国产异构数据库之间的表结构复制、全量/增量数据同步迁移,并提供驱动管理、元数据浏览、任务监控与操作审计的一站式数据库同步运维能力。

DBswitch开源项目:https://gitee.com/inrgihc/dbswitch

1、广泛兼容信创数据库,支持自定义驱动管理

平台覆盖MySQL、Oracle等传统数据库,同时完整适配达梦、人大金仓、神通、南大通用、瀚高、OceanBase等国产信创数据库。

预置主流数据库驱动,针对特殊版本或国产库,支持手动上传 JAR 驱动包完成适配;数据源创建强制测试连接校验,从源头规避连接异常,满足国产化项目异构数据库对接需求。

主流开源与商业关系型数据库(RDBMS):MySQL、MariaDB、Oracle、SQLServer、PostgreSQL、DB2、Sybase、SQLite3

国产信创/国产关系型数据库:DM、KingBase、Oscar、OpenGauss、OceanBase、TDSQL、HighGo

大数据与分布式分析型数据库:Hive、ClickHouse、Doris、StarRocks、Greenplum、GBase8A

NoSQL/文档与搜索引擎:MongoDB、ElasticSearch

数据源创建支持在线测试连接校验,从源头规避连接异常,满足国产化项目异构数据库对接需求

2、异构库表结构+数据一体化同步迁移

支持全量数据同步,也支持仅复制表结构(字段、索引、注释、自增属性),可用于搭建测试环境、对齐开发生产库结构。

✅️ 任务支持源端、目标端灵活配置,提供表名、列名映射转换、增量同步配置,可自主选择仅建表、仅同步数据、建表并同步数据多种模式,满足异构数据库之间表结构迁移、数据搬运的多样化场景。

数据同步源端设置

数据同步的目标端设置
配套数据导航能力,可浏览元数据、预览表结构、在线执行SQL,方便前期核对源库信息

3、可视化运维监控,完整记录任务与用户操作

通过任务内执行日志、全量监控日志,实现数据库同步任务可视化状态跟踪,可实时掌握平台状态、快速排查任务故障并支持操作审计追溯,构建从任务创建到排错的运维闭环。

监控调度中留存每一次任务运行记录,可查看读取、写入数据量与详细执行日志,报错可通过日志快速定位故障

    操作日志完整留存全部用户操作行为,记录操作人、时间、行为,便于审计追溯; 任务从创建、执行到排错形成闭环,降低异构数据库同步运维难度

    二、数据集成平台(Tis)

    数据集成平台 (Tis) 统一注册、按业务线管理各类数据源,支持海量同步任务分组运维;配置同步作业可自动在目标端建表,免去手动建表。平台采用全量离线 + 增量实时一体化同步,先一次性迁移存量历史数据,完成后一键开启增量通道,自动捕获源端新增、变更数据并持续同步,保障目标库数据时效性,降低开发工作量。

    Tis项目地址:https://github.com/datavane/tis

    Tis项目文档:https://tis.pub/docs/

    1、多源异构统一接入,覆盖全域数据源

    平台支持批量(DataX)读写、实时Source/Sink多类数据源,覆盖关系型数据库、国产数据库、消息队列、数仓、搜索引擎等组件,可满足绝大多数企业内部异构数据源的汇聚同步需求:

    2、双引擎同步:离线批量+实时CDC,一站式流转

    平台集成离线批量+实时CDC双引擎与可视化低代码ETL能力,一套平台即可完成全场景数据采集、同步与加工,兼顾大数据量迁移与低延迟变更捕获,支持拖拽编排与脚本扩展,大幅降低数据集成开发成本。

    引擎一体化:离线批量与CDC实时同步统一管控,全量/增量、数据库变更捕获一站式实现,不侵入源业务库,适配ODS落地与实时指标场景;

    加工可视化:拖拽式流程编排,内置丰富数据转换算子,可快速完成清洗、映射、脱敏;同时兼容 SQL/Flink SQL脚本,简单场景低代码配置,复杂逻辑自定义开发;

    运维简化:集成同步与加工链路统一管理,无需维护多套独立工具。

    手动操作数据同步

    开通实时CDC同步任务自动获取增量数据

    全量历史数据抽取时,可对抽取并发、单次拉取数据量进行限速控制,平缓读取源库数据,避免一次性全量拉取把源库CPU、IO资源打满,保障生产业务数据库稳定运行,不会因为数据同步任务影响前端业务正常访问。

    全量同步中预先设置了内存批量拉取数值

    3、任务调度与运维监控,全链路可观测

    平台提供一体化任务调度与可视化运维监控,支持手动触发同步作业,实时查看任务构建执行状态,可追溯操作历史与运行日志,实现全链路数据流转可观测。

    灵活任务触发:同步作业配置完成后,支持手动一键触发同步构建,按需启动数据同步任务

    可视化执行监控:任务执行页面直观展示运行状态、耗时、数据进度,实时判断构建与同步是否成功

    全量操作留痕:操作历史模块记录所有任务操作行为,支持查看完整操作记录与底层接口日志
      主控台清晰显示执行任务情况
      构建详细中查看该次构建的完成情况
      操作历史中记录任务的执行全部历史,可追查记录以及查看日志定位问题

      三、数据集成管理(Transport)

      数据集成管理是AllData数据中台的数据同步核心模块,提供模板化批量构建数据同步任务能力,支持单表同步、多表同步两种同步模式,实现异构数据源之间的数据离线同步。

      Transport开源项目:https://github.com/alldatacenter/alldata

      Transport产品手册 https://www.yuque.com/aolingdata/product

      1、基础底座能力 | 数据源与任务模板管理

      数据源管理统一维护各类型数据库连接信息,一次性配置可反复复用,和平台其他数据源模块相互独立;新建数据源必须完成测试连接才可保存,解决数据读取的连接源头问题。

      ✅️ 任务模版实现同步流程标准化复用,固化定时、告警、执行器等通用配置;模版更新仅对新套用任务生效,不会改动历史已创建任务,减少重复配置工作量,适配多任务的统一规范管理。

      统一数据源管理,一次性配置可反复复用

      标准化任务模版

      2、核心数据搬运能力 | 数据同步任务构建

      平台提供单表同步、多表同步两种模式,满足不同业务迁移场景:

      单表同步:一对一表数据迁移,适合少量、测试、独立单表场景;流程为配置源端 Reader、目标端 Writer、字段映射、套用模版构建任务。

      多表同步:批量多张数据表同步,适合业务大批量初始化、关联表需要保障数据一致性场景;支持多选源 / 目标数据表、批量表映射,一键批量生成大量同步任务。

      单表同步

      多表同步

      任务编辑页面,查看引用过的模版信息以及同步设置

      3、运行保障能力 | 任务调度运维监控

      ✅ 任务详情:统一管理全部同步任务,支持手动单次执行、启停、编辑任务;修改运行中任务建议先停止,改完需要手动重启才生效,修改任务不会改动原任务模版。

      ✅ 执行配置&注册中心:管理任务执行器,查看执行器CPU、内存负载状态,监控执行器在线健康情况,任务调度依赖可用执行器资源。

      ✅ 运行日志:完整留存每一次任务执行记录,可查看详细运行输出、终止临时执行任务,用于排查同步报错、定位运行故障。

      两种方式创建出来的任务均汇总到任务详情中统一管控,新创建任务需要手动启动才会执行调度

      运行日志中查看任务运行情况

      四、数据同步平台(Seatunnel-Web)

      Seatunnel-Web项目地址:https://github.com/apache/seatunnel

      Seatunnel-Web官方文档:https://seatunnel.apache.org/zh-CN/docs/2.3.11/start-v2/locally/deployment/

      1、多类型数据源兼容管理,前置连接校验保障接入可靠

      平台支持JDBC‑Mysql、Oracle、Doris、Kafka、Hive等多种数据库与消息中间件数据源类型,覆盖传统数据库、消息流等多类业务数据源。

      传统数据库(最核心的业务与数仓数据源):Doris、JDBC-Postgres、JDBC-ClickHouse、JDBC-Hive、JDBC-Db2、JDBC-Mysql、StarRocks、JDBC-TiDB、SqlServer-CDC、Hive、MySQL-CDC、JDBC-SQLServer、JDBC-Oracle

      文件:S3

      非结构化:Kafka、ElasticSearch、MongoDB

      假连接:Console、FakeSource

      支持的传统数据源类型以及6大分类

      2、可视化编排同步任务,内置丰富数据加工组件

      支持离线+实时两种同步模式,通过可视化画布编排同步流程,流程以Source数据源作为输入、Sink作为数据输出。

      平台内置全套数据加工处理组件,覆盖复制、SQL 转换、字段映射过滤、脱敏、多表关联 Join、聚合、去重、字段拆分等能力,在同步链路中直接完成数据清洗、转换、脱敏、多表拼接,无需额外开发,可实现敏感信息脱敏、条件过滤、字典翻译、数据标准化等复杂的数据处理需求。

      同步任务编辑页面:可视化+拖拽式编辑

      同步任务每个节点都可以单独设置详细信息

      3、虚拟表逻辑多源整合,不污染原始业务数据

      提供虚拟表能力,属于逻辑表,不存储真实物理数据。支持接入多源数据,自定义配置表结构与字段,实现多源数据逻辑拼接整合;业务可基于虚拟表开展数据查询、同步操作,全程不会改动、污染原始源表数据,兼顾数据安全与多源联合分析的业务诉求,支持后期编辑调整虚拟表字段类型。

      虚拟表的列表页面

      虚拟表的设置页面,设置配置和模型信息

      四大功能核心优势与场景选型

      数据库同步平台、数据集成平台、数据集成管理、数据同步平台这四个功能在不同场景下分工明确:数据集成管理和数据集成平台侧重“传输+加工”,适合开发数仓;而数据库同步平台和数据同步平台侧重“传输一致”,适合实时同步、容灾和数据搬运。

      1、数据库同步平台(DBSwitch)

      侧重的数据汇聚同步方向:数据库层面的低延迟表结构 + 数据同步,聚焦库内数据,保障秒级数据一致性,最小化对生产库压力,多用于主备、实时数仓库表同步。

      技术底座:基于数据库binlog/redo日志捕获技术,增量CDC内核,适配信创数据库

      推荐场景:需要建立实时数据仓库、支持跨系统数据融合,或对主备数据库的秒级延迟和数据一致性有强诉求,并能有效降低同步对生产数据库的影响。如:政务业务库实时同步至信创数仓,业务库新增审批单据秒级同步,不影响在线业务,保障政务报表实时更新。

      2、数据集成平台(Tis)

      侧重的数据汇聚同步方向:全链路数据汇聚治理,采集、清洗、转换、聚合一体化,面向数仓构建,标准化数据口径,兼顾存量全量迁移 + 实时增量同步。

      技术底座:全量+增量一体化调度引擎,内置数据转换、清洗算子,配套统一元数据管理

      推荐场景:企业有构建数据仓库、进行全链路数据治理的规划,需要将数据采集、清洗、聚合等流程统一管理,以提升开发效率并规范数据口径。制造企业搭建企业级数据仓库,汇聚生产、财务、供应链多系统数据,统一清洗转换,形成标准化指标用于经营分析。

      3、数据集成管理(Transport)

      侧重的数据汇聚同步方向:多源异构数据快速接入汇聚,兼顾结构化、非结构化数据,主打开箱即用,快速完成跨系统数据采集与传输,轻量化任务管理。

      技术底座:基于数据传输内核,轻量执行引擎,支持多异构数据源驱动插件化管理;

      推荐场景:需要快速进行跨系统数据整合,且数据源类型较多(如RDBMS、数仓、非结构化数据),对工具的开箱即用和灵活性有较高要求。如:煤矿企业快速汇集生产数据库、设备日志文件、文档资料,短时间搭建临时数据采集链路,快速做临时业务统计分析。

      4、数据同步平台(Seatunnel-Web)

      侧重的数据汇聚同步方向:泛数据搬运,重点支持日志、文件等非 / 半结构化数据、消息队列、云平台数据流的采集同步,擅长流式数据传输与链路内数据加工。

      技术底座:Flink流式处理引擎,内置丰富的Reader/Writer组件,支持流批一体。

      推荐场景:只需要纯粹的数据搬运能力,数据源中存在大量非结构化文件(如日志)、半结构化数据,或需要对接复杂的云平台和消息队列。如:火电平台采集服务器运行日志、Kafka 设备上报数据流,在同步链路中完成过滤、脱敏,传输至下游分析系统做设备监控告警。

      快速选型推荐

      ▶ 如果您需求是“把数据从A准确搬到B”,选数据同步平台(SeatunWeb)

      ▶ 如果您需求是“确保数据库B永远和A保持一致”,选数据库同步平台(DBSwitch)

      ▶ 如果您需求是“搬运的同时进行加工,形成规范数据”,选数据集成平台(Tis)

      ▶ 如果您需求是“快速、灵活地连接各种异构数据源”,选数据集成管理(Transport)

      相关学习资料