引言
这家客户是一家国内头部影视传媒集团,业务覆盖内容制作、发行、用户运营。公司成立十几年,业务规模不断扩张,数据量也在快速增长。但数据管理的方式,还停留在比较原始的阶段。
第一件事:文件格式说变就变,脚本改不过来。每个来源的数据文件有固定的格式,但这个“固定”并不牢靠,这种变化没有规律,也没有提前通知。以前的做法是:为每个文件写一个专门的解析脚本,哪个文件格式变了,就找到对应的脚本去改。但问题在于,文件太多了,来源也太多了,今天改了这个,明天那个又变了。
第二件事:业务规则太多。在需求梳理阶段,我们和客户开了好几次会,把他们平时手工处理数据时的规则一条一条整理出来,最后列了40多条。这些规则涉及用户类型怎么定义、价格从哪张表匹配、支付方式怎么转成中文、数据最后要按什么结构合并,问不清楚就容易出错。

他们想建一个数据中台,核心需求就是解决这两个问题:文件格式动态变化的应对、业务规则的系统化沉淀。
今天我们邀请迅易科技数据业务总监赖香辉,从客户的角度给我们简单分享,迅易科技是怎么帮客户解决问题的。

(内容已整理)
第一个问题:文件格式说变就变
数据团队以前的做法是:每个文件配一个脚本,脚本里写死了分隔符和解析逻辑。文件格式一变,脚本就报错,就得人工去改。
这种模式的问题在于:数据来源多,文件数量多,改脚本的工作量会随着数据量线性增长。而且改脚本的人如果对业务不熟,很容易改出问题。
迅易科技的做法:
基于阿里云 Dataphin 的数据集成能力,我们把“改脚本”变成了“配置规则”。
核心逻辑是:在数据接入环节,不再为每个文件写单独的解析脚本,而是配置一套通用的自动识别规则。每次读取文件时,系统自动取前几行数据,统计常见的出现频率,自动解析路径。
这样一来,不管今天来的文件怎么变化,系统都能自动适配,不需要人工去改脚本。
第二个问题:数据出问题,怎么快速定位?
文件格式变化只是问题的一种。业务规则调整、上游数据异常、表结构变更……任何环节出问题,都可能导致下游数据不准。
以前的做法是:数据对不上了,业务来找,数据团队开始排查。先看哪个任务失败了,再看哪个表数据不对,再往前找是哪个文件的问题。
迅易科技的做法:
依托 Dataphin 的数据质量模块和元数据管理能力,我们把“事后排查”变成了“事前预警”。
第一层:规则配置,提前设好检查点。
在关键表上配置质量规则。系统每天跑完数据后自动校验,不满足规则的数据会被标记出来。从质量大盘上可以一目了然地看到:今天有多少表被检查了,有多少规则异常了,异常的是强规则还是弱规则。
第二层:元数据采集,搞清楚数据从哪里来。
把各个数据源的元数据都采集进来,包括表结构、字段、视图等信息。这样当某个表的数据出问题时,可以快速追溯它的上游来源。
第三层:问题定位,从现象到根因。
当某个指标出现异常,比如某个渠道的新增用户数突然下降,系统会触发波动告警。数据团队收到告警后,可以从规则校验记录里看到具体哪个字段的规则被触发了,然后通过元数据血缘关系,一路追溯到上游是哪个文件、哪个字段出的问题。

第三个问题:业务规则怎么沉淀?
在需求梳理阶段,我们和客户开了好几次会,把他们平时手工处理数据时的规则一条一条整理出来。举几个例子:
01 用户类型规则:
用户类型要根据白名单和退续订规则来生成,这个规则涉及两张表,我们在 DWD 层的清洗作业里写了一段判断逻辑,根据用户在不同表中的状态自动生成用户类型字段。
02 剧头匹配规则:
数据与数据要关联一张额外的映射表,我们把这个映射表作为维度表提前加载,在清洗时通过关联完成匹配。
03 价格和支付方式规则:
价格字段不能直接用,要去关联活动维度和产品维度,支付方式字段要转成中文。所以每次处理订单数据,都要做三次关联。
04 分层合并规则:
用 Dataphin 的条件分发功能,把不同分发的数据流向不同路径,处理完再合并到一起。

所有这些规则,我们全部通过 Dataphin 的规范建模和 ETL 开发能力,写进了数据加工流程里。同时整理成了一份《数据中台开发规范》,涵盖数据建模、ETL开发、命名规范、字段定义等内容,把每个业务规则的出处、对应代码、修改历史都附上了。
为什么能解决这些问题
回顾这个项目,迅易科技能帮客户解决这三个问题,背后是我们在数据中台领域的几个核心能力:
01 对复杂业务场景的理解和抽象能力。
客户 40 多条业务规则,不是简单写几个 SQL 就能搞定的。每条规则背后都有特定的业务含义,我们需要理解这些规则在业务中是怎么用的,然后才能正确地用技术语言表达出来。比如“退续订”和“立即退订”这两个概念,在业务上含义完全不同,对应的代码逻辑也就不同。
02 对平台能力的深度运用。
阿里云 Dataphin 提供了完整的数据集成、开发、质量、服务能力,但能不能用好这些能力,取决于实施方对平台的熟悉程度。我们在这个项目里用到了 Pre-Shell 脚本、条件分发、质量规则配置等多个高阶功能,每个功能都切中了客户的痛点。
03 体系化的数据治理思路。
我们不只是帮客户建了几个 ETL 作业,而是把数据分层、命名规范、质量监控、血缘管理这些体系化的东西都沉淀下来。这样客户后续自己做扩展时,能保持一致的规范,不会越做越乱。
如果您也在被类似的数据问题困扰,欢迎找我们聊聊。
关于迅易科技
广州迅易科技有限公司,专注于企业数字化转型服务,是微软、阿里云、腾讯云、帆软等厂商的认证合作伙伴。我们提供从咨询、实施到运营的全流程服务,帮助企业实现 AI 赋能、数据驱动、智能运营。