Skip to content

Split 转换组件使用说明

组件说明

用于将单个字符串字段的值,按指定分隔符拆分成多个字段或数组,主要用于处理格式规整的拼接字符串数据,实现结构化解析。

典型使用场景

1、单字段拆分为多个独立字段

这是 Split 最常用的场景。当源数据中某个字段是用固定分隔符拼接的复合内容时,可拆分为多个独立字段,便于后续分析。

  • 解析拼接的用户信息:源数据中 user_info 字段值为 1001,zhangsan,25,male(逗号分隔 ID / 姓名 / 年龄 / 性别),拆分为 user_id、user_name、user_age、user_gender 四个字段;
  • 解析日志中的结构化内容:日志字段 log_detail 值为 order_123|PAID|2025-01-01(竖线分隔订单号 / 状态 / 时间),拆分为 order_no、order_status、create_time 三个字段。

2、单字段拆分为数组字段

当拆分后的元素数量不固定,或需要保留集合形式时,可将拆分结果存入一个数组类型字段,适用于标签、爱好等多值场景。

  • 解析用户标签:源数据中 user_tags 字段值为 sports,music,reading(逗号分隔标签),拆分为数组字段 tags_array,值为 ["sports", "music", "reading"];
  • 解析商品分类路径:商品字段 category_path 值为 electronics>phone>smartphone(大于号分隔),拆分为数组字段 category_array,便于后续提取层级分类。

3、清洗非标准分隔符数据

针对字段中存在多分隔符混合或冗余分隔符的场景,可配合 Replace 组件先标准化分隔符,再用 Split 拆分。

  • 源字段 goods_info 值为 laptop;15000|2025-01-01(混合 ; 和 | 分隔符),先通过 Replace 将 | 替换为 ;,再拆分为 goods_name、price、produce_time 三个字段。

4、特殊场景:限制拆分结果数量

通过配置 limit 参数,可控制拆分的最大元素数量,避免因字段值异常(如过多分隔符)导致生成多余字段。

  • 源字段 address 值为 陕西省,西安市,雁塔区,某某街道,只需拆分为省、市、区三级,配置 limit = 3,则拆分结果为 陕西省、西安市、雁塔区,某某街道(剩余内容合并为第三个字段)。

配置项说明

配置名称数据类型是否必填默认值描述
节点名称StringSplit当前创建的节点名称,由用户自定义且不可为空。命名可包含字母、数字、下划线。确保唯一性。
节点编码String自动生成当前创建的节点编码,以此标识此组件,由用户自定义且不可为空。命名可包含字母、数字、下划线。确保唯一性。
表匹配方式List正则匹配两种匹配方式:正则匹配、精确匹配。
正则匹配:需要输入正则表达式。
精确匹配:需要选择精确匹配的库.表。
两种匹配方式可以同时选择。
待分割字段String-待分割的字段名称,例如:name。
分隔符String-分割字段值的分割符。
例如:字段 name,字段值 Joy-Ding,以空格“-”分割,得到两部分值,分割结果赋值给两个字段输出first_name、second_name,字段值分别为Joy、Ding
输出字段String-分割后的结果字段,例如:first_name,second_name。

FAQ