Skip to content

LLM组件使用说明

组件说明

结合大语言模型(Large Language Model)处理非结构化 / 半结构化数据 设计的功能组件,核心是利用 LLM 的自然语言理解、文本生成、内容提炼能力,完成传统数据处理组件难以实现的非结构化数据结构化、文本内容深度解析、业务标签智能生成等需求。

它的核心逻辑是:将数据流中的文本字段(如用户评论、日志内容、文档摘要)作为输入,调用 LLM 接口(如 OpenAI API、本地化部署的 LLaMA/Qwen 等),再将 LLM 返回的结果解析为结构化字段,融入原数据流中。

典型使用场景

1. 非结构化文本结构化解析

传统组件(如 Regex Split)只能处理格式规整的文本,而 LLM 可以对自由格式的非结构化文本进行语义级解析,提取关键信息并转化为结构化字段。

  • 用户评论结构化提取:电商用户评论字段 comment 内容为:"这款手机续航超棒,用了3天还剩50%电,就是屏幕有点暗,价格2999元很值!",通过 LLM 提取 产品优点、缺点、价格 三个结构化字段,无需编写复杂正则。
  • 客服对话日志解析:客服聊天记录字段 dialog 内容为:"用户:我的订单12345还没发货;客服:您好,已帮您加急,预计明天送达",通过 LLM 提取 用户诉求、订单号、解决方案 等核心信息。

2、文本内容深度理解与标签生成

利用 LLM 的语义理解能力,为文本字段生成业务标签、情感倾向、分类结果,用于后续的数据分析和分流。

  • 情感倾向分析:对商品评论 comment 生成 sentiment 标签(正面 / 中性 / 负面),用于统计商品口碑。
  • 新闻内容自动分类:对新闻摘要 news_summary 生成 news_category 标签(科技 / 财经 / 娱乐),用于内容推荐。
  • 合规性检测:对用户发布的内容 user_content 检测是否包含违规词,生成 is_compliant 标签(true/false)。

3、跨语言文本翻译与标准化

针对多语言混杂的数据源(如跨境电商评论、国际用户日志),利用 LLM 完成文本翻译、术语统一,生成标准化的单语言字段。

  • 将英文评论 en_comment 翻译为中文 cn_comment,并统一专业术语(如 battery life → 续航能力)。

4、半结构化数据补全与增强

对于字段缺失、内容不完整的半结构化数据,利用 LLM 基于上下文进行字段补全、内容润色,提升数据质量。

  • 订单备注字段 order_note 内容为 "加急,送北京朝阳",通过 LLM 补全为结构化字段:urgent = true、delivery_address = "北京市朝阳区"。

配置项说明

配置名称数据类型是否必填默认值描述
节点名称StringLLM当前创建的节点名称,由用户自定义且不可为空。命名可包含字母、数字、下划线。确保唯一性。
节点编码String自动生成当前创建的节点编码,以此标识此组件,由用户自定义且不可为空。命名可包含字母、数字、下划线。确保唯一性。
厂商String-要使用的模型提供者。
api_keyString-用于模型提供者的 API 密钥。
选择大模型String-要使用的模型。不同的模型提供者有不同的模型。
api_pathString-用于模型提供者的 API 路径。
输入列String--输入列名。
promptString-发送到 LLM 的提示。此参数定义 LLM 将如何处理和返回数据。
输出数据类型String--输出数据的数据类型。可用选项为: STRING,INT,BIGINT,DOUBLE,BOOLEAN. 默认值为 STRING。
输出字段名称String--自定义输出数据字段名称。自定义字段名称与现有字段名称相同时,将替换为llm_output。

FAQ