⌘CtrlK
Appearance
Appearance
结合大语言模型(Large Language Model)处理非结构化 / 半结构化数据 设计的功能组件,核心是利用 LLM 的自然语言理解、文本生成、内容提炼能力,完成传统数据处理组件难以实现的非结构化数据结构化、文本内容深度解析、业务标签智能生成等需求。
它的核心逻辑是:将数据流中的文本字段(如用户评论、日志内容、文档摘要)作为输入,调用 LLM 接口(如 OpenAI API、本地化部署的 LLaMA/Qwen 等),再将 LLM 返回的结果解析为结构化字段,融入原数据流中。
传统组件(如 Regex Split)只能处理格式规整的文本,而 LLM 可以对自由格式的非结构化文本进行语义级解析,提取关键信息并转化为结构化字段。
利用 LLM 的语义理解能力,为文本字段生成业务标签、情感倾向、分类结果,用于后续的数据分析和分流。
针对多语言混杂的数据源(如跨境电商评论、国际用户日志),利用 LLM 完成文本翻译、术语统一,生成标准化的单语言字段。
对于字段缺失、内容不完整的半结构化数据,利用 LLM 基于上下文进行字段补全、内容润色,提升数据质量。
| 配置名称 | 数据类型 | 是否必填 | 默认值 | 描述 |
|---|---|---|---|---|
| 节点名称 | String | 是 | LLM | 当前创建的节点名称,由用户自定义且不可为空。命名可包含字母、数字、下划线。确保唯一性。 |
| 节点编码 | String | 是 | 自动生成 | 当前创建的节点编码,以此标识此组件,由用户自定义且不可为空。命名可包含字母、数字、下划线。确保唯一性。 |
| 厂商 | String | 是 | - | 要使用的模型提供者。 |
| api_key | String | 是 | - | 用于模型提供者的 API 密钥。 |
| 选择大模型 | String | 是 | - | 要使用的模型。不同的模型提供者有不同的模型。 |
| api_path | String | 是 | - | 用于模型提供者的 API 路径。 |
| 输入列 | String | - | - | 输入列名。 |
| prompt | String | 是 | - | 发送到 LLM 的提示。此参数定义 LLM 将如何处理和返回数据。 |
| 输出数据类型 | String | - | - | 输出数据的数据类型。可用选项为: STRING,INT,BIGINT,DOUBLE,BOOLEAN. 默认值为 STRING。 |
| 输出字段名称 | String | - | - | 自定义输出数据字段名称。自定义字段名称与现有字段名称相同时,将替换为llm_output。 |