概览
更新时间:2026-08-24
脚本作业为离线数据开发提供代码编辑和运行管理能力,适用于可视化处理无法满足的复杂数据加工逻辑。
支持的作业类型
当前脚本作业仅支持 SparkSQL,用于使用 SQL 完成多表关联、数据清洗、去重、聚合和指标计算。作业可读取和写入元数据中可用的 Iceberg 表、Lance 表。
使用流程
脚本作业主要用于开发和管理可复用的脚本任务。开发完成后,可通过单次运行验证脚本是否能够正常执行;如需按照固定时间周期自动运行,需要将已开发好的脚本作业引用到工作流中,通过工作流节点进行统一编排和例行调度。
1. 创建脚本作业
进入脚本作业页面,创建对应类型的脚本作业,并根据实际业务需求配置作业基本信息。
2. 开发并单次运行
完成脚本编写和参数配置后,可通过运行功能执行当前脚本作业。
脚本作业页面中的“运行”属于单次运行,用于开发和调试验证,不会自动形成周期性调度任务。
3. 验证并完善脚本
根据单次运行结果查看执行日志和任务状态。
如果执行失败,可根据日志定位问题并修改脚本、Spark 参数或环境变量,修改后重新运行验证。
建议在正式配置调度前,确保脚本能够通过单次运行验证。
4. 在工作流中引用脚本作业
如果脚本需要按照固定时间或周期自动执行,需要进入工作流进行配置。
在工作流中添加与脚本类型对应的节点,例如:
- SparkSQL 脚本>添加 SparkSQL 节点
在节点配置中,选择已经开发完成的脚本作业,将脚本作业作为工作流节点执行。
工作流中的节点引用的是已经开发好的脚本作业,因此无需在工作流中重复编写脚本代码。
5. 配置工作流调度
将脚本作业添加到工作流后,根据业务需求配置工作流的:
- 执行周期:例如每天、每小时等;
- 执行时间:指定具体的调度时间;
- 依赖关系:配置上游、下游任务的执行依赖;
- 运行参数:根据实际业务需要配置工作流运行时参数。
完成配置后,发布工作流并启用调度,系统即可按照配置的调度周期自动执行。
6. 使用流程示例
以“每日生成用户统计数据”为例:
Plain Text
1创建 Spark 脚本作业
2 ↓
3编写用户统计 Spark 脚本
4 ↓
5配置 Spark 参数 / 环境变量
6 ↓
7单次运行
8 ↓
9查看日志并验证执行结果
10 ↓
11脚本开发完成
12 ↓
13进入工作流
14 ↓
15添加 Spark 脚本节点
16 ↓
17引用已开发的 Spark 脚本作业
18 ↓
19配置每日调度时间
20 ↓
21发布并启用工作流
22 ↓
23按照调度周期自动执行
功能入口
| 入口 | 用途 | 创建后的处理 |
|---|---|---|
| 左侧导航 > 脚本作业 | 查看、搜索和管理脚本作业,也可以创建脚本作业。 | 单击创建作业后填写作业名、创建的类型和项目目录;创建成功后,作业保存到所选项目目录,并使用代码编辑器打开。 |
| 工作台 > 项目 | 查看、搜索和管理脚本作业,也可以创建脚本作业。 | 在项目目录中打开目标脚本作业,进入代码编辑器继续开发、保存或执行验证。创建入口和可用操作以当前项目页面展示为准。 |
评价此篇文章
