名词解释 推流 将本地视频源和音频源推送到百度直播云服务器 拉流 即直播播放,指已实现直播推流之后,用指定地址将百度云服务器中的视频源和音频源拉取播放的过程。其视频源是实时生成的,而实时直播在播视频的时候是没有进度条的。 推流域名 指用于推送直播流的域名,必选配置,该域名必须在使用直播服务前完成注册并备案。配置完推流域名后,直播服务会生成对应的推流地址。
名词解释 流媒体上下文(Streaming Context) 包含时间线、预览窗口、采集、资源包管理等相关信息集合的对象,Context被销毁之后,SDk视频制作框架也随之不复存在。 采集(Capture) 捕获摄像头设备画面。 录制(Record) 输出采集画面到指定格式文件中。 动画贴纸(Animated Sticker) 带有动画效果的贴纸,叠加在视频上产生一些特殊效果。
视频按时间戳切分 简介 视频时间戳切分处理器,支持按指定时间范围分割 功能描述 按给定的时间戳区间切分视频 支持片段二进制输出或BOS存储 提供格式自动推断与自定义 MP4 (.mp4) AVI (.avi) MOV (.mov) MKV (.mkv) 其他常见视频格式 算子参数 输入 输入 含义 video_paths 包含输入视频路径的数组 默认值:None video_binaries 包含视频二进制数据的数组
登录/注册 个人中心 消息中心 退出登录 百度千帆视频 AI 笔记组件:技术架构解析与开发者落地实践 AI原生应用开发 / 技术交流 百度AI插件 2025.12.12 38002 看过 在企业培训、会议记录、知识管理等场景中,视频内容的高效转化与结构化提取长期是行业痛点。传统人工整理视频笔记不仅耗时耗力,还易遗漏关键信息、出现理解偏差。
视频手部重建(HaWoR) 简介 视频 3D 手部重建算子,对视频重建双手 3D 位姿,并直接产出下游 HandActionCompute 可消费的 hand_pose_seq ,闭合「人类视频 → 动作」链路。离线 GPU 运行。 功能描述 • 从视频均匀抽取 frame_num 帧,用 MoGe-2 估计 FoV 换算 img_focal,用 YOLO 检测器做手部检测与跟踪。
视频相机标定(静态_MoGe) 简介 静态相机内参 / FOV 标定算子,基于 MoGe-2 对静态相机视频估计相机内参矩阵 K(3x3) 与水平 / 垂直 FOV(比 DeepCalib 更准)。 功能描述 • 从视频用 opencv 均匀抽取 frame_num 帧,逐帧用 MoGe-2 推理归一化内参并还原到像素单位。
视频训练适用性评分(VTSS) 简介 视频训练适宜性评分(VTSS)算子,是 SILA 论文 VTSS 的冷启动版(VTSS 权重未开源)。用 CLIP-IQA + Farneback 光流 + Laplacian 清晰度组合规则打 0-9 综合分。用于 SILA §5 步骤 ④ 训练适宜性过滤。
默认值:128 enable_prefix_caching bool True 是否启用前缀缓存以加速多轮推理。默认值:True gpu_memory_utilization float 0.9 单卡GPU显存利用率上限,范围0~1。默认值:0.9 enforce_eager bool False 是否强制使用eager模式推理,调试或特殊场景可用。
对口型 本接口用于创建对口型任务 注意事项: P 模型注意事项 支持 .mp4 或 .mov 视频文件,最大分辨率:1920p,文件大小不超过50MB,视频时长不超过30s 支持 .mp3 或 .wav 音频文件,文件大小不超过50MB,视频时长不超过30s K 模型注意事项 K 模型视频文件支持.mp4/.mov,文件大小不超过100MB,视频时长不超过10s且不短于2s,仅支持720p和1080p
支持视频和图像双分支。