云原生 函数计算 CFC 容器实例BCI 容器镜像服务CCR 安全 DDoS防护服务 应用防火墙 WAF 密钥管理服务 SSL证书 云堡垒机 应用加固与安全检测 人工智能 人脸识别 人体分析 语音技术 文字识别 语言处理技术 图像识别 图像搜索 图像增强 全功能AI开发平台 BML 零门槛AI开发平台 EasyDL 知识理解 内容审核平台 智能大数据 MapReduce 流式计算 BSC 数据可视化
词汇重复率计算 简介 词重复比例计算器 - 基于N-gram词组重复比例的文本特征提取 功能描述 词重复比例计算:精确统计文本中重复词组的比例 双语言支持:支持中文、英文的分词处理 灵活配置:支持不同长度的N-gram词组计算 文本质量评估 数据清洗和预处理 内容重复检测 基于空格分词:适用于英文等空格分隔的语言 基于模型分词:使用sentencepiece模型,中文须使用此模式 可配置N-gram
文本长度计算器 文本长度计算器 简介 文本长度计算器,计算文本字符串的字符数(字节/Unicode 字符数),用于数据质量过滤。
文本困惑度计算 简介 困惑度计算算子 - 基于语言模型的文本质量评估解决方案 功能描述 语言模型评估 基于 KenLM 语言模型计算文本困惑度 支持中英文文本质量评估 提供文本可读性指标 质量评估 困惑度越低,文本质量越高 适用于文本质量筛选和评估 模型核心 KenLM: 高效的语言模型推理 SentencePiece: 中英文分词处理 计算优化 批量处理提升效率 内存友好的模型加载 算子参数 输入
字符占比计算器 字符占比计算器 简介 字符占比计算器,计算文本中字母字符数与总字符数(或 token 数)的比值,用于过滤非自然语言文本。
音频时长分析处理器 简介 音频时长分析处理器,精确计算音频内容时长 功能描述 精确计算音频时长(秒级精度) 支持本地文件、BOS存储与二进制 基于librosa专业音频处理库 支持视频格式 MP3 (.mp3) WAV (.wav) FLAC (.flac) OGG (.ogg) AAC (.aac) M4A (.m4a) 算子参数 输入 输入 含义 audio_inputs 存放音频路径或二进制的列
视频清晰度评分 简介 视频清晰度计算处理器,支持多种清晰度评估方法和抽帧策略。
文本 sparse & dense embedding 简介 基于 BGE-M3 的文本嵌入模型,支持稀疏/稠密/token 三级向量生成 功能描述 稀疏向量:词项权重表示,适合关键词检索 稠密向量:1024维语义表示,适合语义相似度计算 Token向量:细粒度上下文表征 硬件加速**:支持 FP16 量化与 GPU 并行计算 算子参数 输入 输入 含义 texts 包含待处理文本的数组,元素类型为
视频运动分计算 简介 视频运动分计算 功能描述 Farneback TV-L1 DIS:ULTRAFAST、FAST、MEDIUM、accurate MEMFOF(深度学习光流) 多指标支持:返回多种多层次计算指标 mean_score: 原始均值 median_score: 中位数 dynamic_mean_score: 尺寸自适应均值 high_percentile_score: 原始95分位
t ImageEasyOcr 10 11 if __name__ == __main__ : 12 if os . getenv ( DAFT_RUNNER , native ) == ray : 13 import ray 14 ray . init ( dashboard_host