产品功能
更新时间:2026-09-09
一、AI安全护栏
| 产品功能 | 功能描述 |
|---|---|
| 多模态内容审核HOT | 融合前沿视觉理解和跨模态对齐技术,实现对文本、图像、视频、音频、文档等多种形式内容的全方位安全防护和处置。 |
| Agent安全检测HOT | 防范输入、输出、工具调用环节中涉及违规内容、直接/间接注入攻击等风险,保障智能体运行安全。 |
| 高级攻击检测 | 对于恶意提示词攻击、算力消耗、角色扮演、拒绝抑制、提示词泄露等用户输入风险提供防护能力。 |
| 红线知识库服务 | 针对对话中高敏感的涉政(如领导人相关)问题,提供标准的回复内容,保证内容客观、政治中立、准确全面。 |
| 安全大模型代答 | 针对不良价值观、涉黄、涉政、违法等提问,安全大模型结合政府网站/官媒/百科的信任域检索库,提供准确回答。 |
| 敏感信息检测 | 检测用户获取敏感信息意图,同时避免大模型生成手机号、身份证号、家庭住址等个人敏感信息。 |
| 网址安全检测 | 提供色情、博彩、诈骗、盗版等违规网站检测能力。 |
二、大模型安全评测
| 产品功能 | 功能描述 |
|---|---|
| 评测数据构造HOT | 支持根据风险分类、攻击类型、多模态场景等维度自动生成标准化评测数据;同时支持自定义数据上传,并可通过改写模型按需生成定向评测数据集,满足多样化评测需求。 |
| 风险自动化脱敏HOT | 支持对模型输入输出内容进行自动化标注与智能分析,结合上下文语义综合判断回答安全性,自动生成可追溯、可核验的评测依据。 |
| 策略配置管理 | 支持针对待测模型与智能体进行灵活配置,包括自定义关键词词表、标注策略规则及基础运行参数,实现精细化评测管控。 |
| 自动化生成评测报告 | 基于评测标注结果自动生成大模型安全评测报告,涵盖风险问题识别、问题分析与优化建议,并以可视化图表呈现;报告支持在线查看、导出下载与自定义编辑。 |
| 数据统计可视化看板 | 提供评测任务全维度数据可视化看板,支持测试结果统计、风险趋势分析与异常问题快速定位,直观呈现模型安全能力与风险分布。 |
| 舆情风险事件监测 | .基于境内外全量新闻资讯与热点事件智能聚合,实时生成每日高风险舆情榜单,并自动构建标准化舆情风险测试样本,为系统安全与内容风控提供精准测试支撑。 |
三、大模型语料清洗系统
| 产品功能 | 功能描述 |
|---|---|
| 语料风险检测HOT | 提供训练语料中涉及个人敏感信息及违反社会主义核心价值观的违规数据检测能力。 |
| 风险自动化脱敏 | 提供针对多种结构化与非结构化训练数据格式的风险自动化脱敏或删除处理,脱敏后文件可直接用于训练。 |
| 自定义清洗配置 | 根据业务管控需要灵活配置需要清洗的敏感信息与违规数据类型,并可选择不同的脱敏方式。 |
| 训练数据隔离 | 不同业务之间训练数据隔离处理,独立管理互不可见,避免信息泄露。 |
四、运营质检系统
| 产品功能 | 功能描述 |
|---|---|
| 数据自动化质检HOT | 对线上大模型业务数据进行全自动的误报、漏报质检,风险快速发现,及时处理。 |
| 风险快速处置 | 联动安全护栏产品,构建风险处置流水线,降低人工处理成本。 |
| 全链路审计 | 业务信息、质检结果、护栏防护情况、case干预等全链路记录以备审计。 |
评价此篇文章
