概述
更新时间:2026-08-17
模型评测用于在统一的评测任务中,对模型能力、性能与结果质量进行量化验证和分析。通过标准化的数据集、评测配置和结果展示,帮助用户高效完成模型选型、版本验收和效果迭代。
核心功能
- 创建评测:选择待评测模型、评测集与评测配置,发起一次可追溯的评测任务。
- 评测详情:查看任务状态、指标结果、样本明细和运行信息,定位模型表现差异。
- 对比评测:将多次评测结果并列比较,辅助模型、版本和参数配置的决策。
适用场景
- 模型上线前的效果验收与基线校验。
- 多模型或多版本的能力、性能对比与选型。
- 具身模型 task、执行参数等迭代后的效果回归。
- 按统一口径沉淀团队评测结果,形成可复用的评测资产。
权限说明
使用模型评测前,需要具备目标项目或工作空间的访问权限,以及相关模型、数据集和计算资源的使用权限。无权限时,请联系项目管理员开通。
典型使用方式
- 准备待评测模型。
- 创建评测,配置评测指标、评测规模与运行参数。
- 在评测详情中查看结果与样本分析,确认模型表现。
- 发起或查看对比评测,比较多个模型、版本或配置,并据此完成选型或迭代。
评价此篇文章
