测试动态 / 质量专栏 / AI人工智能/机器学习测试入门:模型质量到底怎么测?
AI人工智能/机器学习测试入门:模型质量到底怎么测?
2026-09-20 作者:cwb 浏览次数:17

模型质量不是只看一个分数,是看它在未知数据上、真实业务里和风险场景下是不是可靠。传统机器学习和生成式AI的测法差别很大。


一、先确定模型质量测什么?


一般要看:

泛化能力:在没见过的数据上表现怎样。

业务适配:标准是不是对应业务代价,比如漏诊和误诊哪个更不能接受。

鲁棒性:遇到异常输入、噪声、分布变化时是不是稳定。

安全和合规:是不是有偏见、毒性、幻觉、隐私泄露等问题。

可解释性:场景下能否解释模型为什么这样判断。

二、传统机器学习,用标准量化性能


分类模型最基础的是混淆矩阵,记录四种结果:真正例、假正例、真负例、假负例。


由混淆矩阵可以算出:

准确率:预测对的比例。适合类别均衡的简单场景。

精确率:预测为正的样本里,有多少是真的正。适合假正例代价高的场景,比如垃圾邮件过滤。

召回率:真实正样本里,有多少被找出来。适合假负例代价高的场景,比如疾病筛查。

F1分数:精确率和召回率的调和平均,用来找平衡。

AUC-ROC:测量模型区分正负样本的排序能力,常用于类别不平衡场景。极不平衡时还可以看 PR-AUC。


精确率和召回率一般要权衡。提高一个,往往会降低另一个。所以不能只看单一标准。


回归任务常用:

MAE:平均绝对误差。

MSE / RMSE:均方误差 / 均方根误差,对大误差更敏感。

R²:决定系数,看模型解释了多少方差。


聚类任务常用:

轮廓系数:看簇内紧密程度和簇间分离程度。

Calinski-Harabasz 指数、Davies-Bouldin 指数等。


三、生成式AI/大模型需要多方面综合考虑

生成式 AI 的输出是开放文本,没有唯一标准答案,所以不能只靠一个自动标准。

常见方法有四类:


自动化标准

BLEU:常用于翻译,看 n-gram 重叠。

ROUGE:常用于摘要,看参考文本内容包括了多少。

BERTScore:用预训练模型算语义相似度,比单纯词重叠更准。

这些标准适合有参考答案的任务,但对开放式生成不够全面。


LLM-as-a-Judge

让一个强模型当裁判,按相关性、连贯性、无害性等标准打分。

优点是扩展性强,能处理开放任务。

缺点是可能有位置偏差、冗长偏差、自我增强偏差。


人工考虑

由人按标准评分,最可靠,能发现自动标准忽略的问题。

但成本高、速度慢、难以复现。


安全和风险标准

包括毒性、偏见、幻觉、越狱、隐私泄露、指令按照失败等。

生成式 AI 上线前,这部分往往和效果标准一样重要。


四、常用工具

scikit-learn:传统机器学习标准计算。

DeepEval:LLM应用、RAG、Agent的考虑框架。

Inspect:灵活考虑LLM的开源框架。

Azure AI Studio:提供内置考虑标准和系统化考虑流程。

PivotEval:大模型效果和性能压测,生成可视化报告。


五、标准流程


确定目的

根据业务目的确定标准和优先级,不要默认只看准确率。


准备数据

测试集必须和训练集严格分离。预处理也要避免使用测试集信息,否则会数据泄漏,结果过于乐观。


选择标准

分类、回归、生成任务用不同标准。业务更怕误报还是漏报,决定精确率和召回率谁更重要。


执行考虑

可以用自动标准、LLM裁判、人工考虑组合进行。


分析迭代

找弱项,回到数据、特征、模型结构或提示词上优化。


六、重点

警惕过拟合:训练集好、新数据差,就是过拟合。

警惕数据泄漏:测试集信息不能进入训练或预处理。

小数据集用交叉证实:k折交叉证实比单次划分更可靠。

不要只看准确率:类别不平衡时,高准确率可能没有实际作用。

定量加定性:自动标准看规模,人工考虑看真实体验。

考虑要可复现:固定数据版本、随机种子、考虑脚本和标准定义。


模型质量考虑,就是围绕业务目的,用独立数据、合适标准和多种考虑手段,不断测试模型是不是可靠、安全、有用。


文章标签: 软件测试 软件测试用例
热门标签 换一换
第三方软件国产化测试 第三方信创测试 CNAS软件测评报告 CMA软件测评报告 首版次软件认定 软件结题验收 软件测试报告书 软件质量检测 数据库测试 H5应用测试 软件质检机构 第三方质检机构 第三方权威质检机构 信创测评机构 信息技术应用创新测评机构 信创测试 软件信创测试 软件系统第三方测试 软件系统测试 软件测试标准 工业软件测试 软件应用性能测试 应用性能测试 可用性测试 软件可用性测试 软件可靠性测试 可靠性测试 系统应用测试 软件系统应用测试 软件应用测试 软件负载测试 API自动化测试 软件结题测试 软件结题测试报告 软件登记测试 软件登记测试报告 软件测试中心 第三方软件测试中心 应用测试 第三方应用测试 软件测试需求 软件检测报告定制 软件测试外包公司 第三方软件检测报告厂家 CMA资质 软件产品登记测试 软件产品登记 软件登记 CNAS资质 cma检测范围 cma检测报告 软件评审 软件项目评审 软件项目测试报告书 软件项目验收 软件质量测试报告书 软件项目验收测试 软件验收测试 软件测试机构 软件检验 软件检验检测 WEB应用测试 API接口测试 接口性能测试 第三方系统测试 第三方网站系统测试 数据库系统检测 第三方数据库检测 第三方数据库系统检测 第三方软件评估 课题认证 第三方课题认证 小程序测试 app测试 区块链业务逻辑 智能合约代码安全 区块链 区块链智能合约 软件数据库测试 第三方数据库测试 第三方软件数据库测试 软件第三方测试 软件第三方测试方案 软件测试报告内容 网站测试报告 网站测试总结报告 信息系统测试报告 信息系统评估报告 信息系统测评 语言模型安全 语言模型测试 软件报告书 软件测评报告书 第三方软件测评报告 检测报告厂家 软件检测报告厂家 第三方网站检测 第三方网站测评 第三方网站测试 检测报告 软件检测流程 软件检测报告 第三方软件检测 第三方软件检测机构 第三方检测机构 软件产品确认测试 软件功能性测试 功能性测试 软件崩溃 稳定性测试 API测试 API安全测试 网站测试测评 敏感数据泄露测试 敏感数据泄露 敏感数据泄露测试防护 课题软件交付 科研经费申请 软件网站系统竞赛 竞赛CMA资质补办通道 中学生软件网站系统CMA资质 大学生软件网站系统CMA资质 科研软件课题cma检测报告 科研软件课题cma检测 国家级科研软件CMA检测 科研软件课题 国家级科研软件 web测评 网站测试 网站测评 第三方软件验收公司 第三方软件验收 软件测试选题 软件测试课题是什么 软件测试课题研究报告 软件科研项目测评报告 软件科研项目测评内容 软件科研项目测评 长沙第三方软件测评中心 长沙第三方软件测评公司 长沙第三方软件测评机构 软件科研结项强制清单 软件课题验收 软件申报课题 数据脱敏 数据脱敏传输规范 远程测试实操指南 远程测试 易用性专业测试 软件易用性 政府企业软件采购验收 OA系统CMA软件测评 ERP系统CMA软件测评 CMA检测报告的法律价值 代码原创性 软件著作登记 软件著作权登记 教育APP备案 教育APP 信息化软件项目测评 信息化软件项目 校园软件项目验收标准 智慧软件项目 智慧校园软件项目 CSRF漏洞自动化测试 漏洞自动化测试 CSRF漏洞 反序列化漏洞测试 反序列化漏洞原理 反序列化漏洞 命令执行 命令注入 漏洞检测 文件上传漏洞 身份验证 出具CMA测试报告 cma资质认证 软件验收流程 软件招标文件 软件开发招标 卓码软件测评 WEB安全测试 漏洞挖掘 身份验证漏洞 测评网站并发压力 测评门户网站 Web软件测评 XSS跨站脚本 XSS跨站 C/S软件测评 B/S软件测评 渗透测试 网站安全 网络安全 WEB安全 并发压力测试 常见系统验收单 CRM系统验收 ERP系统验收 OA系统验收 软件项目招投 软件项目 软件投标 软件招标 软件验收 App兼容性测试 CNAS软件检测 CNAS软件检测资质 软件检测 软件检测排名 软件检测机构排名 Web安全测试 Web安全 Web兼容性测试 兼容性测试 web测试 黑盒测试 白盒测试 负载测试 软件易用性测试 软件测试用例 软件性能测试 科技项目验收测试 首版次软件 软件鉴定测试 软件渗透测试 软件安全测试 第三方软件测试报告 软件第三方测试报告 第三方软件测评机构 湖南软件测评公司 软件测评中心 软件第三方测试机构 软件安全测试报告 第三方软件测试公司 第三方软件测试机构 CMA软件测试 CNAS软件测试 第三方软件测试 移动app测试 软件确认测试 软件测评 第三方软件测评 软件测试公司 软件测试报告 跨浏览器测试 软件更新 行业资讯 软件测评机构 大数据测试 测试环境 网站优化 功能测试 APP测试 软件兼容测试 安全测评 第三方测试 测试工具 软件测试 验收测试 系统测试 测试外包 压力测试 测试平台 bug管理 性能测试 测试报告 测试框架 CNAS认可 CMA认证 自动化测试
专业测试,找专业团队,请联系我们!
咨询软件测试 400-607-0568