企业 AI 上线前应该怎么测试?上线后还要监控吗?
直接答案
上线前要用真实任务、正常样本、边界样本和恶意样本评估质量、风险、成本和可用性;上线后仍要持续监控。模型输出存在变化,资料、用户和业务环境也会变化。
只在演示中问几个顺利的问题,无法判断系统能否进入真实工作。测试集应来自实际任务,并保留预期答案、允许范围或人工评分标准。高风险场景还要测试拒答、越权、提示词注入和服务中断。
上线前至少要看哪些指标
- 任务是否完成,事实是否准确;
- 是否引用了正确资料,是否遗漏关键条件;
- 敏感信息、越权和不当内容风险;
- 响应时间、失败率和单次成本;
- 人工返工量和用户是否愿意采用。
上线后的监控要覆盖功能是否仍按预期工作、基础设施是否稳定、异常输出、用户反馈和实际影响。模型版本、知识库和提示词发生变化后,应重新运行关键测试。
测试结果不是永久证明
预上线评估发生在受控环境,不能覆盖所有真实输入。团队应保存失败样本、设置报警和停用条件,并明确谁负责修复、谁决定恢复运行。