把评估拆成可重复的测试集
不能只由项目成员随手提问。应收集真实业务问题,标注期望答案、必需来源、允许误差和必须拒答的情况,每次模型、提示词、知识库或工具变化后重复运行。
- 正确答案与关键事实一致性
- 来源召回率和引用可用性
- 拒答、澄清和人工升级是否正确
- 响应时间、调用成本和失败率
验证权限越界和提示注入
测试人员应尝试让智能体忽略规则、读取其他部门资料、泄露系统提示或调用未授权工具。安全控制不能只写在提示词中,还要由身份系统、检索过滤和工具权限共同执行。
上线后持续观察,而不是一次验收
上线后应监测用户采纳率、人工修改率、无答案率、错误类型、工具失败和异常成本。发现问题后,需要能定位到模型版本、知识版本、提示词和工具调用记录。
- 高风险任务默认人工确认
- 保留必要日志并控制日志中的敏感信息
- 设置停用开关、限额和异常告警