没有评测集,AI项目只能靠“感觉更好了”。中小企业不需要学术级benchmark,但需要自己的10道真题。
10条怎么配
建议结构:
- 3条应能正确答(有文档)
- 2条应拒答或说未知(库中无)
- 2条考引用是否点对文档
- 2条考转人工/高风险(价格、投诉等)
- 1条考过期版本是否被误用
记录什么
| 字段 | 说明 | | --- | --- | | 问题 | 脱敏真实问法 | | 期望 | 要点/应拒答/应转人工 | | 实际输出 | 粘贴 | | 结果 | 通过/失败 | | 失败类型 | 幻觉/串库/越权/态度等 |
何时跑
- 改Prompt
- 大幅更新知识库
- 换模型或Agent工具
- 每周固定一次
结论
10条真题,胜过100页PPT承诺。 先有回归,再谈扩场景。方法见 中小企业AI办公方案;若要共建评测集,可 预约咨询。
常见问题
10条会不会太少?
够启动。稳定后扩到30–50,并按风险域加权。
要用自动化评分吗?
早期人工打分即可;自动化是后话。
评测集从哪来?
真实工单、咨询记录与制度问答;脱敏后入库。
继续在生态里走
这篇方法对应到站点里的行业、方案、Prompt、案例与工具——选一条继续深入。