先评估,再优化

提示词、模型和工作流都在快速变化。没有一套固定测试,所谓“效果变好了”很难被重复证明。

AI 评估的抽象图

AI 产品的评估并不神秘:先收集代表性任务,再为每一类任务定义可观察的成功条件。客服场景可能在意事实准确、语气与转人工时机;代码场景可能在意测试是否通过、改动范围与解释是否完整。

关键是让样本包含真实的难题,而非只放几个漂亮示例。把失败案例也保存下来,尤其是会造成业务风险、用户误解或不必要操作的失败。

区分离线指标与线上信号

离线评估适合比较模型、提示词和流程的变化;线上信号则反映真实使用,例如完成率、人工接管率、撤销率与用户反馈。两者不能互相取代:离线指标提供可控对比,线上数据提示新的盲点。

评估的目的不是证明模型聪明,而是发现系统在哪些条件下不可靠。

开始时不必追求复杂的自动评分。对高价值样本进行人工标注,明确“正确”“可接受”“必须拒绝”的边界,往往比一个模糊的总分更有价值。

把评估放进发布流程

当提示词、工具模式或模型版本改变时,自动运行固定测试集并记录差异。对于影响用户的数据写入或决策结果的更新,应把评估结果和人工复核一起纳入发布门槛。

延伸资料