确定了评测对象(见 Prompt测试与Agent测试)之后,下一个问题是怎么给输出打分。第一个决策点是:任务输出是"确定性"的还是"生成性"的——这决定了用对答案、还是用评估器。

决策点:确定性任务 vs 生成性任务

类型 说明 评测方法
确定性任务 输出有唯一或有限的正确答案。如意图识别——"帮我上个团购"就该被唯一识别为 product_agent 预期值直接对比:把模型输出与"标准答案"匹配,算准确率/召回/F1/格式一致性
生成性任务 输出开放、多样、无固定范式。如生图、文案——"画一只猫"有千万种画法,没有绝对标准答案 引入评估器多维打分:设计一个评估器(专用模型或一套评估 Prompt),从多维度综合打分

通用评测维度(Prompt 侧)

无论哪类任务,Prompt 层都常用精确性 / 鲁棒性 / 安全性 / 格式遵从四个维度,完整定义详见 Prompt测试与Agent测试,本页不重复展开。

生成性任务:评估器 + 多维加权打分

没有标准答案时,把主观"好坏"拆成多个可判维度,各给权重,加权求总分:

综合得分 = Σ(维度得分 × 维度权重)

以"生成商品主图"为例:

评测维度 含义 权重
真实与合理性 人物结构、物理关系是否合理(别出现"三条腿的人") 80%
与商品标题相关性 是否准确表达 Prompt 核心元素(要"中式足疗"别给"泰式按摩") 10%
构图与视觉美学 主体是否突出、背景是否干净 5%
商业吸引力 能否激发购买欲 5%

其中"合规与风险"(涉违规/侵权)是一票否决项,不参与加权,命中直接判不通过。

关键:评估器(评测维度 + 打分标准)必须团队共识、版本统一,避免"同样数据、两个略不同的评估器、得出两个相反结论"。调整评估器时,新旧版本都跑一遍校准分差。

对比法:GSB 与 SBS

横向比模型、纵向比版本时,常用两种人工/模型对比打分法:

方法 全称 打分方式
GSB Good / Same / Bad 把 A 与 B 对比,三档:A 更好选 G、一样选 S、A 更差选 B
SBS Side-By-Side 更细的六档:A 更好 / A 好一些 / B 更好 / B 好一些 / 一样好 / 一样差

GSB 适合快速大批量判优劣,SBS 适合需要区分"明显好"和"略好"的精细对比。

选型口诀

  • 有唯一答案 → 自动对比,越客观越好,能上规模
  • 无标准答案 → 评估器多维加权,把主观量化
  • 选模型/比版本 → GSB/SBS 做相对排序,而非各打绝对分

PM 此阶段职责

  1. 判定任务类型:每个评测点先问"有没有标准答案",决定走对比还是评估器
  2. 设计评估器维度与权重:生成性任务的维度拆解和权重分配本质是"把业务价值翻译成可打的分",必须 PM 主导
  3. 设一票否决项:合规/安全这类红线不进加权,单独卡
  4. 统一评估器版本:避免口径漂移导致结论不可比

相关页面

效果评测体系(评测主题枢纽) → Prompt测试与Agent测试(评测对象与四维度) → Badcase分析方法论(打分发现的低分 case 进入归因) → 效果评测体系(自动/人工/LLM-as-Judge 的评判者分类) → 模型选型方法论(横向对比用 GSB/SBS 给候选模型排序) → AIPM课程 Day11