模型选型报告 = 把 模型选型方法论 五步流程落地,产出一份能驱动「用哪个模型上线」决策的报告。本指南把五步法、模型选型五维度效果评测体系 的相关部分组合成可直接执行的流程 + 报告模板。

适用场景

适合 不适合
新功能上线前要定模型 已有模型且无人反对 → 不必走完整流程
既有模型涨价/退役,要替换 单点验证模型能不能做 → 用 POC验证操作指南
多供应商比价,需对外汇报 微调内部参数(temperature 等)

核心原则(来自 模型选型方法论):不追"最强模型",只追"最匹配模型"。这是 CEO 思维的商业决策,不是 CTO 的技术 trade-off。

步骤总览

步骤 名称 核心问题 主要产出
1 业务场景适配 我们到底要模型做什么? 六维度需求清单
2 建立候选模型池 谁可能符合? 3-5 个候选模型 + 排除理由
3 设计评测集 用什么样本来比? 20 条真实 Prompt,分 4 大类
4 定义评分维度 怎么打分? 维度表 + 0-3 分制评分标准
5 小规模横向测试 哪个胜出? 效果对比矩阵 + 成本分析 + 结论

前置准备

  • 业务方对接人已对齐(评分需要业务方参与)
  • 各候选模型的 API key 或私有部署测试入口已备齐
  • 预算允许跑 20×N 次测试(N 为候选模型数)

第一步:业务场景适配

六维度需求清单

| 维度 | 我们的需求 |
| 输入是什么?     | □文本 □图片 □语音 □视频 □结构化数据 |
| 输出是什么?     | □文本 □图片 □语音 □代码 □结构化数据 |
| 部署要求         | □国内 API □私有化部署 □海外可用 □无要求 |
| 任务难度         | □单轮对话 □多轮推理 □复杂工作流 |
| 容错率           | □零容错 □错一点可接受 □容错较高 |
| 响应速度         | □实时(<3s) □准实时(<60s) □离线可等 |

匹配型分类

按需求填完后,定位三种匹配型(来自 模型选型方法论)之一:

匹配型 典型场景 选型权重
A 速度优先型 客服机器人 速度 > 成本 > 效果
B 推理优先型 代码助手 效果 > 推理深度 > 成本
C 质量优先型 离线报告生成 效果 > 长上下文 > 速度

检查项

  • 六维度清单已填完
  • 匹配型已定(A/B/C)
  • 业务方对场景描述无异议

第二步:建立候选模型池

候选池来源

模型选型五维度 的"模型服务商分类":

来源 例子
自研+直营 OpenAI、Anthropic、Gemini、DeepSeek
自研+分销(云市) Azure OpenAI、AWS Bedrock、阿里云百炼、华为云 MaaS、火山方舟
开源+托管 浪潮、京东云言犀、各云厂商的 Llama/Qwen 托管

候选清单

至少 3 个、不超过 5 个:

| # | 模型名 | 厂商 | 接入方式 | 初步是否符合六维度 | 排除理由(如排除) |
| 1 | ____ | ____ | API/私有 | ✓/✗ | ____ |
| 2 | ____ | ____ | API/私有 | ✓/✗ | ____ |
| ... |

关键原则(来自 模型选型方法论):候选池是从六维度筛选出来的,不是凭印象列举的。

检查项

  • 候选模型 3-5 个
  • 每个模型的接入方式已确认(能跑测试)
  • 被排除的模型有书面理由

第三步:设计评测集

评测集结构

  • 总量 20 条
  • 分 4 大类,每类 5 条
  • 按公司真实业务高频场景配比

4 类典型分布(以 AI 生图为例,可改)

# 类别 测试目的 5 条样本类型
1 商务办公 日常高频需求 商务插画、报告配图
2 数据/科技 专业场景 数据可视化、科技感配图
3 特殊场景 暴露短板(重点) 人种偏见、中文文字、人物细节、本土文化、复杂指令
4 业务定制 公司独有需求 自填

特殊场景题 = POC 中的"陷阱题",决定模型上限。

评测集模板

| 题号 | 类别 | Prompt | 业务方提供的"参考好答案" | 测试目的 |
| 1-1 | 商务办公 | ... | (生图:参考效果描述)| ... |
| ... |

检查项

  • 20 条 Prompt 已就位
  • 4 类 × 5 条结构清晰
  • 第 3 类"特殊场景"已覆盖至少 5 类短板
  • 评测集已锁版本

第四步:定义评分维度

评分维度选择原则

评分维度应反映业务真正关心什么。文本/生图/代码三种场景维度不同,按业务自定义

通用模板(0-3 分制)

| 维度 | 0 分(不可用) | 1 分(勉强) | 2 分(可用) | 3 分(惊艳) |
| 维度 1 | ... | ... | ... | ... |
| 维度 2 | ... | ... | ... | ... |
| 维度 3 | ... | ... | ... | ... |
| 维度 4 | ... | ... | ... | ... |

AI 生图场景示例

维度 0 分 1 分 2 分 3 分
美感 丑、杂乱 一般 精美 惊艳
Prompt 还原度 完全不沾边 沾点边 大致还原 完美还原
风格一致性 风格全错 风格偏 大致对 风格完美
商用安全 有违规 擦边 安全 完全合规

评分人员

每条 Prompt 至少 3 人独立打分(避免单人偏见),分数取均值或多数票。打分人组合建议:

  • 1 个 PM(业务理解)
  • 1 个业务方(用户视角)
  • 1 个内容/设计专员(专业判断)

检查项

  • 评分维度 3-5 个,反映业务真正关心的
  • 每个维度的 0-3 分有明确定义(不靠感觉)
  • 至少 3 人独立打分
  • 打分一致性可接受(分数标准差 < 1)

第五步:小规模横向测试

效果对比矩阵

| 题号 | 维度 | 模型A | 模型B | 模型C |
| 1-1  | 美感 | 2 | 3 | 1 |
| 1-1  | 还原度 | 3 | 2 | 1 |
| 1-1  | ... |
| ...  |
| 总分(满分=20×维度数×3) | 各模型加权汇总 |

成本分析

| 模型 | 单次调用单价 | 单次生成数量 | 单次成本 | 预计月调用量 | 月成本 |
| A    | ¥0.05/次   | 1 张        | ¥0.05   | 100,000 次  | ¥5000 |
| B    | ¥0.20/次   | 1 张        | ¥0.20   | 100,000 次  | ¥20000 |
| ...  |

综合决策表

| 模型 | 效果总分 | 月成本 | 速度(P95) | 合规风险 | 加权得分 | 排名 |
| A    | 95 | ¥5000 | 2s | 低 | 8.5 | 1 |
| B    | 110 | ¥20000 | 4s | 中 | 7.0 | 2 |

加权公式按第一步的匹配型确定:

  • 速度优先型:效果 30% + 成本 30% + 速度 40%
  • 推理优先型:效果 50% + 成本 20% + 速度 30%
  • 质量优先型:效果 60% + 成本 20% + 速度 20%

检查项

  • 全部 20×N 次测试已跑完
  • 效果矩阵 + 成本矩阵 + 综合决策表都已填
  • 加权得分排名清晰
  • 第一名与第二名的差距已说明(如果接近,要给替补方案)

报告模板

最终交付报告结构:

# 模型选型报告:[场景名称]

## 1. 业务背景
- 场景:____
- 决策影响范围:____(哪个产品/哪些功能)
- 预计上线时间:____

## 2. 需求清单(六维度)
[填表]

## 3. 候选模型池
[3-5 个 + 排除理由]

## 4. 评测方法
- 评测集规模:20 条,分 4 类
- 评分维度:____
- 评分人员:____

## 5. 结果
### 效果对比
[矩阵]
### 成本分析
[表]
### 综合决策
[加权排名]

## 6. 推荐
- 主选模型:____
- 备选模型:____(万一主选挂了能切换)
- 推荐理由:____(业务方能懂的话)

## 7. 风险提示
- 供应商风险:____
- 合规风险:____
- 成本上限假设:____

## 8. 下一步
- POC 阶段:____(接 [POC验证操作指南](/notes/AI%E4%BA%A7%E5%93%81/%E6%93%8D%E4%BD%9C%E6%8C%87%E5%8D%97/POC%E9%AA%8C%E8%AF%81%E6%93%8D%E4%BD%9C%E6%8C%87%E5%8D%97/))
- 上线灰度方案:____(接 [灰度发布](/notes/AI%E4%BA%A7%E5%93%81/%E6%A6%82%E5%BF%B5/%E7%81%B0%E5%BA%A6%E5%8F%91%E5%B8%83/))

常见坑

后果 规避
凭印象列候选模型 漏掉真正合适的 候选必须从六维度筛
跳过评测集直接对比 benchmark 分数 benchmark 与你的业务无关 必须用业务真实样本
评分人只有自己 数据有偏见 至少 3 人独立打分
只看效果,不算成本 上线后账单爆炸 综合决策表是必须项
没有备选模型 主选退役/涨价时被动 主选 + 备选成对推荐

完成检查清单

报告交付前:

  • 六维度需求清单已对齐
  • 候选池 3-5 个,排除理由完整
  • 评测集 20 条 × 4 类
  • 评分维度有 0-3 分明确定义
  • ≥3 人独立打分,标准差 < 1
  • 效果矩阵 + 成本表 + 综合决策表都完整
  • 主选 + 备选成对推荐
  • 风险提示有 3 项以上

相关概念

模型选型方法论(五步流程详解) → 模型选型五维度(效果/成本/速度/安全/可控五维评估) → 效果评测体系(评测集与评分方法论) → POC验证(选型后的可行性验证) → POC验证操作指南(选型 → POC 的下一步) → 云厂商与AI基础设施(候选池来源) → AIPM课程 Day5(完整 AI 生图案例参考)