模型选型方法论是 AI 产品经理在多个可用大模型中,依据业务需求系统性地挑选最匹配模型的完整操作框架。与 模型选型五维度(侧重"评什么")互补,本页侧重"怎么选"的全流程。
核心定义
模型选型 = 在多个可用的大模型候选项中,依据具体的业务需求,从能力、成本、速度、合规、生态等维度做出系统性比较,挑出最匹配场景的那个或那几个的过程。
五个关键原则:多个候选项(≥3 个模型纳入对比)、依据需求(先有需求再选模型)、多维度(不只看 benchmark 分数)、系统性(有打分有矩阵有结论)、适配性(选最合适而非最好)。
为什么要做模型选型
- 供给侧:模型货架日益扩大,2022-2026 模型数量增长 10000 倍+。PM 不主动选型,要么被技术团队"拍脑袋"决定,要么被动接受供应商推销。
- 需求侧:业务场景差异大。没有"万能模型",只有"场景最优解"。
- 决策侧:选错代价高——成本风险(吞掉全部毛利)、合规风险(无法上线)、供应风险(产品瘫痪)。这是 CEO 思维的商业决策,不只是 CTO 的技术 trade-off。
步骤总览
| 步骤 | 名称 | 核心问题 | 主要产出 |
|---|---|---|---|
| 1 | 业务场景适配 | 我们到底要模型做什么? | 六维度需求清单 |
| 2 | 建立候选模型池 | 谁可能符合? | 3-5 个候选模型 |
| 3 | 设计评测集 | 用什么样本来比? | 20 条真实 Prompt,分 4 大类 |
| 4 | 定义评分维度 | 怎么打分? | 维度表 + 评分标准(0-3 分制) |
| 5 | 小规模横向测试 | 哪个胜出? | 效果对比 + 成本分析 → 决策 |
三大评价维度与三种匹配型
效果(质量/效果)、成本(资源/费用)、速度(响应/时延)
| 匹配型 | 典型场景 | 权重特征 |
|---|---|---|
| A 速度优先型 | 客服机器人 | 毫秒级响应、成本敏感、稳定性高 |
| B 推理优先型 | 代码助手 | 推理深度、准确性、复杂任务处理 |
| C 质量优先型 | 离线报告生成 | 速度可让位质量、长文本、高质量输出 |
核心理念:不追"最强模型",只追"最匹配模型"——按场景定义指标权重,按权重选型。
第一步:业务场景适配
根据具体的业务场景,把需求拆成可量化的清单,六个维度:
| 维度 | 要回答的问题 |
|---|---|
| 输入是什么? | 文本/图片/语音/视频/结构化数据 |
| 输出是什么? | 文本/图片/语音/代码/结构化数据 |
| 部署要求 | 国内 API/私有化部署/海外可用 |
| 任务难度 | 单轮对话/多轮推理/复杂工作流 |
| 容错率 | 零容错/错一点可接受/容错较高 |
| 响应速度 | 实时(<3s)/准实时(<60s)/离线可等 |
第二步:建立候选模型池
根据业务场景找到对应的模型,再去除不符合要求的模型进入候选池。关键是从第一步的六维度出发做筛选,而非凭印象列举。
第三步:设计评测集
准备 20 条真实 prompt,按公司员工使用场景配比,分 4 大类(每大类 5 条)。评测集要覆盖核心场景和边界场景。
以 AI 生图场景为例的四大类:
- 商务办公场景:日常高频使用的商务插画需求
- 数据/科技场景:数据可视化、科技感配图需求
- 特殊场景:重点评测模型短板——人种偏见性、中文文字渲染、人物细节、本土文化、复杂指令
- (第四类根据具体业务补充)
第四步:定义评分维度
对梳理好的 20 条 prompt,生成后的效果进行横向对比打分。设置具体的打分维度及评分标准(0-3 分制)。
以 AI 生图场景为例:
| 维度 | 0 分 | 1 分 | 2 分 | 3 分 |
|---|---|---|---|---|
| 美感 | 丑、杂乱 | 一般 | 精美 | 惊艳 |
| Prompt 还原度 | 完全不沾边 | 沾点边 | 大致还原 | 完美还原 |
| 风格一致性 | 风格全错 | 风格偏 | 大致对 | 风格完美 |
| 商用安全 | 有违规 | 擦边 | 安全 | 完全合规 |
维度的选择取决于业务场景,不同场景应设计不同的评分维度。
第五步:小规模横向测试
包含两部分——效果对比和成本分析,综合考量后做出最终决策。
- 效果对比:用评测集跑各候选模型,按评分维度打分汇总
- 成本分析:计算单次调用成本和月成本。公式示例:单次调用成本 = 单价 × 生成数量;月成本 = 单次成本 × 月调用量。最终得到"单份成本"用于商业决策
案例:企业内部 PPT 配图生成器选型
详见 AIPM课程 Day5 第八节,完整走通五步流程:从痛点分析(版权风险/成本高/质量差)到需求场景适配(文本→图片、国内 API、单轮、60s 内),建立候选池(wan2.2-flash/plus、seedream4.0、混元 3.0、Midjourney v7、SD 3.5 Large、gpt-image-2),设计 4 类 20 条评测 prompt,定义 4 维度 0-3 分评分标准,最终横向对比效果与成本。
PM 此阶段职责
- 拆需求:把"老板说要个 AI"翻译成可量化的六维度清单
- 建候选池:不能依赖供应商单方面推荐,至少 3 家对比
- 造评测集:评测集质量决定选型结论质量,必须用真实业务样本
- 定评分维度:维度反映业务关心什么——客服重稳定,营销重创意,金融重合规
- 算综合账:效果第一不是绝对的——成本/合规/供应风险都可能反过来 veto
协作对象:算法工程师(候选池构建/测试执行)、业务方(评测样本/评分)、采购/法务(合规与供应商资质)
与其他概念的关系
- 选型是 AI产品研发全流程 中"模型选型"环节的操作方法论
- 模型选型五维度 提供了评估的维度框架(效果/成本/速度/安全/可控),本页的五步流程是将其落地的具体操作步骤
- 选型结果直接影响后续的 POC验证 和 效果评测体系
- 选型中的评测集设计方法可复用到 Badcase分析方法论
相关页面
→ 模型选型报告操作指南(执行版,含完整报告模板) → 模型选型五维度 → 效果评测体系 → POC验证 → AI产品研发全流程 → Badcase分析方法论 → 数据准备五环节 → AIPM课程 Day5