模型选型 = 根据业务场景的需求,选择"最合适"(不是最强大)的大模型作为AI产品的能力底座,在效果/成本/速度/安全/可控性之间做出最优权衡的过程。

本页侧重"评什么"——五个评估维度本身;完整的"怎么选"五步流程见 模型选型方法论

类比买车:没有"最好的车",只有"最适合你场景的车"——模型也一样。

核心认知:模型选型不是技术决策,是"业务 × 技术 × 成本"的三方平衡。PM必须深度参与(懂业务、懂效果、懂成本)。

五个核心评估维度

  1. 效果维度:准确率、推理能力、多语言、上下文长度
  2. 成本维度:单token价格、月度调用总量、微调/部署成本、边际成本
  3. 速度维度:响应延迟、并发能力、首字延迟、TPS吞吐
  4. 安全维度:数据隐私、内容合规、出海合规、行业资质
  5. 可控维度:私有部署、模型微调、版本锁定、响应格式

主流模型对比(2025年参考)

模型 效果 成本 速度 中文支持 适合场景
Claude Opus ★★★★★ ★★ ★★★ ★★★★ 复杂推理/Agent
Claude Sonnet ★★★★ ★★★★ ★★★★ ★★★★ 通用主力(推荐)
Claude Haiku ★★★ ★★★★★ ★★★★★ ★★★ 高并发/低成本
GPT-5 ★★★★★ ★★ ★★★ ★★★★ 复杂推理/创作
GPT-4o-mini ★★★ ★★★★★ ★★★★★ ★★★ 简单分类/翻译
Gemini ★★★★ ★★★★ ★★★★ ★★★ 多模态/长文档
DeepSeek-V3 ★★★★ ★★★★★ ★★★★ ★★★★★ 国内业务/性价比
通义千问 ★★★★ ★★★★ ★★★★ ★★★★★ 阿里云生态/合规
Llama 3.3 ★★★ ★★★★★ ★★★★ ★★★ 私有化/数据敏感

数据每3-6月会变,选型前必须重新评测。维度优先级会因场景变化(同一产品可能有不同选择):

  • 客服机器人:速度>成本>效果
  • 法律合同审查:效果>安全>成本
  • 营销文案生成:效果>速度>成本
  • 海量内容审核:成本>速度>效果
  • 医疗辅助诊断:安全>效果>速度

选错的代价

  • 选太强:每月API账单¥50万,但准确率只比便宜模型高3%
  • 选太弱:准确率不够,用户流失、口碑崩盘
  • 选错类型:用文本模型做图片识别,根本跑不通
  • 选错部署方式:医疗数据用云端API,合规事故

PM核心心法:先问"业务最在乎什么",再倒推"模型怎么选"。

模型服务商分类

  • 自研+直营(第一方官方):API自己卖,如OpenAI、Anthropic、Gemini、DeepSeek等
  • 自研+分销(第一方云市):模型官方训练,通过云厂商货架售卖,如Azure OpenAI、AWS Bedrock、阿里云百炼市场、华为云MaaS、火山方舟
  • 开源+托管(第三方托管):基于LLaMA/ChatGLM/Qwen提供托管或一体机,如新华、浪潮、京东云"言犀"

PM 怎么用 / 何时用

  • 选型评审时,用五维度(效果/成本/速度/安全/可控)做候选模型打分表,避免只看"效果"拍脑袋。
  • 当业务对延迟或单次成本敏感时,先用"速度/成本"两维度划掉不达标的,再在剩下的比效果。
  • 私有化/合规场景,"安全/可控"是一票否决项,优先于效果;选型前先回答"业务最在乎什么",再倒推模型。

相关页面

AIPM课程 Day2POC验证中国AI产业图谱效果评测体系AI工程集成