把 AI Demo 装进产品壳子后,工程上要解决六个核心问题:性能 / 成本 / 可靠性 / 安全合规 / 可观测性 / 灰度发布。每个问题都有典型症状、常用解法和关键指标。
总框架与五层架构、监控指标见 AI工程集成。
1. 性能优化:怎么让 AI 更快?
问题:LLM 调用 3-30 秒,用户等不及。
解法:
- 流式输出:边生成边展示,感知延迟下降 70%
- 语义缓存:相似请求命中缓存,直接返回结果
- 并行调用:多个 AI 子任务并发执行
- 模型路由:高峰轻量任务用小模型
- Prompt 压缩:精炼 Prompt,减少 token 处理时间
关键指标:P95 延迟 < 3s、P99 延迟 < 8s、缓存命中率 > 30%、流式完成率 > 90%
2. 成本控制:怎么让 AI 更便宜?
问题:API 成本随用户线性增长,可能烧钱过快。
解法:
- Token 优化:每个用户、每个功能的成本可追踪
- 用户分级:免费用户限频次,付费用户分档位
- 智能降级:高峰期自动切换低成本模型
- Batch API:批处理任务型请求用批量 API,价格低 50%
- Prompt 优化:每减少 100 token,成本降约 5%
关键指标:单次成本 < ¥0.05、月成本增幅 < 15%、缓存节省率 > 80%
3. 可靠性:怎么让 AI 不挂?
问题:API 限流、超时、返回错误码、模型版本变更。
解法:
- 多模型备灾:主用 Claude,备用 GPT、DeepSeek
- 自动重试:10 秒后重试,最多 3 次
- 三层降级保护:用户侧 → 边缘侧 → 全量
- 熔断机制:错误率 > 10% 自动切断新流量
关键指标:可用率 > 99.5%、错误率 < 3%、降级触发率 < 2%、自动恢复率 > 90%
4. 安全合规:怎么让 AI 不出事?
问题:Prompt 注入、幻觉、违规内容、合规风险。
安全防护链路:
用户输入 → 输入过滤(敏感检测/注入防护)→ 调用LLM → 输出过滤(违规/PII)→ 审计日志
解法:
- 输入过滤:敏感信息检测、Prompt 注入拦截
- 输出过滤:AI 内容安全检测、过滤 PII(手机号、身份证)
- 审计日志:全存储满足监管、合规事件可溯源
- 私有化部署:高敏感场景(医疗/金融)使用本地模型
关键指标:违规内容过滤率 > 99%、Prompt 注入拦截率 = 100%、安全事件 = 0、合规日志覆盖率 = 100%
5. 可观测性:怎么知道 AI 在干啥?
问题:模型是黑盒,出问题不知道哪一步坏了。
解法:
- 全链 Trace:从接入到调用 LLM 每步均可见
- Prompt 版本追踪:每次更新即时对应版本
- Token 日志:input/output token、成本全记录
- 实时看板:QPS、错误率、P99 延迟、成本
关键指标:日志覆盖率 = 100%、Trace 完整率 > 95%、告警响应率 > 90%、成本可视延迟 < 10 分钟
6. 灰度发布:怎么让 AI 迭代不翻车?
详见 灰度发布:版本准备 → 1% → 5% → 20% → 50% → 100% 五步法,AI 产品对灰度的依赖比传统产品高 10 倍。
关键指标:回滚成功率 > 95%、AB 实验 p < 0.05、发布时间 < 1 分钟、效果跌水率 < 10%
PM 怎么用 / 何时用
- 出工程问题时,先归类到六问之一(性能/成本/可靠性/安全/可观测/灰度),按对应"典型症状→解法"对症下药。
- 写需求或验收时,直接引用每个问题的关键指标作为量化标准(如 P95<3s、单次成本<¥0.05、注入拦截=100%)。
- 上线前过一遍六问 checklist,确认性能、降级、安全过滤、监控、灰度方案都已落实再发布。
相关页面
→ AI工程集成 → 灰度发布 → 效果评测体系 → 模型选型五维度 → AIPM课程 Day2