LLMStart|持续课程 · 不追玄学
模块 7 · 7.1
进阶级60 分钟

7.1如何选择模型

本课只解决一个主问题:本单元只解决一个主问题:

做 AI 产品或工作流时,应该如何选择合适的模型?

学习目标

学完本单元后,学习者应该能够:

  • 根据任务类型初步选择模型。
  • 理解通用大模型、小模型、代码模型、多模态模型、推理模型的差异。
  • 在质量、成本、延迟、隐私和可控性之间做取舍。
  • 设计一个简单的模型选型决策流程。
  • 避免只看排行榜或宣传图选模型。

先给直觉

选模型像选交通工具。

你要去楼下便利店,不需要开飞机。

你要跨城运输货物,也不该骑共享单车。

模型也是一样:

  • 简单分类任务可能不需要最强模型。
  • 高风险推理任务不能只看便宜。
  • 多模态任务需要能处理图片、音频或视频。
  • 本地隐私场景可能需要端侧或私有部署模型。

“最强模型”不等于“最合适模型”。

先定义任务

选模型前,先回答 7 个问题:

  1. 任务输入是什么?
  2. 任务输出是什么?
  3. 质量要求有多高?
  4. 错误成本有多大?
  5. 延迟要求多严格?
  6. 预算和调用量如何?
  7. 是否涉及隐私、合规或本地部署?

如果这些问题没回答,直接比较模型就是看热闹。

常见模型类型

通用大模型

适合:

  • 综合问答
  • 写作
  • 总结
  • 复杂指令
  • 多步骤任务
  • 原型验证

优点:

  • 能力覆盖广。
  • 上手快。
  • 对复杂任务适应性强。

缺点:

  • 成本较高。
  • 延迟可能更高。
  • 对特定任务未必最划算。

小模型

适合:

  • 分类
  • 信息抽取
  • 简单改写
  • 高频低成本任务
  • 本地或端侧场景

优点:

  • 成本低。
  • 延迟低。
  • 部署更灵活。

缺点:

  • 复杂推理能力有限。
  • 泛化能力可能弱。
  • 对 Prompt 的容错更低。

代码模型

适合:

  • 代码补全
  • 代码解释
  • Bug 修复
  • 测试生成
  • 代码库问答

注意:

代码任务不只看模型会不会写代码,还要看它是否理解项目上下文、能否运行测试、能否遵守现有架构。

多模态模型

适合:

  • 图片理解
  • OCR
  • 截图分析
  • 图文问答
  • 视频摘要
  • 语音理解

注意:

多模态任务评估更复杂。看懂图片的一部分,不代表能可靠处理专业视觉任务。

推理模型

适合:

  • 多步推理
  • 复杂数学
  • 代码规划
  • 方案分析
  • 高价值决策辅助

代价:

  • 可能更慢。
  • 成本更高。
  • 不适合所有高频简单任务。

模型选择决策树:多模态、高风险、低延迟、私有部署、复杂推理五个分支

图:选模型先回答五个问题,缩小候选范围,再结合评测、成本与监控做最终决定。

质量、成本、延迟三角

模型选择常常是三角取舍:

质量
 / \
成本 - 延迟

你通常不能同时要:

  • 最高质量
  • 最低成本
  • 最低延迟

真实项目里要按任务分层。

例如:

  • 用户输入意图分类:小模型。
  • 普通问答:中等模型。
  • 高风险总结:强模型 + RAG + 审核。
  • 复杂规划:推理模型。

错误成本决定模型等级

同样是“总结”,风险差别很大。

低风险:

总结一篇公开博客。

中风险:

总结客户反馈,供产品会议参考。

高风险:

总结合同付款义务,供签约前决策。

高风险任务需要:

  • 更强模型。
  • 可靠资料。
  • 引用依据。
  • 评估集。
  • 人工审核。

不是所有任务都值得用最强模型,但高风险任务不该只按便宜选。

开源与闭源

闭源 API

优点:

  • 能力强。
  • 接入快。
  • 运维少。
  • 适合快速验证。

风险:

  • 成本受供应商影响。
  • 数据合规需要评估。
  • 能力和接口可能变化。
  • 深度定制受限。

开源模型

优点:

  • 可私有部署。
  • 可定制。
  • 可控性更强。
  • 适合特定领域优化。

挑战:

  • 部署维护成本。
  • 推理优化复杂。
  • 评估和安全要自己承担。
  • 综合能力未必适合所有任务。

选开源还是闭源,不是价值观测试,而是约束条件不同。

云端、本地与端侧

云端 API

适合:

  • 快速原型。
  • 能力要求高。
  • 团队不想维护模型基础设施。

本地部署

适合:

  • 数据敏感。
  • 成本可预测。
  • 需要深度定制。
  • 有工程运维能力。

端侧模型

适合:

  • 低延迟。
  • 离线使用。
  • 隐私敏感。
  • 手机、电脑、设备端功能。

模型路由

成熟系统不一定只用一个模型。

可以做模型路由:

  • 简单任务走便宜模型。
  • 复杂任务走强模型。
  • 高风险任务走强模型 + 审核。
  • 多模态任务走多模态模型。
  • 失败后升级模型。

例子:

意图识别 → 小模型
课程问答 → 中等模型 + RAG
复杂学习规划 → 强模型
高风险事实问题 → 强模型 + 引用 + 人工审核

模型路由能控制成本,但会增加系统复杂度。

评估先于上线

不要只凭主观试用决定模型。

至少准备:

  • 代表性问题集。
  • 标准答案或评价标准。
  • 失败案例。
  • 成本和延迟记录。
  • 人工评分表。

评估模型时要看自己的任务,不要只看公开 Benchmark。

Benchmark 有价值,但它不是你的业务。

简单决策流程

可以按这个流程选:

  1. 明确任务类型。
  2. 标注风险等级。
  3. 设定质量、成本、延迟目标。
  4. 确认输入输出模态。
  5. 确认隐私和部署要求。
  6. 选择 2-3 个候选模型。
  7. 用任务评测集测试。
  8. 记录成本、延迟和失败类型。
  9. 决定模型或模型路由。
  10. 上线后持续监控。

案例:课程学习助手选型

任务:

  • 回答课程概念问题。
  • 根据课程资料引用来源。
  • 生成练习题。
  • 帮学习者制定学习路径。

可能方案:

子任务 模型选择 原因
课程资料检索 Embedding 模型 做语义检索
普通课程问答 中等或强模型 + RAG 需要解释清楚并引用
生成练习题 中等模型 创作但风险较低
学习路径规划 强模型 需要综合判断
高变化模型信息 强模型 + 官方资料检索 + 人工核查 避免过时

这比所有任务都调用一个最强模型更合理。

常见误区

误区 1:排行榜第一就是最佳选择

公开榜单不等于你的任务表现。

误区 2:最贵模型一定最适合

不一定。简单任务可能浪费成本。

误区 3:开源一定更便宜

部署、显卡、优化、运维和评估都是成本。

误区 4:小模型不值得考虑

小模型在高频、低延迟、低成本、本地场景很有价值。

误区 5:选完模型就结束了

模型能力、价格、接口和业务需求都会变化,需要持续评估。

动手练习

为下面 4 个任务选择模型策略:

任务 质量要求 延迟要求 风险 你的模型策略
用户评论情感分类
课程问答助手
合同风险摘要 很高
广告标题头脑风暴

要求说明:

  • 为什么选择这个模型等级。
  • 是否需要 RAG。
  • 是否需要人工审核。
  • 是否需要模型路由。
检查题(自测)
  1. 为什么不能只看排行榜选模型?
  2. 小模型在哪些场景有价值?
  3. 什么是模型路由?它解决什么问题,又带来什么复杂度?
参考答案
  1. 排行榜测的是通用基准,不代表你的任务分布;选型还要权衡质量、成本、延迟、隐私、风险,并在自己的任务上评测。
  2. 小模型在简单高频任务、低延迟低成本场景、私有部署和数据敏感场景有价值。
  3. 模型路由按请求特征把任务分派到不同模型(如简单给小型、复杂给大型)。好处是省成本、提体验;复杂度在路由策略的设计与持续评估。

Takeaway

模型选择是产品和工程决策,不是粉丝投票。先看任务、风险、成本、延迟、隐私和评估,再选模型。真正成熟的系统,往往不是一个模型包打天下,而是按任务分配能力。