7.1如何选择模型
本课只解决一个主问题:本单元只解决一个主问题:做 AI 产品或工作流时,应该如何选择合适的模型?
学习目标
学完本单元后,学习者应该能够:
- 根据任务类型初步选择模型。
- 理解通用大模型、小模型、代码模型、多模态模型、推理模型的差异。
- 在质量、成本、延迟、隐私和可控性之间做取舍。
- 设计一个简单的模型选型决策流程。
- 避免只看排行榜或宣传图选模型。
先给直觉
选模型像选交通工具。
你要去楼下便利店,不需要开飞机。
你要跨城运输货物,也不该骑共享单车。
模型也是一样:
- 简单分类任务可能不需要最强模型。
- 高风险推理任务不能只看便宜。
- 多模态任务需要能处理图片、音频或视频。
- 本地隐私场景可能需要端侧或私有部署模型。
“最强模型”不等于“最合适模型”。
先定义任务
选模型前,先回答 7 个问题:
- 任务输入是什么?
- 任务输出是什么?
- 质量要求有多高?
- 错误成本有多大?
- 延迟要求多严格?
- 预算和调用量如何?
- 是否涉及隐私、合规或本地部署?
如果这些问题没回答,直接比较模型就是看热闹。
常见模型类型
通用大模型
适合:
- 综合问答
- 写作
- 总结
- 复杂指令
- 多步骤任务
- 原型验证
优点:
- 能力覆盖广。
- 上手快。
- 对复杂任务适应性强。
缺点:
- 成本较高。
- 延迟可能更高。
- 对特定任务未必最划算。
小模型
适合:
- 分类
- 信息抽取
- 简单改写
- 高频低成本任务
- 本地或端侧场景
优点:
- 成本低。
- 延迟低。
- 部署更灵活。
缺点:
- 复杂推理能力有限。
- 泛化能力可能弱。
- 对 Prompt 的容错更低。
代码模型
适合:
- 代码补全
- 代码解释
- Bug 修复
- 测试生成
- 代码库问答
注意:
代码任务不只看模型会不会写代码,还要看它是否理解项目上下文、能否运行测试、能否遵守现有架构。
多模态模型
适合:
- 图片理解
- OCR
- 截图分析
- 图文问答
- 视频摘要
- 语音理解
注意:
多模态任务评估更复杂。看懂图片的一部分,不代表能可靠处理专业视觉任务。
推理模型
适合:
- 多步推理
- 复杂数学
- 代码规划
- 方案分析
- 高价值决策辅助
代价:
- 可能更慢。
- 成本更高。
- 不适合所有高频简单任务。
图:选模型先回答五个问题,缩小候选范围,再结合评测、成本与监控做最终决定。
质量、成本、延迟三角
模型选择常常是三角取舍:
质量
/ \
成本 - 延迟
你通常不能同时要:
- 最高质量
- 最低成本
- 最低延迟
真实项目里要按任务分层。
例如:
- 用户输入意图分类:小模型。
- 普通问答:中等模型。
- 高风险总结:强模型 + RAG + 审核。
- 复杂规划:推理模型。
错误成本决定模型等级
同样是“总结”,风险差别很大。
低风险:
总结一篇公开博客。
中风险:
总结客户反馈,供产品会议参考。
高风险:
总结合同付款义务,供签约前决策。
高风险任务需要:
- 更强模型。
- 可靠资料。
- 引用依据。
- 评估集。
- 人工审核。
不是所有任务都值得用最强模型,但高风险任务不该只按便宜选。
开源与闭源
闭源 API
优点:
- 能力强。
- 接入快。
- 运维少。
- 适合快速验证。
风险:
- 成本受供应商影响。
- 数据合规需要评估。
- 能力和接口可能变化。
- 深度定制受限。
开源模型
优点:
- 可私有部署。
- 可定制。
- 可控性更强。
- 适合特定领域优化。
挑战:
- 部署维护成本。
- 推理优化复杂。
- 评估和安全要自己承担。
- 综合能力未必适合所有任务。
选开源还是闭源,不是价值观测试,而是约束条件不同。
云端、本地与端侧
云端 API
适合:
- 快速原型。
- 能力要求高。
- 团队不想维护模型基础设施。
本地部署
适合:
- 数据敏感。
- 成本可预测。
- 需要深度定制。
- 有工程运维能力。
端侧模型
适合:
- 低延迟。
- 离线使用。
- 隐私敏感。
- 手机、电脑、设备端功能。
模型路由
成熟系统不一定只用一个模型。
可以做模型路由:
- 简单任务走便宜模型。
- 复杂任务走强模型。
- 高风险任务走强模型 + 审核。
- 多模态任务走多模态模型。
- 失败后升级模型。
例子:
意图识别 → 小模型
课程问答 → 中等模型 + RAG
复杂学习规划 → 强模型
高风险事实问题 → 强模型 + 引用 + 人工审核
模型路由能控制成本,但会增加系统复杂度。
评估先于上线
不要只凭主观试用决定模型。
至少准备:
- 代表性问题集。
- 标准答案或评价标准。
- 失败案例。
- 成本和延迟记录。
- 人工评分表。
评估模型时要看自己的任务,不要只看公开 Benchmark。
Benchmark 有价值,但它不是你的业务。
简单决策流程
可以按这个流程选:
- 明确任务类型。
- 标注风险等级。
- 设定质量、成本、延迟目标。
- 确认输入输出模态。
- 确认隐私和部署要求。
- 选择 2-3 个候选模型。
- 用任务评测集测试。
- 记录成本、延迟和失败类型。
- 决定模型或模型路由。
- 上线后持续监控。
案例:课程学习助手选型
任务:
- 回答课程概念问题。
- 根据课程资料引用来源。
- 生成练习题。
- 帮学习者制定学习路径。
可能方案:
| 子任务 | 模型选择 | 原因 |
|---|---|---|
| 课程资料检索 | Embedding 模型 | 做语义检索 |
| 普通课程问答 | 中等或强模型 + RAG | 需要解释清楚并引用 |
| 生成练习题 | 中等模型 | 创作但风险较低 |
| 学习路径规划 | 强模型 | 需要综合判断 |
| 高变化模型信息 | 强模型 + 官方资料检索 + 人工核查 | 避免过时 |
这比所有任务都调用一个最强模型更合理。
常见误区
误区 1:排行榜第一就是最佳选择
公开榜单不等于你的任务表现。
误区 2:最贵模型一定最适合
不一定。简单任务可能浪费成本。
误区 3:开源一定更便宜
部署、显卡、优化、运维和评估都是成本。
误区 4:小模型不值得考虑
小模型在高频、低延迟、低成本、本地场景很有价值。
误区 5:选完模型就结束了
模型能力、价格、接口和业务需求都会变化,需要持续评估。
动手练习
为下面 4 个任务选择模型策略:
| 任务 | 质量要求 | 延迟要求 | 风险 | 你的模型策略 |
|---|---|---|---|---|
| 用户评论情感分类 | 中 | 高 | 低 | |
| 课程问答助手 | 高 | 中 | 中 | |
| 合同风险摘要 | 很高 | 中 | 高 | |
| 广告标题头脑风暴 | 中 | 低 | 低 |
要求说明:
- 为什么选择这个模型等级。
- 是否需要 RAG。
- 是否需要人工审核。
- 是否需要模型路由。
检查题(自测)
- 为什么不能只看排行榜选模型?
- 小模型在哪些场景有价值?
- 什么是模型路由?它解决什么问题,又带来什么复杂度?
参考答案
- 排行榜测的是通用基准,不代表你的任务分布;选型还要权衡质量、成本、延迟、隐私、风险,并在自己的任务上评测。
- 小模型在简单高频任务、低延迟低成本场景、私有部署和数据敏感场景有价值。
- 模型路由按请求特征把任务分派到不同模型(如简单给小型、复杂给大型)。好处是省成本、提体验;复杂度在路由策略的设计与持续评估。
Takeaway
模型选择是产品和工程决策,不是粉丝投票。先看任务、风险、成本、延迟、隐私和评估,再选模型。真正成熟的系统,往往不是一个模型包打天下,而是按任务分配能力。