模型选型决策表与小型评测集
模块 7 作业:模型选型决策表与小型评测集
背景
对应学习目标:根据任务类型选择模型;设计小型任务评测集;区分人工评测、自动评测和线上监控;估算模型成本、延迟和吞吐压力。
这个作业让你在"排行榜截图"之外,建立自己的选型与评估方法。
任务
- 定义任务:写 3 个具体任务(如"中文客服回复""代码审查建议""论文摘要"),每个任务写明输入、输出、质量要求。
- 做选型表:对每个任务列一张表:
- 候选模型(通用/推理/代码/多模态各至少一个)。
- 权衡维度:质量、成本(Token)、延迟、上下文、隐私、部署方式。
- 初步结论与理由。
- 设计评测集:为其中 1 个任务设计 10 条评测用例(覆盖正常、边界、易错三类),并说明每条测什么。
- 写评估流程:说明你会怎么做人工评估 + 自动评估 + 上线后监控。
交付物
model-selection.md:3 个任务的选型表与结论。eval-set.md:10 条评测用例 + 评估流程。
评分 Rubric
| 维度 | 优秀 | 合格 | 需改进 |
|---|---|---|---|
| 权衡维度 | 质量/成本/延迟/隐私都覆盖 | 主要维度覆盖 | 只看质量 |
| 评测集 | 覆盖三类用例且可执行 | 基本可用 | 随意凑数 |
| 评估流程 | 离线/自动/线上三层都有 | 有基本方案 | 只有"看效果" |
建议用时
120 分钟。