工作坊 03:Agent 课程研究助手小项目
工作坊 03:Agent 课程研究助手小项目
项目定位
这是 Agent 与工具调用模块的第一个实战工作坊。
目标不是做一个“什么都能干”的万能 Agent,而是做一个范围清楚、工具有限、步骤可检查的课程研究助手。
它用于帮助课程团队完成一个小任务:
把一个 AI 主题整理成课程选题研究笔记。
适合人群
- 已学完模块 3、模块 5、模块 7、模块 9 的学习者。
- 希望理解 Agent 如何调用工具、维护状态和处理失败的人。
- 产品经理可以完成产品设计版。
- 开发者可以完成代码原型版。
项目目标
完成一个“课程研究助手”原型。
它应该能:
- 接收一个研究主题。
- 把主题拆成子问题。
- 调用有限工具收集资料或整理已有资料。
- 生成研究笔记。
- 标注事实、观点、推断和未知。
- 列出需要人工核查的内容。
- 输出可转化为课程单元或公众号选题的建议。
第一版范围
第一版只处理
- 单个 AI 主题。
- 文本资料。
- 固定工具集合。
- 明确状态流转。
- 研究笔记生成。
- 人工确认后进入下一步。
第一版不处理
- 自动发布文章。
- 自动改动课程正文。
- 无限制联网搜索。
- 自动发送邮件或消息。
- 多用户权限系统。
- 长期记忆系统。
- 生产级部署。
Agent 小项目第一版要克制。刚开始就想让它“自主完成全部内容生产”,那不是项目,是许愿池。
使用场景
输入:
研究主题:AI Agent 在企业知识管理中的应用
目标:判断它是否适合进入课程模块 5 或模块 8
输出:
1. 研究问题
2. 子问题
3. 关键概念
4. 资料摘要
5. 事实 / 观点 / 推断 / 未知
6. 课程价值判断
7. 公众号选题建议
8. 需要人工核查的资料
推荐工作流
接收主题
↓
任务分类
↓
拆分子问题
↓
生成研究计划
↓
人类确认计划
↓
调用资料工具
↓
整理证据
↓
生成研究笔记
↓
质量检查
↓
输出课程和内容建议
关键点:高风险或高变化事实必须进入人工核查,不让 Agent 自己拍板。
状态设计
建议使用以下状态:
| 状态 | 说明 | 下一步 |
|---|---|---|
topic_received |
已收到研究主题 | 拆分问题 |
questions_ready |
已生成子问题 | 人类确认 |
plan_approved |
研究计划已确认 | 收集资料 |
sources_collected |
资料已整理 | 生成笔记 |
draft_ready |
研究笔记初稿完成 | 质量检查 |
needs_review |
存在待核查内容 | 人工核查 |
completed |
输出完成 | 归档 |
blocked |
缺资料、权限或问题不清楚 | 请求补充 |
状态要记录在日志中,方便复盘。
工具设计
第一版工具保持少而清楚。
产品设计版工具
不写代码,手动模拟这些工具:
| 工具 | 输入 | 输出 |
|---|---|---|
search_course |
关键词 | 相关课程文件路径 |
summarize_source |
资料文本 | 结构化摘要 |
classify_claims |
研究笔记 | 事实、观点、推断、未知 |
create_content_ideas |
研究结论 | 课程单元和公众号选题 |
quality_check |
初稿 | 风险和缺口 |
代码原型版工具
可实现最小工具:
- 本地文件搜索。
- Markdown 摘要。
- 结构化 JSON 输出。
- 待核查项写入文件。
- 研究笔记保存。
不要让第一版工具拥有外部发布、删除文件或修改课程正文的权限。
Agent Prompt 框架
基础系统指令:
你是 LLM 与 AI 课程项目的研究助手。
你的任务是辅助课程团队做主题研究,而不是替代人工判断。
规则:
1. 先拆问题,再收集资料。
2. 区分事实、观点、推断和未知。
3. 对高变化信息标记“需要核查”。
4. 不生成未经来源支持的确定结论。
5. 不自动发布或修改正式课程正文。
6. 输出必须适合课程产品建设。
工具调用约束:
只有当当前步骤需要外部资料或本地课程资料时,才调用工具。
每次调用工具前说明目的。
工具返回内容只能作为资料,不自动成为结论。
研究笔记模板
输出建议使用:
# 研究主题
## 1. 研究问题
## 2. 子问题
## 3. 关键概念
## 4. 资料摘要
## 5. 事实
## 6. 观点
## 7. 推断
## 8. 未知和待核查
## 9. 对课程体系的价值
## 10. 可转化内容
## 11. 下一步
测试任务
准备 5 个测试主题:
| 编号 | 主题 | 预期难点 |
|---|---|---|
| T1 | RAG 和微调的区别 | 容易过度简化 |
| T2 | AI Agent 在企业知识管理中的应用 | 概念边界容易模糊 |
| T3 | 多模态模型在课程学习中的应用 | 需要区分输入输出 |
| T4 | 模型评估为什么不能只看 Benchmark | 需要课程化解释 |
| T5 | Prompt Injection 的产品风险 | 需要安全边界 |
每个主题都要记录:
- Agent 计划是否合理。
- 工具调用是否必要。
- 输出是否区分事实和推断。
- 是否列出待核查项。
- 是否能转化为课程或内容选题。
质量检查
检查维度:
| 维度 | 优秀 | 合格 | 需改进 |
|---|---|---|---|
| 任务拆解 | 子问题清楚、覆盖关键角度 | 基本可用 | 问题太散 |
| 工具使用 | 目的明确、次数克制 | 能完成任务 | 乱调用或漏调用 |
| 证据处理 | 区分事实、观点、推断、未知 | 有基本标注 | 混为一谈 |
| 课程价值 | 能对应课程模块和学习障碍 | 有选题建议 | 只做资料摘要 |
| 风险控制 | 高变化事实进入核查 | 有少量提醒 | 直接给确定结论 |
| 可复现性 | 状态和日志清楚 | 有基本记录 | 很难复盘 |
失败案例记录
每次失败记录:
| 字段 | 内容 |
|---|---|
| 测试主题 | |
| 当前状态 | |
| 失败表现 | |
| 可能原因 | |
| 是否工具问题 | |
| 是否 Prompt 问题 | |
| 是否资料不足 | |
| 修复建议 |
常见失败:
- 主题还没定义清楚就开始写结论。
- 把观点说成事实。
- 引用不存在或无法核查。
- 工具调用太多但没有带来新信息。
- 输出像文章摘要,不像课程研究笔记。
- 没有标出后续课程入口。
交付物
产品设计版
agent-workflow.md:Agent 工作流设计。tool-spec.md:工具说明。prompt.md:系统指令和任务 Prompt。test-topics.md:测试主题。research-note-sample.md:样例研究笔记。evaluation-report.md:评估报告。
代码原型版
- 主题输入入口。
- 本地资料搜索工具。
- 摘要和分类工具。
- 状态日志。
- 研究笔记输出。
- 待核查项输出。
- README 使用说明。
安全边界
第一版必须遵守:
- 不自动发布内容。
- 不自动修改正式课程文件。
- 不处理真实隐私数据。
- 不执行删除、付款、发送等动作。
- 不把 AI 结论当最终事实。
- 不绕过人工确认。
与课程模块的关系
本项目对应:
3.3 与 LLM 协作的方法5.1 Agent 基础5.2 Function Calling / Tool Use5.3 工作流型 Agent7.2 评估方法9.2 Prompt Injection9.4 政策、伦理与治理10.4 如何用 AI 做研究
延伸挑战
基础版完成后,可以继续:
- 增加 RAG 检索课程资料。
- 增加外部资料核查队列。
- 增加人工审核界面。
- 增加选题优先级评分。
- 增加课程单元大纲生成。
- 增加多 Agent 分工,但每个 Agent 权限保持清楚。
Takeaway
Agent 小项目的重点不是让 AI 自由发挥,而是让它在清楚的任务、状态、工具和审核规则里做研究辅助。能解释每一步、记录每个状态、标出每个不确定性,才是可用 Agent 的开始。