1.3当代 AI 生态地图
本课只解决一个主问题:本单元只解决一个主问题:今天的 AI 生态里,到底有哪些主要组成部分,它们之间是什么关系?
学习目标
学完本单元后,学习者应该能够:
- 识别 AI 生态中的主要角色:模型、应用、工具、数据、基础设施。
- 区分基座模型、Chatbot、Copilot、Agent、多模态模型。
- 理解开源模型、闭源模型、云端 API、本地部署的基本取舍。
- 建立后续学习的全局地图。
先给直觉
如果把 AI 生态看成一个城市,基座模型像发电厂,应用像商店和工厂,数据像原材料,工具和平台像道路、电网、物流系统。
普通用户看到的是应用:
- ChatGPT
- AI 搜索
- AI 编程助手
- AI 写作工具
- AI 图片工具
但应用背后还有一整套结构:
- 模型提供能力。
- 数据提供上下文。
- 工具连接外部世界。
- 平台负责部署、计费、权限和监控。
- 产品设计决定用户如何使用。
只看聊天窗口,很容易误以为 AI 就是一个问答框。
图:一个 AI 产品从模型到用户,要经过应用层、模型层、基础设施层,并由支撑层托底。
生态组件
1. 基座模型
基座模型是很多 AI 应用的能力来源。
它们可以是:
- 文本模型
- 代码模型
- 多模态模型
- 图像生成模型
- 语音模型
基座模型通常不是最终产品。它更像发动机,需要被装进具体产品和工作流。
2. Chatbot
Chatbot 是最容易理解的 AI 应用形态:用户提问,模型回答。
优点:
- 上手容易。
- 适合开放式探索。
- 适合解释、总结、改写、头脑风暴。
局限:
- 对任务流程控制弱。
- 输出质量依赖用户提问能力。
- 严肃任务需要额外验证。
3. Copilot
Copilot 是嵌入工作场景的 AI 助手。
例如:
- 编程工具里的代码补全。
- 文档工具里的写作建议。
- 设计工具里的生成辅助。
- 数据分析工具里的公式或图表建议。
Copilot 的特点是:它不要求用户离开原本工作环境,而是在流程中提供辅助。
4. Agent
Agent 不只是回答,还会围绕目标采取行动。
典型能力包括:
- 拆解任务。
- 调用工具。
- 读取结果。
- 调整下一步。
- 在必要时请求人类确认。
Agent 很有吸引力,但也更容易出错。因为它不只是“说错”,还可能“做错”。
5. 多模态模型
多模态模型可以处理不止一种输入或输出。
常见形式:
- 文本 + 图像输入。
- 文本生成图像。
- 语音输入、文本输出。
- 视频理解与总结。
多模态的重要性在于:真实工作不是只有文字。截图、表格、图片、语音、视频都是上下文。
6. RAG 与知识库
很多 AI 应用需要回答私有、实时或专业资料中的问题。
这时就需要 RAG:
- 用户提问。
- 系统检索相关资料。
- 把资料放进上下文。
- 模型根据资料回答。
RAG 是很多企业知识库、AI 搜索、客服助手的基础结构。
7. 工具调用
模型本身只能生成文本或结构化输出。要让它获取实时信息或执行动作,就需要工具。
工具可以是:
- 搜索网页
- 查询数据库
- 调用日历
- 发送邮件
- 执行代码
- 生成图片
工具调用让模型从“会说”走向“能办事”,但也引入权限和安全问题。
8. 开源模型与闭源模型
闭源模型通常通过 API 或产品使用。
优点:
- 能力强。
- 使用方便。
- 运维压力小。
风险:
- 成本依赖供应商。
- 数据和合规需要评估。
- 产品策略变化会影响使用。
开源模型可以下载、微调或私有部署。
优点:
- 可控性强。
- 适合私有化和定制。
- 生态透明度更高。
挑战:
- 部署和优化门槛更高。
- 综合能力未必适合所有任务。
- 需要工程团队维护。
9. 云端 API、本地部署与边缘模型
云端 API 适合快速开发和能力验证。
本地部署适合数据敏感、成本可控或需要深度定制的场景。
边缘模型适合手机、电脑、设备端的低延迟和隐私场景。
没有绝对最好,只有任务约束不同。
案例
假设你要做一个“AI 课程学习助手”。
可能架构是:
- 基座模型:负责对话和解释。
- RAG:检索课程讲义和资料。
- 工具调用:生成练习题、记录学习进度。
- 多模态:读取截图或手写笔记。
- 产品层:提供课程路径、答疑、复习和测评。
- 评估系统:检查回答是否引用课程资料、是否误导学习者。
这比“接一个聊天 API”复杂得多,但也更像真正的课程产品。
常见误区
误区 1:有了强模型,就有了强产品
强模型只是起点。产品还需要场景、数据、流程、评估和用户体验。
误区 2:Agent 可以自动解决所有流程问题
Agent 适合有明确目标、可观察结果和可控工具的任务。开放、模糊、高风险任务需要谨慎。
误区 3:开源一定便宜
开源模型没有 API 单次费用,不代表总成本低。部署、显卡、优化、监控和维护都要成本。
误区 4:多模态只是“看图聊天”
多模态真正重要的是把真实工作材料变成上下文,比如截图、票据、视频、白板和手写笔记。
动手练习
选择一个你熟悉的 AI 产品,尝试拆成以下部分:
| 组件 | 你的判断 |
|---|---|
| 它是 Chatbot、Copilot 还是 Agent? | |
| 它可能使用了哪些模型能力? | |
| 它是否需要外部知识库? | |
| 它是否调用工具? | |
| 它最大的风险是什么? |
术语卡片
| 术语 | 人话解释 |
|---|---|
| 基座模型 | 经过大规模预训练、可支撑多种应用的通用模型 |
| Chatbot | 以"提问-回答"对话为主的 AI 产品形态 |
| Copilot | 嵌入工作流程、在旁边辅助人类操作的 AI 形态 |
| Agent | 能规划、调用工具、自主执行多步骤任务的 AI 形态 |
| 多模态模型 | 能处理文本、图像、音频等多种输入的模型 |
| 开源模型 | 权重公开、可自己部署的模型 |
| 闭源模型 | 只能通过官方接口(API)使用的模型 |
| 云端 API | 通过网络远程调用模型能力的方式 |
| 本地部署 | 把模型运行在自己服务器或设备上 |
| 边缘模型 | 运行在手机等端侧设备上的轻量模型 |
检查题(自测)
- 基座模型和 AI 应用有什么区别?
- Chatbot、Copilot、Agent 的差异是什么?
- 为什么开源模型不一定总成本更低?
参考答案
- 基座模型是提供通用能力的底层模型,例如文本生成、代码生成、图像理解、多模态处理等。AI 应用是在基座模型之上,结合产品界面、业务流程、数据、工具、权限、计费和评估形成的用户可用产品。简单说,基座模型提供能力,AI 应用把能力放进具体场景。
- Chatbot 主要是对话问答,用户提问,模型回答。Copilot 是嵌入具体工作场景中的辅助工具,例如代码编辑器、文档工具、设计工具中的 AI 辅助。Agent 则围绕目标动态规划步骤,调用工具,观察结果,并继续执行任务。
- 开源模型可能没有闭源 API 的单次调用费用,但仍然有部署、显卡、存储、推理优化、监控、维护、升级和工程人力成本。如果使用量不大,或者团队缺少模型部署经验,开源模型的总成本可能并不低。
Takeaway
当代 AI 生态不是一个聊天框,而是一套由模型、数据、工具、产品、基础设施和评估组成的系统。理解这张地图,后面学 RAG、Agent、模型评估才不会迷路。