LLMStart|持续课程 · 不追玄学
模块 6 · 6.1
入门到进阶55 分钟

6.1多模态模型入门

本课只解决一个主问题:本单元只解决一个主问题:

多模态 AI 到底是什么,它为什么不只是“让模型看图”?

学习目标

学完本单元后,学习者应该能够:

  • 解释什么是多模态模型。
  • 区分文本、图像、音频、视频作为输入和输出的不同场景。
  • 理解多模态模型为什么对真实工作重要。
  • 判断一个产品是否真的需要多模态能力。
  • 识别多模态应用的常见风险和评估难点。

先给直觉

人类工作时,很少只处理纯文字。

我们会看:

  • 截图
  • 表格
  • 图片
  • PDF
  • 白板
  • 视频
  • 语音
  • 手写笔记
  • 网页界面

如果 AI 只能处理文字,它就像一个很聪明但只能听电话的人。你可以描述图片,但描述本身会丢信息,也很费劲。

多模态 AI 的价值是:让模型能直接处理更多类型的信息。

什么是模态

模态可以理解为信息的形式。

常见模态:

  • 文本
  • 图像
  • 音频
  • 视频
  • 表格
  • 代码
  • 传感器数据

多模态模型就是能处理多种模态输入或输出的模型。

例如:

  • 输入图片,输出文字描述。
  • 输入截图和问题,输出操作建议。
  • 输入语音,输出文字和总结。
  • 输入文本,输出图片。
  • 输入视频,输出摘要。

输入多模态与输出多模态

多模态可以从输入和输出两个方向理解。

多模态输入

模型能接收不同类型的输入。

例子:

  • 上传截图问:“这个报错是什么意思?”
  • 上传图表问:“这张图说明了什么趋势?”
  • 上传照片问:“这是什么植物?”
  • 上传音频问:“帮我总结会议重点。”

多模态输出

模型能生成不同类型的输出。

例子:

  • 根据文字生成图片。
  • 根据文本生成语音。
  • 根据脚本生成视频草稿。
  • 根据数据生成图表。

同一个产品可能同时用到多模态输入和多模态输出。

多模态为什么重要

1. 真实上下文不只是文字

很多问题用文字描述很麻烦。

例如:

这个网页右上角那个蓝色按钮旁边弹出的错误提示是什么意思?

不如直接发截图。

2. 降低用户表达成本

用户不用把看到的东西全部描述出来。

截图、照片、录音、视频都可以成为上下文。

3. 支持更自然的工作流

多模态让 AI 更容易进入真实场景:

  • 看合同截图。
  • 看设计稿。
  • 听会议录音。
  • 读手写白板。
  • 分析图表。
  • 总结视频。

4. 增强产品体验

很多产品的关键体验来自“直接把材料丢进去”。

用户不想先整理成完美文本。用户想说:

你看这个,帮我处理一下。

常见多模态能力

OCR

OCR 是从图片中识别文字。

例如:

  • 识别票据。
  • 识别截图文字。
  • 识别扫描 PDF。

OCR 只是多模态能力的一部分。识别出文字不等于理解图片。

图像描述

模型描述图片内容。

例如:

这张图里有一个人站在白板前,白板上画着流程图。

视觉问答

用户围绕图片提问。

例如:

这张图表里哪一项增长最快?

视觉推理

模型需要结合视觉信息做判断。

例如:

这张产品截图中,用户下一步应该点哪里?

图像生成

根据文本或参考图生成图片。

例如:

生成一张解释 RAG 流程的教学插图。

音频理解

处理语音、会议、访谈或环境音。

常见任务:

  • 语音转文字。
  • 会议摘要。
  • 说话人区分。
  • 音频问答。

视频理解

处理视频中的画面、声音和时间结构。

常见任务:

  • 视频摘要。
  • 章节切分。
  • 关键片段定位。
  • 教学视频问答。

多模态不等于万能理解

模型能看图,不代表它总能准确理解图。

常见问题:

  • 看漏细节。
  • 误读图表。
  • OCR 错字。
  • 空间关系判断错误。
  • 对专业图像理解不足。
  • 无法可靠识别非常小的文字。
  • 对视频长时间关系把握不稳。

多模态能力很有用,但不能把“能看”直接等同于“看得准”。

什么时候需要多模态

适合多模态的场景:

  • 用户材料本身是图片、音频或视频。
  • 用文字描述成本太高。
  • 视觉信息对判断很关键。
  • 需要把截图、图表、票据、白板作为上下文。
  • 输出需要图片、语音或视频。

不一定需要多模态的场景:

  • 纯文本问答。
  • 结构化数据查询。
  • 简单分类。
  • 用户输入已经足够清楚。

多模态不是高级装饰。能用文本稳定解决,就不用强行上传一堆素材给模型开盲盒。

产品设计注意点

输入质量

图片是否清晰?

音频是否有噪音?

视频是否太长?

截图是否包含敏感信息?

输入质量直接影响输出质量。

隐私

图片和音频里经常包含隐私:

  • 人脸
  • 地址
  • 手机号
  • 证件
  • 公司内部信息
  • 客户数据

产品要设计脱敏、权限和提醒。

成本与延迟

多模态输入通常更贵、更慢。

视频尤其明显。

输出可检查性

多模态回答要能让用户检查依据。

例如图表分析,可以说明:

  • 它看到了哪些数据。
  • 它的结论来自哪里。
  • 哪些地方不确定。

案例:课程学习中的多模态

在 AI 课程产品里,多模态可以这样用:

截图答疑

学员上传报错截图。

模型识别错误信息,结合课程内容解释原因。

白板理解

学员上传手写流程图。

模型整理成文字结构。

图示生成

根据课程单元生成教学插图需求。

视频摘要

对录课视频生成章节和复习提纲。

语音问答

学员语音提问,系统转成文本并回答。

这些能力都服务学习任务,而不是为了显得产品“很 AI”。

常见误区

误区 1:多模态就是图片生成

不是。多模态包括理解图片、处理音频、分析视频、生成语音等多种能力。

误区 2:OCR 等于图像理解

OCR 只是识别文字。理解图像还包括布局、对象、关系、趋势和上下文。

误区 3:模型能看图,就能看懂专业图

专业图像需要领域知识和评估,不能只看通用表现。

误区 4:多模态一定提升体验

如果输入麻烦、输出不准、延迟很高,体验反而会下降。

误区 5:图片和音频没有隐私风险

恰恰相反,它们常常包含更多隐私细节。

动手练习

选择一个你熟悉的工作场景,判断是否需要多模态。

填写:

问题 你的答案
用户材料是什么模态?
用文字描述是否麻烦?
哪些信息必须从图片/音频/视频中获得?
模型输出如何被验证?
是否涉及隐私?
延迟和成本是否可接受?
如果不用多模态,有没有更简单方案?
检查题(自测)
  1. 多模态模型和纯文本模型的核心区别是什么?
  2. OCR 为什么不等于完整图像理解?
  3. 判断一个产品是否需要多模态时,至少要考虑哪些因素?
参考答案
  1. 多模态模型能同时处理文本、图像、音频、视频等多种输入,并统一理解它们;纯文本模型只能处理文字。
  2. OCR 只负责把图片里的文字提取出来,不理解图像的内容、构图、物体关系和语义。
  3. 至少考虑:任务是否真的需要多模态输入、数据与成本、评估难度、隐私与版权风险、延迟与体验。

Takeaway

多模态 AI 的价值不是炫技,而是把真实世界里的图片、声音、视频和文本一起变成 AI 可以处理的上下文。它能显著降低用户表达成本,但也带来评估、隐私、成本和可靠性问题。