LLMStart|持续课程 · 不追玄学
模块 6 · 6.3
进阶级65 分钟

6.3音频与视频

本课只解决一个主问题:本单元只解决一个主问题:

AI 如何处理音频和视频,它能帮我们做什么,又有哪些边界?

学习目标

学完本单元后,学习者应该能够:

  • 区分语音识别、语音合成、音频理解和视频理解。
  • 理解音频和视频任务为什么比文本更复杂。
  • 判断会议、课程、播客、短视频等场景适合哪些 AI 能力。
  • 识别音视频 AI 的隐私、版权、准确性和成本风险。
  • 为课程产品设计音视频辅助学习功能。

先给直觉

音频和视频比文本更接近真实世界,也更麻烦。

一段会议录音里有:

  • 谁在说话。
  • 说了什么。
  • 语气如何。
  • 哪些是决定。
  • 哪些是闲聊。
  • 哪些地方听不清。

一段视频里还有:

  • 画面。
  • 字幕。
  • 动作。
  • 场景变化。
  • 时间顺序。
  • 声音和画面的对应关系。

所以音视频 AI 不只是“把声音转文字”。

语音识别

语音识别是把语音转成文字。

常见场景:

  • 会议转写。
  • 课堂录音转文字。
  • 播客字幕。
  • 语音输入。
  • 客服通话记录。

语音识别的关键问题:

  • 口音。
  • 背景噪音。
  • 多人说话。
  • 专业术语。
  • 中英混杂。
  • 断句和标点。

转写结果不是最终知识,只是后续处理的原材料。

说话人区分

会议和访谈里,知道谁说了什么很重要。

说话人区分要解决:

  • 有几个人在说话。
  • 每句话是谁说的。
  • 说话人是否重复出现。

难点:

  • 多人重叠说话。
  • 声音相似。
  • 录音质量差。
  • 说话人中途加入。

如果说话人识别错,会议纪要就可能把责任分错。

语音合成

语音合成是把文本变成声音。

常见场景:

  • 课程旁白。
  • 听书。
  • 语音助手。
  • 客服播报。
  • 多语言配音。

关注点:

  • 自然度。
  • 情绪。
  • 语速。
  • 停顿。
  • 多语言发音。
  • 是否需要授权声音。

不要随意克隆真实人物声音。声音也是身份特征。

音频理解

音频理解不只是转写。

它可能包括:

  • 总结会议。
  • 提取行动项。
  • 判断情绪。
  • 识别关键词。
  • 标注章节。
  • 找出争议点。

例子:

请从这段会议录音中提取:
1. 已决定事项
2. 待办事项
3. 风险点
4. 需要会后确认的问题

音频理解通常依赖转写结果,但也可能结合语音特征。

视频理解

视频比音频更复杂,因为它包含时间序列的画面和声音。

常见任务:

  • 视频摘要。
  • 自动章节。
  • 关键片段定位。
  • 课程视频生成笔记。
  • 操作演示理解。
  • 视频问答。

例子:

请总结这节课程视频的主要概念,并标出每个概念出现的大致时间。

视频理解的关键是时间结构。

视频摘要

好的视频摘要不只是把字幕压缩。

它应该考虑:

  • 讲了哪些主题。
  • 主题之间如何转场。
  • 哪些画面是关键证据。
  • 哪些只是口头过渡。
  • 哪些内容适合做章节标题。

课程视频摘要尤其要服务复习。

多模态检索

音视频内容也可以进入知识库。

处理方式:

  1. 提取音频转写。
  2. 抽取关键帧。
  3. 生成章节。
  4. 建立文本和时间戳索引。
  5. 支持用户按问题检索片段。

例子:

用户问:

课程里什么时候讲了 RAG 和微调的区别?

系统可以返回:

  • 视频章节。
  • 时间戳。
  • 转写片段。
  • 相关讲义。

音视频的评估难点

转写准确性

文字是否听对。

说话人准确性

谁说的话是否标对。

摘要完整性

是否漏掉关键决定或概念。

时间戳准确性

定位是否正确。

多模态一致性

字幕、画面和总结是否一致。

隐私和授权

是否包含未经授权的声音、脸、会议内容。

成本与延迟

音视频通常比文本更贵、更慢。

影响因素:

  • 时长。
  • 文件大小。
  • 是否需要说话人区分。
  • 是否需要视频关键帧分析。
  • 是否需要多语言翻译。
  • 是否需要高精度转写。

长视频处理适合异步任务,不适合同步等待。

课程产品中的音视频 AI

录课转写

把课程视频转成文字稿。

自动章节

根据讲解内容生成章节。

复习提纲

从课程视频生成复习笔记。

问答定位

用户问问题,系统返回视频时间点。

多语言字幕

生成翻译字幕。

语音提问

学员用语音提问,系统转写后回答。

隐私与版权

音视频经常涉及:

  • 人脸。
  • 声纹。
  • 会议内容。
  • 学员提问。
  • 讲师肖像。
  • 第三方素材。

需要明确:

  • 是否获得录制和处理授权。
  • 是否保存原始音视频。
  • 谁能访问转写文本。
  • 是否允许生成衍生内容。
  • 是否需要删除机制。

案例:课程视频助手

目标:

让学员快速复习课程视频。

工作流:

  1. 上传课程视频。
  2. 提取音频。
  3. 生成转写。
  4. 生成章节。
  5. 生成复习提纲。
  6. 建立时间戳索引。
  7. 支持按问题检索视频片段。

评估:

  • 转写是否准确。
  • 章节是否合理。
  • 时间戳是否可用。
  • 摘要是否漏掉关键概念。

常见误区

误区 1:音频 AI 就是语音转文字

转写只是入口,理解、总结、检索和行动项提取才是应用。

误区 2:视频摘要就是总结字幕

视频有画面和时间结构,不能只看字幕。

误区 3:转写出来就一定可靠

口音、噪音、术语都会影响准确性。

误区 4:语音合成没有授权问题

声音也可能涉及身份和授权。

误区 5:长视频适合同步处理

长音视频通常应该异步处理,并给用户进度反馈。

动手练习

为一个“课程视频复习助手”设计方案。

填写:

项目 内容
输入文件
需要哪些处理步骤
是否需要说话人区分
是否需要章节
是否需要时间戳检索
隐私和授权风险
如何评估质量
失败时如何提示用户
检查题(自测)
  1. 语音识别和音频理解有什么区别?
  2. 视频摘要为什么不能只依赖字幕?
  3. 音视频 AI 产品为什么要特别关注授权和隐私?
参考答案
  1. 语音识别只把语音转成文字;音频理解还包括语气、情绪、说话人、环境声等更丰富的信息。
  2. 字幕丢失了大量画面信息:动作、图表、演示、表情、非语言内容,只看字幕的摘要会漏掉关键信息。
  3. 音视频涉及人脸、声音、肖像权,数据存储和处理也更容易触碰隐私红线,需要授权和合规设计。

Takeaway

音频和视频 AI 的价值在于把真实交流和课程内容转成可检索、可复习、可行动的知识。但音视频任务同时带来更高的成本、隐私、授权和评估难度。