LLMStart|持续课程 · 不追玄学
模块作业模块 9

为 AI 应用设计安全边界

模块 9 作业:为 AI 应用设计安全边界

背景

对应学习目标:理解幻觉的原因和缓解方法;解释 Prompt Injection 的基本原理;识别敏感数据、权限和隐私风险;为 AI 应用设计基础安全边界。

这个作业让你把"安全"从口号变成一张可执行的设计。

任务

  1. 选应用:挑一个 AI 应用场景(客服机器人、写作助手、知识库问答、代码助手任选)。
  2. 风险识别:针对三类风险各写 2 个该场景下的具体表现:
    • 幻觉:哪里可能一本正经地编。
    • 注入:哪里可能被用户指令劫持。
    • 隐私/权限:哪些数据不该被模型看到。
  3. 设计防护:为每个风险写一条可落地的防护措施(输入过滤、输出校验、权限隔离、人工审核、日志审计),并说明取舍(防护和体验的代价)。
  4. 写分级表:给应用的功能按风险分级(低/中/高),每级写明需要的审查强度。

交付物

  • safety-boundary.md:风险识别、防护设计、风险分级表。

评分 Rubric

维度 优秀 合格 需改进
风险具体 三类风险各 2 个具体场景 主要风险覆盖 抽象
防护落地 每项防护可执行且有取舍 有防护思路
风险分级 分级清楚、审查强度匹配 有分级 一刀切

建议用时

90 分钟。