Prompt Injection 深挖

状态:🚧 占位待补齐
一句话定义:攻击者通过用户输入或检索内容 篡改指令层级 ,让模型违背开发者意图(直接 / 间接注入)。

大纲(待补齐)

  1. 直接 vs 间接(RAG/网页/邮件)注入
  2. 典型 payload 与防御失败模式
  3. 分层防御:隔离、权限、输出审核、工具白名单
  4. 与「系统提示保密」的关系(提示不是密钥)

已有相关文档(先读这些)

学习要点(补齐后应能回答)

  • 为什么「忽略之前的指令」仍然有效?
  • RAG 场景最小安全基线是什么?

参考资料(待补充)

-