模型周围的 Harness

一条可以继续验证的思路

Prompt 安全

这里有 8 篇文章,从一个词走向真实工作里的选择;先读懂,再决定要不要使用。

阅读线程开放
8篇札记
阅读方式先找到你卡住的地方,再顺着证据和取舍走

每篇可以独立阅读,也可以沿着这条线程继续。

模型周围的 Harness无需登录

本页解决的问题

先给结论

什么是「Prompt 安全」,它会影响哪些 AI 决策?

SQL 注入类比 → Message List 本质 → 缺乏参数化 → 5 大攻击类型概览 本页把相关概念、常见误区和实践文章放在同一条阅读线程里。

判断标准

先判断你卡在定义、选择还是验证,再从下方 8 篇文章中选择最接近的一篇。

下一步

从「Prompt Injection:为什么会被攻击」开始,读完后用自己的任务复述结论。

常见误区

不要把同一主题下的所有方法当成可互换方案;输入、风险和验收标准变化时,答案也会变化。

这条问题线程

把一个词放回它真正影响的选择里。

8 篇札记
安全

Prompt Injection:为什么会被攻击

SQL 注入类比 → Message List 本质 → 缺乏参数化 → 5 大攻击类型概览

模型周围的 Harness 3 min →
安全

Prompt Injection:12 个攻击案例

越权指令 / 角色扮演 / Few-Shot / 结构注入 / 隐喻伪装,中招版 vs 防御版

模型周围的 Harness 3 min →
实战

Prompt 防御:三层拦截实战

输入层正则 → 提示词层约束 → 输出层泄漏检测 → 二次审核,可模拟攻击全链路

模型周围的 Harness 3 min →
安全

AI 安全红线:四条底线

不能做的事、做了会怎样,产品经理必须守住的四类安全边界

模型周围的 Harness 3 min →
安全

风险分级与责任:谁来管、怎么管

AI 输出的风险分级模型,各角色的责任分工与治理框架

模型周围的 Harness 3 min →
概念

AI 该有多大的自由

完全自主 vs 每步审批,五种权限模式和适用场景

从能跑的 Demo 到能用的产品 3 min →
实战

弹窗太多用户烦,不弹又不安全

Human-in-the-loop 的平衡点:风险分级思路

从能跑的 Demo 到能用的产品 3 min →
架构

Agent 干了什么你知道吗

事件流与 Token 追踪。不看日志你永远不知道出了什么错

从能跑的 Demo 到能用的产品 3 min →