跳到主要内容

1 篇博文 含有标签「safety」

查看所有标签

[LLM 8/10] Guardrails:真正的安全护栏不是模型,而是阈值

· 阅读需 25 分钟
Kobkrit Viriyayudhakorn
CEO, iApp Technology

我和团队给客户上线的泰语聊天机器人,遇到的从来不只是彬彬有礼的提问—— 有人来要违法物品的配方,有人变着法子想诱导它去骂别人, 也有那么一天,模型自己把客户的电话号码吐了出来。 这一章我们要在两个方向上都建起防线:拦截危险 prompt 的入站分类器,以及出站的 PII 过滤器。 但本章真正的核心不是模型本身——而是这样一个事实:护栏是一个在成本不对称条件下所做的阈值决策, 而大家最爱拿出来展示的那个"accuracy 94%",其实几乎什么也没说。