正在加载模式…
宪章分类器(CC)
轻量级的输入和输出分类器,在由一部自然语言宪章生成的合成数据上训练,该宪章定义了允许和屏蔽的内容。它们以级联方式部署,廉价的筛查覆盖所有流量,可疑情形则升级处理;输出分类器能够在违规token出现的瞬间中止流式生成。这与 Constitutional AI 不同:Constitutional AI 在训练阶段对齐模型,而宪章分类器是从宪章训练而来、在运行时起作用的防护。
30秒速览
- 是什么
- 用自然语言宪章生成的合成数据训练轻量分类器,在推理前筛查输入,并在出现第一个违规 token 时立即中止输出。
- 何时使用
- 适用于需要运行时内容过滤的大流量系统,前提是宪章规则清晰,且攻击模式可以合成出来用于训练。
- 注意
- 基于合成数据训练的分类器,可能会漏掉宪章生成示例中未涵盖的新型混淆手法或对抗性措辞。
向AI专家咨询此模式
打开助手并预填您的问题,发送前可先确认。
宪章分类器: 概览
轻量级的输入和输出分类器,在由一部自然语言宪章生成的合成数据上训练,该宪章定义了允许和屏蔽的内容。它们以级联方式部署,廉价的筛查覆盖所有流量,可疑情形则升级处理;输出分类器能够在违规token出现的瞬间中止流式生成。这与 Constitutional AI 不同:Constitutional AI 在训练阶段对齐模型,而宪章分类器是从宪章训练而来、在运行时起作用的防护。
- Constitution in natural language defines allowed vs blocked content
- Synthetic training data generated from the constitution
- Input classifier screens prompts before the model runs
- Streaming output classifier halts generation at first violating token
- Cascaded cheap-to-expensive screening controls cost
- Constitution can be updated as new attack classes emerge
The Agent Architect
每周一个模式、一个权衡、一个生产事故案例。为构建智能体系统的人准备的每周简报。
每周一封邮件,一键退订。您的地址仅用于发送简报。
参考资料
该模式所依据的论文、规范和代码仓库。
由本目录背后的工程师执行
对你的智能体系统做红队测试
这里写的防护,只有真的有人去攻破才算数。我们用真实攻击者的方式测试你的系统:提示注入、越狱、工具滥用与数据外泄,每一条结论都附上修复方案。
€750(原价 €1,500),一周交付,书面报告加讲解通话,9月30日前