内容审核:输入输出双向、多层兜底
生成式产品的审核跟 UGC 产品有一个本质区别:内容不是用户发的,是模型生成的,你既要防用户「问出」违规内容(越狱、诱导),又要防模型自己「说出」违规内容(幻觉出来的暴恐细节、政治敏感表述)。所以审核必须是双向的。
实务上是三层结构。第一层输入侧:用户 query 先过敏感词和意图分类模型,明显违规的直接拒答并给标准话术,这层成本极低(毫秒级、每条不到一厘钱),能拦掉大多数明目张胆的攻击。第二层生成侧:靠模型自身的安全对齐(SFT/RLHF 阶段做的拒答训练),这是通用兜底。第三层输出侧:模型产出再过一遍安全分类器,流式场景下要么分段检测、命中即掐断,要么对高风险品类先审后发。三层每层都会漏,叠在一起才能把漏网率压到可接受。上线前还要做一轮对抗测试(red teaming):组织人专门用各种拐弯抹角的方式诱导模型说违禁内容——角色扮演、多语言混杂、拆字谐音,把能挖出来的洞先在内部挖一遍。这层测试没有自动化银弹,靠的是积累的攻击样本库,每次模型或提示词变更后都要回归跑。
拒答话术要产品化,别让模型自由发挥。「根据相关法律法规,我无法回答该问题」比模型自己道歉一长串好,标准化话术既不泄露审核规则细节,也不会二次引发争议。
隐私保护:从架构上开始设计
AI 产品的隐私风险比传统产品多一层:用户会往对话框里塞各种东西——身份证照片、公司合同、病历。设计上几条底线:用户数据默认不用于训练,要用于训练必须单独授权且可随时撤回(ChatGPT 和国产主流产品现在都有「不用于改进模型」的开关);敏感信息做脱敏处理,识别到身份证号、银行卡号这类字段,该打码打码、该拦截提示拦截提示;企业场景的数据隔离要更严格,客户数据不进公共模型、不留存训练,这是很多 B 端合同里的硬性条款。
还有一块容易忽视的:提示词和日志里全是用户明文数据,研发排查问题时随手就能看到用户问了什么。内部也要做权限分级和访问审计,隐私不只是对外承诺,也是对内的流程设计。
未成年人保护:模式要做,认定更要想
法规对未成年人有明确要求,产品上的标配是:青少年模式(使用时长限制、内容分级过滤、禁用消费功能)、年龄识别机制、以及适龄提示。难点在于「怎么知道屏幕前是未成年人」——实名认证太重会挡掉大量正常用户,纯靠自觉勾选等于没有。务实的组合是:注册环节轻量声明 + 行为特征识别(使用时段、内容偏好)做辅助判断 + 家长端的可管控入口。豆包等产品上线过「未成年人模式」,内容侧对学习类正常回答、对情感陪伴、深夜闲聊类做限制,这个分级思路可以参考:未成年人保护不是一刀切断网,是把高风险场景管住。
合规要前置,不能等上线前补
最痛的经验是合规后置:产品做完了送审,被告知算法没备案、内容安全机制不达标,回炉重做三个月。正确的节奏是立项就拉上法务:面向公众的生成式服务要做算法备案和安全评估,预留一到两个月;深度合成类内容(AI 生图、数字人)要加显式标识「AI 生成」,这是法规硬性要求;训练数据来源的合法性(版权、授权)也要早理,近年因为训练语料版权被起诉的案例越来越多。
最后给一句态度:安全合规不是产品的对立面。内容审核拦住的那部分请求,本来也不会产生留存和付费;而把「这个产品用着放心」做出口碑,本身就是竞争力。