Indie Hackers · Newest9/5 12:3670 分精选
用户不会攻击内容过滤器,而是逐字协商
Users don't attack your content filter. They negotiate with it, one word at a time.
推荐理由:做AI产品审核的必看:作者用真实数据拆穿“布尔标记”陷阱,指出用户会像二分搜索一样试探过滤器,并给出带状态、分用户阈值的可抄方案。
作者运营一个图像转视频工具,用户上传照片并用一句话描述运动,模型生成动画。最初使用分类器的布尔标记进行内容审核,但一天内就发现误报严重,如“她冲下码头”等正常提示被标记为暴力。日志显示用户并非攻击过滤器,而是通过逐字修改提示词进行“协商”,每次提交更温和的版本,直到通过。作者提出三项改进:1. 过滤器需有状态,记录用户近期拒绝次数,多次拒绝后收紧阈值或直接拒绝;2. 对不同风险用户设置不同阈值,未付费用户比付费用户更严格,因为数据显示免费用户尝试软色情后付费转化率为零;3. 信息有限,未提及第三项改进。