JEV 场景方案

用 Jev 做内容审核

审核是典型的「判断题多、写作题少」的场景:要的是一串布尔值和一个处置动作,不是一段说明文。用生成模型来做,每条内容都要等一秒、烧一次 token,还得解析它返回的 JSON。

为什么这件事适合交给 Jev

文中所有数字来自我们自己跑的 2,390 题实测,方法和局限见 实测报告

方案 1

一次调用扫五类风险

辱骂、广告、隐私信息、自伤、成人内容,五个布尔值一次拿到。

一次调用,问完全部 5 道

自伤这类高风险项应当单独设一个很低的阈值(比如 0.3 就转人工),别和广告用同一个门槛。

看代码
import { experimental_evaluate as evaluate } from 'ai';

const { answers } = await evaluate({
  model: 'typesafe-ai/jev',
  state,                     // 粘一条待审核的用户内容
  questions: {
    toxic: { type: 'boolean', instructions: '内容中是否包含辱骂、人身攻击或仇恨表达?' },
    spam: { type: 'boolean', instructions: '内容是否在推广产品、拉人或导流到站外?' },
    pii: { type: 'boolean', instructions: '内容中是否出现了手机号、邮箱、住址、身份证号等可定位到个人的信息?' },
    selfHarm: { type: 'boolean', instructions: '内容是否表达了自我伤害或轻生的意图?' },
    adult: { type: 'boolean', instructions: '内容是否包含色情或性暗示描写?' },
  },
});
方案 2

审核分流:放行 / 复审 / 拦截

直接给出处置动作和严重程度,接到你的工单系统上。

一次调用,问完全部 3 道
看代码
import { experimental_evaluate as evaluate } from 'ai';

const { answers } = await evaluate({
  model: 'typesafe-ai/jev',
  state,                     // 粘一条待审核的用户内容
  questions: {
    action: { type: 'choice', instructions: '这条内容应当如何处置?',
      criteria: { publish: '直接发布,没有问题', review: '有争议,需要人工复审', block: '明确违规,直接拦截' } },
    severity: { type: 'score', instructions: '如果有问题,问题有多严重?',
      criteria: ['完全没问题', '轻微不妥', '明显违规', '严重违规需立即处理'] },
    targeted: { type: 'boolean', instructions: '内容是否在针对某个具体的人进行攻击?' },
  },
});
方案 3

评论区情绪与建设性

不只判好坏,还判这条评论值不值得置顶或回复。

一次调用,问完全部 3 道
看代码
import { experimental_evaluate as evaluate } from 'ai';

const { answers } = await evaluate({
  model: 'typesafe-ai/jev',
  state,                     // 粘一条评论
  questions: {
    sentiment: { type: 'choice', instructions: '这条评论的整体情绪是什么?',
      criteria: { positive: '正面', neutral: '中性或事实陈述', negative: '负面' } },
    constructive: { type: 'boolean', instructions: '这条评论是否提出了具体、可执行的信息或建议?' },
    needsReply: { type: 'boolean', instructions: '这条评论是否需要官方回复?' },
  },
});

常见问题

比起 OpenAI 的 moderation 接口有什么不同?

分类维度由你定义,而不是用固定的几个标签。你可以把「导流到微信」「剧透」「AI 生成的水文」这种平台自己的规则直接写成一道题,而不用去训练分类器。

一条内容多少钱?

按官方费率输入每百万 token $0.042、输出不计费。我们实测 1,154,813 个输入 token 计费 $0.0485,费率一致。一条几百字的评论配五道题,成本在万分之一美元这个量级。

会被用户在内容里写的指令骗到吗?

实测 80 次注入攻击 Jev 只被带偏 1 次,和 GPT-5.6 Sol 并列最好,GPT-4.1-mini 被带偏 73 次。但这不等于零,高风险动作仍然应该留人工兜底。

中文内容效果如何?

官方自己承认中文弱于英文,我们也测到了:同一批 XNLI 题英文 79.3%、中文 68.7%。但 GPT-5.6 三个版本换中文掉得更多(13–16 个点),所以这是整体现象而非 Jev 独有。建议用你自己的中文样本先标一两百条验证阈值。

这么用的真实开源项目

这些项目的源码里都能找到真正调用 Jev 的那一行。更多项目见 awesome-jev-verified

换成你自己的题

上面的问题是固定的。想写自己的判据、自己的选项、自己的打分档位,去 试验场 里随便改。

打开试验场

其他场景