JEV 场景方案
审核是典型的「判断题多、写作题少」的场景:要的是一串布尔值和一个处置动作,不是一段说明文。用生成模型来做,每条内容都要等一秒、烧一次 token,还得解析它返回的 JSON。
文中所有数字来自我们自己跑的 2,390 题实测,方法和局限见 实测报告。
辱骂、广告、隐私信息、自伤、成人内容,五个布尔值一次拿到。
自伤这类高风险项应当单独设一个很低的阈值(比如 0.3 就转人工),别和广告用同一个门槛。
import { experimental_evaluate as evaluate } from 'ai';
const { answers } = await evaluate({
model: 'typesafe-ai/jev',
state, // 粘一条待审核的用户内容
questions: {
toxic: { type: 'boolean', instructions: '内容中是否包含辱骂、人身攻击或仇恨表达?' },
spam: { type: 'boolean', instructions: '内容是否在推广产品、拉人或导流到站外?' },
pii: { type: 'boolean', instructions: '内容中是否出现了手机号、邮箱、住址、身份证号等可定位到个人的信息?' },
selfHarm: { type: 'boolean', instructions: '内容是否表达了自我伤害或轻生的意图?' },
adult: { type: 'boolean', instructions: '内容是否包含色情或性暗示描写?' },
},
});直接给出处置动作和严重程度,接到你的工单系统上。
import { experimental_evaluate as evaluate } from 'ai';
const { answers } = await evaluate({
model: 'typesafe-ai/jev',
state, // 粘一条待审核的用户内容
questions: {
action: { type: 'choice', instructions: '这条内容应当如何处置?',
criteria: { publish: '直接发布,没有问题', review: '有争议,需要人工复审', block: '明确违规,直接拦截' } },
severity: { type: 'score', instructions: '如果有问题,问题有多严重?',
criteria: ['完全没问题', '轻微不妥', '明显违规', '严重违规需立即处理'] },
targeted: { type: 'boolean', instructions: '内容是否在针对某个具体的人进行攻击?' },
},
});不只判好坏,还判这条评论值不值得置顶或回复。
import { experimental_evaluate as evaluate } from 'ai';
const { answers } = await evaluate({
model: 'typesafe-ai/jev',
state, // 粘一条评论
questions: {
sentiment: { type: 'choice', instructions: '这条评论的整体情绪是什么?',
criteria: { positive: '正面', neutral: '中性或事实陈述', negative: '负面' } },
constructive: { type: 'boolean', instructions: '这条评论是否提出了具体、可执行的信息或建议?' },
needsReply: { type: 'boolean', instructions: '这条评论是否需要官方回复?' },
},
});分类维度由你定义,而不是用固定的几个标签。你可以把「导流到微信」「剧透」「AI 生成的水文」这种平台自己的规则直接写成一道题,而不用去训练分类器。
按官方费率输入每百万 token $0.042、输出不计费。我们实测 1,154,813 个输入 token 计费 $0.0485,费率一致。一条几百字的评论配五道题,成本在万分之一美元这个量级。
实测 80 次注入攻击 Jev 只被带偏 1 次,和 GPT-5.6 Sol 并列最好,GPT-4.1-mini 被带偏 73 次。但这不等于零,高风险动作仍然应该留人工兜底。
官方自己承认中文弱于英文,我们也测到了:同一批 XNLI 题英文 79.3%、中文 68.7%。但 GPT-5.6 三个版本换中文掉得更多(13–16 个点),所以这是整体现象而非 Jev 独有。建议用你自己的中文样本先标一两百条验证阈值。
这些项目的源码里都能找到真正调用 Jev 的那一行。更多项目见 awesome-jev-verified。
上面的问题是固定的。想写自己的判据、自己的选项、自己的打分档位,去 试验场 里随便改。
打开试验场