JEV 场景方案
分类、审核、评判、路由、闸门——这些活儿的输出是一个枚举值加一个概率,不是一段话。下面 5 个场景、15 套现成的问题组合,每一套都能在页面上用你自己的文本当场跑一次。
我们用 2,390 道有标准答案的题,把 Jev 和 GPT-4.1-mini 以及 GPT-5.6 Sol / Terra / Luna 放在一起测过。是/否判断准确率 92.5%,和最新的推理模型打平;中位延迟 456ms 对 1.3–1.7 秒;跑完同一批题 $0.049 对 $4.27。代价是多选题低约 5 个点,计数类任务明显不行。
完整数据、逐条核对官方宣传、以及这次测试的局限,都在 实测报告 里。