← 回到项目库 评测与研究
jev-ood-calibration @scienthoon ★ 2 Python MIT 更新于 2026-09-19
对TypeSafe的Jev在未见过任务上的独立校准测试,包括900条规则生成的支持工单和3个公开基准,提供原始响应、带噪声基线的ECE、温度重拟合及类型误校准符号,成本约0.06美元。
英文原文 Independent calibration test of TypeSafe's Jev on a task it cannot have seen: 900 rule-generated support tickets (choice / score / boolean) plus 3 public benchmarks via Vercel AI Gateway. Raw responses, ECE with noise floor, temperature refit, per-type sign of miscalibration. Reproducible for ~$0.06.
scienthoon/jev-ood-calibration ↗
它在哪儿调用了 Jev import { experimental_evaluate as evaluate } from 'ai';scripts/jev_eval.mjs:21
链接指向我们抓取当天的那个 commit,行号是准的。
这个项目没法在这儿跑 它的 question 组合是运行时拼出来的,或者代码里没有直接写出来,所以没法原样搬过来。源码链接在上面,可以自己去看。
同类的其他项目 jev-playground ▶ — 这是一个用于通过 MoonBit 访问 TypeSafe AI 的 System One 模型 Jev 的测试平台。 jev-as-a-judge ▶ — 使用 Jev 作为评估工具。 eutrya ▶ — Jev 原生 AI 安全工具,支持自主研究、多 agent 群体、持久追踪板和长时 agent 工作流,CLI 优先,开源,适用于授权安全研究。 typesafe-local ▶ — 受TypeSafe Ai启发,向本地LLM提问,获得校准概率而非文本,输出结构化结果,无需生成或解析,支持MLX和Apple Silicon。 jev-mcp ▶ — 将 JEV 连接到 MCP 客户端,使用共享数据集和可测量准确率对比其判断与通用 LLM 的表现。 omp-jev ▶ — TypeSafe Jev 路由,用于 Oh My Pi,支持可选的 checkpoint 编排器和可编辑的 XDG 配置,需 Bun 1.3.14 和 OMP 18.2.3。 jev-chat ▶ — 基于类型化 Jev 决策的聊天机器人,采用层级推测解码处理 System One 概率。 jev-browse ▶ — jev-browse 是一个非官方项目,与 TypeSafe 或 Vercel 无关。