← 回到项目库 评测与研究
jev-decision-bench @OmarMujahid ★ 2 Python MIT 更新于 2026-09-19
一个独立的基准测试,用于评估TypeSafe的Jev模型,该模型不生成文本,而是根据内容和类型化问题列表进行回答。
英文原文 An independent benchmark of TypeSafe's Jev, a model that does not write text. You send it some content and a list of typed questions (yes/no, pick one option, rate on a scale) and
OmarMujahid/jev-decision-bench ↗
它在哪儿调用了 Jev d, wall, srv = post("api.typesafe.ai", "/v1/systemone", os.environ["TYPESAFE_API_KEY"], {"model": "jev-1.13.0", "state": state, "questions": questions})run.py:38
链接指向我们抓取当天的那个 commit,行号是准的。
这个项目没法在这儿跑 它的 question 组合是运行时拼出来的,或者代码里没有直接写出来,所以没法原样搬过来。源码链接在上面,可以自己去看。
同类的其他项目 jev-playground ▶ — 这是一个用于通过 MoonBit 访问 TypeSafe AI 的 System One 模型 Jev 的测试平台。 jev-as-a-judge ▶ — 使用 Jev 作为评估工具。 eutrya ▶ — Jev 原生 AI 安全工具,支持自主研究、多 agent 群体、持久追踪板和长时 agent 工作流,CLI 优先,开源,适用于授权安全研究。 typesafe-local ▶ — 受TypeSafe Ai启发,向本地LLM提问,获得校准概率而非文本,输出结构化结果,无需生成或解析,支持MLX和Apple Silicon。 jev-mcp ▶ — 将 JEV 连接到 MCP 客户端,使用共享数据集和可测量准确率对比其判断与通用 LLM 的表现。 omp-jev ▶ — TypeSafe Jev 路由,用于 Oh My Pi,支持可选的 checkpoint 编排器和可编辑的 XDG 配置,需 Bun 1.3.14 和 OMP 18.2.3。 jev-chat ▶ — 基于类型化 Jev 决策的聊天机器人,采用层级推测解码处理 System One 概率。 jev-browse ▶ — jev-browse 是一个非官方项目,与 TypeSafe 或 Vercel 无关。