评测与研究
jev-benchmarks
@AbdelStark★ 11PythonApache-2.0更新于 2026-09-17
针对类型化决策模型的概率感知评估,包括校准、选择性风险、延迟和可复现基准测试。
英文原文
Probability-aware evaluation for typed decision models: calibration, selective risk, latency, and reproducible benchmarks.
AbdelStark/jev-benchmarks ↗
这个项目没法在这儿跑
它的 question 组合是运行时拼出来的,或者代码里没有直接写出来,所以没法原样搬过来。源码链接在上面,可以自己去看。
同类的其他项目
- jev-playground ▶ — 这是一个用于通过 MoonBit 访问 TypeSafe AI 的 System One 模型 Jev 的测试平台。
- jev-as-a-judge ▶ — 使用 Jev 作为评估工具。
- eutrya ▶ — Jev 原生 AI 安全工具,支持自主研究、多 agent 群体、持久追踪板和长时 agent 工作流,CLI 优先,开源,适用于授权安全研究。
- typesafe-local ▶ — 受TypeSafe Ai启发,向本地LLM提问,获得校准概率而非文本,输出结构化结果,无需生成或解析,支持MLX和Apple Silicon。
- jev-mcp ▶ — 将 JEV 连接到 MCP 客户端,使用共享数据集和可测量准确率对比其判断与通用 LLM 的表现。
- omp-jev ▶ — TypeSafe Jev 路由,用于 Oh My Pi,支持可选的 checkpoint 编排器和可编辑的 XDG 配置,需 Bun 1.3.14 和 OMP 18.2.3。
- jev-chat ▶ — 基于类型化 Jev 决策的聊天机器人,采用层级推测解码处理 System One 概率。
- jev-browse ▶ — jev-browse 是一个非官方项目,与 TypeSafe 或 Vercel 无关。