评测与研究
jev-mcp
@arunav25★ 5JavaScriptMIT更新于 2026-09-17▶ 可当场跑
将 JEV 连接到 MCP 客户端,使用共享数据集和可测量准确率对比其判断与通用 LLM 的表现。
英文原文
Connect JEV to MCP clients and compare its judgments against general-purpose LLMs using shared datasets and measurable accuracy.
arunav25/jev-mcp ↗
它在哪儿调用了 Jev
export const DEFAULT_BASE_URL = "https://api.typesafe.ai";
src/config.js:6
链接指向我们抓取当天的那个 commit,行号是准的。
它问 Jev 的问题
下面是从这个项目源码里原样取出来的 question 组合。
取自 test/tool.test.js:60
urgent是/否
urgency?
用你自己的内容跑一遍
代码
import { experimental_evaluate as evaluate } from 'ai';
const { answers } = await evaluate({
model: 'typesafe-ai/jev',
state,
questions: {
urgent: { type: 'boolean', instructions: 'urgency?' },
},
});
同类的其他项目
- jev-playground ▶ — 这是一个用于通过 MoonBit 访问 TypeSafe AI 的 System One 模型 Jev 的测试平台。
- jev-as-a-judge ▶ — 使用 Jev 作为评估工具。
- eutrya ▶ — Jev 原生 AI 安全工具,支持自主研究、多 agent 群体、持久追踪板和长时 agent 工作流,CLI 优先,开源,适用于授权安全研究。
- typesafe-local ▶ — 受TypeSafe Ai启发,向本地LLM提问,获得校准概率而非文本,输出结构化结果,无需生成或解析,支持MLX和Apple Silicon。
- omp-jev ▶ — TypeSafe Jev 路由,用于 Oh My Pi,支持可选的 checkpoint 编排器和可编辑的 XDG 配置,需 Bun 1.3.14 和 OMP 18.2.3。
- jev-chat ▶ — 基于类型化 Jev 决策的聊天机器人,采用层级推测解码处理 System One 概率。
- jev-browse ▶ — jev-browse 是一个非官方项目,与 TypeSafe 或 Vercel 无关。
- jev-broadcast-lab ▶ — TypeSafe Jev 的操作实验室,包含棋类竞技场、封闭式展位和仅供复盘的 Stockfish HUD。