评测与研究

jev-agent-failure-benchmark

@TokenTrim1PythonApache-2.0更新于 2026-09-17

在 Who&When Pro agent-failure-attribution 基准测试(文本子集)中,对比评测 Jev(Typesafe.ai)与强大 LLM 的性能。

英文原文

Benchmarking Jev (Typesafe.ai) against a strong LLM on the Who&When Pro agent-failure-attribution benchmark (text subset).

TokenTrim/jev-agent-failure-benchmark

它在哪儿调用了 Jev

DEFAULT_ENDPOINT = "https://api.typesafe.ai/v1/systemone"

src/jevbench/backends/jev.py:29

链接指向我们抓取当天的那个 commit,行号是准的。

这个项目没法在这儿跑

它的 question 组合是运行时拼出来的,或者代码里没有直接写出来,所以没法原样搬过来。源码链接在上面,可以自己去看。

同类的其他项目