AI产品评测

一文看懂外网爆火的哑巴模型jev,10个实测案例分享!成本几乎为零...

作者:JackCui0 次浏览 来源:JackCui
一文看懂外网爆火的哑巴模型jev,10个实测案例分享!成本几乎为零...

最近,一个不会说话的大模型在网上火了。 它叫 Jev,不能写文章,不能写代码,也不能和你聊天。 这么一个哑巴模型,发布不到 36 小时就有 14 万开发者冲进去内测。 几天内造出了几百个玩法,恐怖如斯... 为什么这么多人上头?因为 Jev 只做判断,不生成文字。 少了逐字生成答案这一步,它反倒比大语言模型更快,也更便宜。 一次判断只要 70 到 500 毫秒,部分场景比大语言模型快近 200 倍。 输出直接免费,有开发者实测审核 1000 个代码提交只花 7 美分。 连句完整的话都不用说了,这是要掀桌子啊? 听起来有点离谱,让我们来看看 Jev 的实测表现。 一、Jev 实测表现 (1)游戏

最近,一个不会说话的大模型在网上火了。

它叫 Jev,不能写文章,不能写代码,也不能和你聊天。

这么一个哑巴模型,发布不到 36 小时就有 14 万开发者冲进去内测。

几天内造出了几百个玩法,恐怖如斯...

文章配图

为什么这么多人上头?因为 Jev 只做判断,不生成文字。

少了逐字生成答案这一步,它反倒比大语言模型更快,也更便宜。

一次判断只要 70 到 500 毫秒,部分场景比大语言模型快近 200 倍。

输出直接免费,有开发者实测审核 1000 个代码提交只花 7 美分。

文章配图

连句完整的话都不用说了,这是要掀桌子啊?

听起来有点离谱,让我们来看看 Jev 的实测表现。

一、Jev 实测表现

(1)游戏操控

先看下 Jev 在游戏里的表现。

以前我们用大语言模型打游戏,可以明显感觉到它们的反应特别慢。无论是移动还是放技能,都要先写小作文,才能抉择。

Jev 并不需要这一步。

开发者 Max Blade 同时开了 50 局地铁跑酷,让 Jev 实时操控游戏。

Jev 不仅没撞车,而且越跑越快。速度从每秒 25 米一路飙到 48 米,全局无伤通过。

50 局跑完,总共花了不到一美分。

文章配图

还有人让 Jev 自己和自己打《任天堂明星大乱斗》,同时控制场上全部 4 个角色进行战斗。

Jev 打得有来有回的,每个角色都有自己的战术。

没有用到任何视觉模型或截图,纯用代码就能达到这样的效果。

整场比赛消耗了超过 2200 万 token,同样只花了几美分。

文章配图

那如果让 Jev 和大语言模型直接对打呢?

日本开发者 niwacis 让 Jev 和 Claude Haiku 4.5 同时操控俄罗斯方块小游戏,看谁先清掉 20 行。

跑了 10 次统计下来,两者准确率几乎一样,Haiku 甚至还多赢了一次。

但 Jev 通关平均 19 秒,Haiku 要 80 秒,快了 4 倍;费用上 Jev 是 Haiku 的 1/24。

两者的速度对比非常直观....

文章配图

光是打游戏快还不过瘾,还有人想继续推 Jev 的极限,让 Jev 直接实时生成游戏。

开发者 Hugo Duprez 做了个忍者跑酷游戏,试图让 Jev 一边跑一边实时制造关卡。

效果也非常惊艳,忍者落在上一块平台的时候,后方的石块就已经升起来了。

文章配图

(2)金融交易

游戏之外,也有人试图把 Jev 用在金融领域。

开发者 Virat Singh 把 Jev 接进了自己的 AI 对冲基金,用它做交易决策,原来跑几分钟的回测流程现在几秒就出结果。

文章配图

但也不是所有人都这么顺利。

另一位开发者 MoonGotchi 花了一个晚上搭了个全自动交易机器人。

Jev 跑得确实飞快,但它一路飞快地亏掉了 31,680 美元。

文章配图

(3)营销获客

看来 Jev 不太适合当操盘手,但换到批量化的营销获客上,Jev 就顺多了。

开发者 Romàn 把 700 条高意向客户和对应的营销话术扔给 Jev,让它判断每条消息发出去效果怎么样、哪些话术跟客户根本不匹配。

700 条全部跑完,只需要 40 秒,花了 9 美分。

文章配图

(4)日常开发

除了批量跑数据,也有人试图把 Jev 接入日常开发。

一般来说,用 Claude Code 写长代码的时候,上下文一满,系统就要停下来写总结小作文。

开发者 tamaratran 做了个插件,让 Jev 几十毫秒内扫完几千行终端日志,直接清除没用的废话和垃圾。

这样,在跑代码的时候就不会总是被拦住了。

文章配图

仓库链接:

https://github.com/tamaratran/fast-jev-compaction

最狠的还是这个印度阿三 Zachi 做的事。

他写了个数据库插件,让你可以用"说人话"的方式搜数据。

比如你公司有一张员工表,里面有姓名、岗位、地址这些字段,但没有"能不能远程办公"这个字段。以前你就搜不了这个问题。

现在装了这个插件,直接写一句"能远程办公",Jev 会自动把每个员工的信息看一遍,判断谁符合条件。

129 条数据,1 秒扫完,花了不到一分钱。

文章配图

仓库链接:

https://github.com/realZachi/pg-jev

(5)3D场景

除了游戏和开发工具,Jev 在 3D 场景上的表现也挺出人意料的。

开发者 Joao Bortotti 用 Jev 操控一个 3D 角色的脸,让它根据对话内容实时做出反应。

没有任何表情预设,Jev 在接收消息的同时做出 10 个决策,同时控制五官细节,组合成一个自然的表情。

文章配图

这是目前大语言模型做不到的事情,不是因为不够聪明,而是太慢了。

等它把答案写完,对话早就过去了。

而且,大语言模型目前也不支持如此精细的并行控制。

二、Jev 内部原理

看完了这些案例,可能很多人会问:Jev 到底是怎么做到又快又便宜的?

大语言模型像是考试的时候先写满一整页分析,最后才圈答案。

而 Jev 是直接看完题就涂答题卡,中间不写任何过程。

这就是它为什么能做到 70 毫秒响应、输出免费。

因为根本没有“输出”这个过程,它只是在给选项打分。

文章配图

Jev 只会做三种题:

第一种叫 Choice,就是选择题。

第二种叫 Score,就是打分题。你给它几个等级,它告诉你属于哪一档。

第三种叫 Noul,就是判断题。它直接返回一个 0 到 1 之间的概率。

每个答案都附带概率。而且多个问题可以一次性问完,Jev 会同时回答。

Jev 背后的公司 TypeSafe AI 官网上写着一个很抓眼球的宣传语:Zero Hallucinations,零幻觉。

听起来像是解决了大模型最大的顽疾,但实际上并不是你想的那个意思。

意思是你给它三个选项 A、B、C,它绝对不会自己编一个 D 出来。

但是否有可能选错呢?完全有可能。

文章配图

一封技术问题的邮件,Jev 可能判断成销售问题。选项不出错,不代表答案一定对。

另外,Jev 背后有一个新的训练方法叫 RLCD,全称是“面向校准决策的强化学习”。

说人话就是:让模型说自己有 90% 把握的时候,真的有 90% 的概率判断正确。

这事为什么重要?因为现在的大模型经常过度自信。明明只有六七成把握,它张嘴就是“我非常确定”。这种不靠谱的置信度在自动化流程里是致命的。

你根本不知道什么时候该相信它,什么时候你该去人为复核。

文章配图

如果 RLCD 真的能做到概率校准,那以后就可以根据置信度自动分流。

置信度高于 90% 的自动执行,60% 到 90% 的交给更强的模型复核,低于 60% 的直接转人工。这才是真正能上生产环境的自动化。

不过,官方目前还没有公开完整论文,也没有披露模型参数和训练细节。

RLCD 到底是一个全新的训练范式,还是把已有方法重新包装了一下,暂时还没法下定论。

三、怎么用上 Jev

官网链接:

https://typesafe.ai/

文章配图

方式一:在 Claude Code / Codex 里用

  1. 运行npx skills add typesafe-ai/skills --skill typesafe-ai
  2. 去 TypeSafe 官网(typesafe.ai)注册账号,在控制台创建 API Key。
  3. 在 prompt 里说一句"use the TypeSafe skill",Agent 就会自动调用 Jev 来做判断

方式二:通过 OpenRouter 调用

如果不想等 waitlist,可以直接通过 OpenRouter 使用。

去 openrouter.ai 注册拿 key,模型名填~typesafe/jev-latest(注意前面有个波浪号),请求地址是https://openrouter.ai/api/alpha/decisions,不是普通的 chat 接口。

方式三:直接调 TypeSafeAPI

  1. 去 TypeSafe 官网(typesafe.ai)注册账号,在控制台创建 API Key。
  2. 安装 Python SDK:pip install typesafe-sdk
  3. 设置环境变量:export TYPESAFE_API_KEY='你的key'
  4. https://api.typesafe.ai/v1/systemone发 POST 请求就行

四、总结

最后说一个有意思的细节:为什么叫 Jev?

这个名字来自经济学家 William Stanley Jevons。他提出过一个著名的悖论:

蒸汽机效率越高,烧掉的煤反而越多。因为便宜了,大家就往死里用。

TypeSafe 给模型起这个名字,赌的就是同样的事情会发生在 AI 上。

当一次智能判断的成本从几毛钱降到千分之一美分,开发者会把 AI 塞进以前根本不舍得用的地方。

说白了,Jev 不是来抢大模型饭碗的。

大模型负责干活,Jev 负责在旁边花几十毫秒看一眼,判断这活干得行不行。

过去几年我们一直在追求让模型写得更好、说得更像人。

但 Jev 反其道行之。

有些事,也许根本不需要“说得多漂亮”,直接把结论给出来,可能反而更有效。

当然,Jev 目前还在 early access 阶段,社区也有不少人质疑它到底是真创新,还是换了个包装的分类器。

但这个思路本身,倒是值得探索试一试。

文章来自于"JackCui",作者 "JackCui"。

相关主题

读完之后

加入 AINRK 交流群

了解加入交流群的方式,与更多 AI 从业者交流。

查看交流群说明(在新窗口打开)