多场景新 SOTA!Ateve Jev 发布:让 AI 更会做选择!

Ateve 团队发布 AI 决策模型 Ateve Jev,首个版本 ateve-jev-v1 支持候选选择、是非判断和等级评分,并上线 TokenDance 平台。

Ateve 团队近日发布 AI 决策模型Ateve Jev,首个版本为ateve-jev-v1。
开发者只需提供当前情况和需要判断的问题,模型便可从给定选项中作出选择、判断条件是否成立,或按指定标准评分,同时返回对应概率。应用可以据此调用工具、推进流程,让 AI 的判断成为软件运行的一部分。
Ateve 致力于让 AI 更好地连接真实世界,通过实时搜索与来源核查,帮助模型和 Agent 获取准确、及时、可追溯的信息。
Ateve Jev 延续这一方向,以“让 AI 更会做选择”为目标,帮助应用根据已有信息作出判断,决定下一步如何行动。
让判断变成行动
以客服处理退款咨询的场景为例,系统需要决定是查询订单、搜索知识库,还是转交人工。Ateve Jev 根据当前信息作出选择,并返回对应概率,供应用执行下一步或决定是否需要复核。它支持候选选择、是非判断和等级评分三类任务,分别对应 Choice、Noul 和 Score 接口。

换个场景,也能做判断
Ateve Jev 的判断能力也适用于内容核查、代码评判和检索排序等通用场景。测评结果显示,该模型在金融客服意图识别(Banking77)和事实一致性判断(VitaminC)任务上的准确率分别达到90.83%
和90.54%,中文、英文场景分类准确率分别达到91.83%和92.97%。

让 AI 在不同场景里做选择
Model Router
修复一个拼写、补充单元测试、排查部署后的登录故障,或迁移整个项目,需要的模型能力并不相同。Ateve Jev 可以根据任务选择合适的模型,减少对高成本模型的不必要调用。

Context Compaction
任务进行得越久,Agent 积累的文件内容、搜索结果和运行日志就越多。Ateve Jev 可以根据当前任务,判断哪些历史工具记录仍然有用、哪些可以缩短或移除,让关键结果留在上下文中,减少后续调用携带的无关内容和 Token 消耗。

Browser Use
以查询苏黎世到伦敦的单程机票为例,Ateve Jev 根据当前页面选择下一步操作:填写出发地和目的地、设置日期,再发起搜索。每次操作后,应用将更新后的页面状态交给模型,继续推进任务,直到显示符合条件的航班和票价。

俄罗斯方块
在 FC 模拟器的俄罗斯方块实测中,Ateve Jev 单局累计消除 316 行。面对不断变化的堆叠,模型选择方块的旋转方式与落点,既争取消行,也为后续方块留出空间,将一次次判断衔接成持续的游戏操作。

备注:俄罗斯方块实测在 Ateve Harness 框架下与 Ateve Jev 配合完成。
超级马里奥
Ateve Jev 在超级马里奥实测中连续通过 1-1 至 1-4 关卡。从跨越平台缺口到躲避旋转火柱和迎面火球,再到越过城堡 Boss,模型根据游戏状态选择移动与跳跃动作,应对连续变化的障碍。

备注:超级马里奥实测在 Ateve Harness 框架下与 Ateve Jev 配合完成。
在 TokenDance 使用 Ateve Jev
Ateve Jev 国内首发上线 TokenDance(词元跳动)平台,模型号为ateve-jev-v1。
开发者可在平台创建 API Key,将模型选择、上下文精简等判断接入自己的应用和 Agent 工作流。
一键直达链接:
https://tokendance.space/models/ateve-jev-v1
在TokenDance 使用ateve-jev-v1,限时免费!!

文章来自于微信公众号 “特工宇宙”,作者 “特工宇宙”
相关主题
读完之后
加入 AINRK 交流群
了解加入交流群的方式,与更多 AI 从业者交流。




