内容栏目

AI技术文章

分享不同 AI 工具、模型与相关技术的使用方法和实践文章。

二元成功率已经过时!PRM-as-a-Judge才是你需要的具身操作评测框架

二元成功率已经过时!PRM-as-a-Judge才是你需要的具身操作评测框架(在新窗口打开)

随着机器人操作从短程、单步技能逐步走向长程、富接触、需要持续协调与恢复能力的复杂任务,传统以二元成功率为核心的评测方式开始暴露出明显局限。它能够回答 “任务是否完成”,却难以回答 “策略推进到了哪里”“执行过程是否高效稳定”“失败究竟发生在什么阶段”。

AI技术文章
0
全球第一,13个SOTA!我们找到了龙虾界掌管GUI的神

全球第一,13个SOTA!我们找到了龙虾界掌管GUI的神(在新窗口打开)

有没有想过让「龙虾」替你打麻将? 自从龙虾热以来,大家慢慢接受了 AI 智能体能够在电脑上执行操作的特性。 既然龙虾具备一定的控制能力,那让它替我去挣欢乐豆不过分吧。 遗憾的是,现在的龙虾,称之为「Claw」是有道理的,笨拙的龙虾爪的确很难进行复杂操作。让它打开浏览器逛逛电商平台比价,都要寻找各种对应的 Skills,而且执行的吭哧瘪肚的,这的确让人很难放心地将正经工作流交给龙虾。 时隔半年有余,那个能够直接操作图形界面的,曾经取得双榜 SOTA 的通用 GUI 智能体模型 Mano 再一次产生了飞跃。不仅解决了自动操作工作流的痛点,甚至连「替我打麻将」的梦想都实现了: 这次,明略科技带着自研

AI技术文章
0
挤干大模型高分「水分」!最强模型仅49分,南大傅朝友发布Video-MME-v2

挤干大模型高分「水分」!最强模型仅49分,南大傅朝友发布Video-MME-v2(在新窗口打开)

现有大模型评测分数日趋饱和,但与真实体验差距显著。南京大学傅朝友团队牵头,在 Google Gemini 评测团队邀约下推出视频理解新基准 Video-MME-v2。凭借创新的分层能力体系与组级非线性评分,以及 3300 + 人工时高质量标注,揭示模型与人类的巨大鸿沟(49 vs 90)、传统 Acc 指标虚高、以及 “Thinking” 并非总是增益等现象。

AI技术文章
0

参与交流

查看 AINRK 交流群说明

了解加入交流群的方式,阅读内容无需登录。

查看交流群说明(在新窗口打开)