内容栏目

AI技术文章

分享不同 AI 工具、模型与相关技术的使用方法和实践文章。

世界模型评测的最大盲区,被新基准MemoBench捅破了

世界模型评测的最大盲区,被新基准MemoBench捅破了(在新窗口打开)

来自哈佛大学、MIT、IBM、波士顿大学、谷歌、JHU、CMU 和 Kempner Institute 的研究者提出了一个新的诊断性基准:MemoBench。这是首个面向动态环境的「消失-重现」世界建模评测基准,并已被计算机视觉顶会 ECCV 2026 接收。其一作 Haoyu Chen 为哈佛大学计算科学与工程专业一年级硕士生,师从哈佛大学计算机科学助理教授 Yilun Du。

AI技术文章
0
Router的作用被低估了?vLLM这个神器,让单次调用背后藏了一支模型协作小队

Router的作用被低估了?vLLM这个神器,让单次调用背后藏了一支模型协作小队(在新窗口打开)

vLLM 社区推出的 Semantic Router 除了专注上面三个方向,正在更进一步:我们认为:router 不只是选择模型,还可以提升模型能力。用户不用改权重,也不用让每个 Agent 团队都自己搭一套 Graph,而是在一次普通 Model API 调用的内部,组织出一支有边界、有预算、有验证、有回退的 “小队”。

AI技术文章
0
把Agent丢入1000+文件:人大CoDA-Bench揭示Code Agent瓶颈

把Agent丢入1000+文件:人大CoDA-Bench揭示Code Agent瓶颈(在新窗口打开)

中国人民大学的研究团队提出 CoDA-Bench,联合评估 Agent 的 Code Intelligence + Data Intelligence。该基准首次把 Code Agent 放进包含 1000 + 数据文件的复杂环境下,要求模型先自主探索文件系统、找到相关数据,再编写代码完成分析。实验显示,即使当前表现最好的系统,在 CoDA-Bench 上执行准确率也只有 61.1%;

AI技术文章
0
AI Agent为什么总是不稳定?终于有了一个系统性基准来拆解

AI Agent为什么总是不稳定?终于有了一个系统性基准来拆解(在新窗口打开)

三星大模型团队联合北京大学、香港城市大学、香港科技大学等科研机构,共同发布了面向 AI Agent 的基准测试 LiveClawBench。它关注的并不是「谁的 Agent 更强」,而是一个更基础、也更关键的问题:为什么同一个 AI Agent,在一些任务中已经接近可用,而在另一些任务中却会突然失稳?

AI技术文章
0
ECCV 2026 | 悉尼大学提出Linstereo, 打通立体匹配「最后一公里」

ECCV 2026 | 悉尼大学提出Linstereo, 打通立体匹配「最后一公里」(在新窗口打开)

LinStereo 对应地做了三件事:PALA 换掉 ConvGRU 解决传播问题,HSCV 保留多尺度特征,DPI 用单目深度给一个靠谱的起点。PALA 做的事情说起来很直观,就是把 ConvGRU 的局部更新换成全局注意力,让每个像素每次迭代都能看到整张图。难点在于 softmax attention 是 O (N²) 的,直接用在高分辨率视差图上跑不动。

AI技术文章
0
怎么量化机器人数据价值?ATHENA将影响函数扩展到十亿参数VLA,313×加速筛选高价值数据

怎么量化机器人数据价值?ATHENA将影响函数扩展到十亿参数VLA,313×加速筛选高价值数据(在新窗口打开)

具身智能正在进入数据 scaling 时代。Vision-Language-Action(VLA)模型让机器人可以从大规模示教数据(demonstrations)中学习更通用的操作策略。但对机器人 VLA 训练来说,数据并不总是越多越好:低质量数据可能会拖累模型性能,而每一条 demonstration 都意味着昂贵的人力采集、机器人运行,以及云端存储和训练成本。

AI技术文章
0

参与交流

查看 AINRK 交流群说明

了解加入交流群的方式,阅读内容无需登录。

查看交流群说明(在新窗口打开)