内容栏目

AI技术文章

分享不同 AI 工具、模型与相关技术的使用方法和实践文章。

ECCV 2026|Google等推出VGGRPO:用4D隐空间奖励实现世界一致的视频生成

ECCV 2026|Google等推出VGGRPO:用4D隐空间奖励实现世界一致的视频生成(在新窗口打开)

最近,来自 Google、哥本哈根大学、牛津大学等机构的研究者提出了 VGGRPO(Visual Geometry GRPO,收录于 ECCV 2026)。这项工作聚焦于一个核心问题:如何在不牺牲预训练模型泛化能力的前提下,高效地提升视频生成的几何一致性,并使其适用于动态场景。其核心思路是,在隐空间(latent space)中利用 4D 几何奖励,进行几何感知的视频后训练。

AI技术文章
0
几亿美金砸出来的硅谷大模型,被一台相机干翻了!

几亿美金砸出来的硅谷大模型,被一台相机干翻了!(在新窗口打开)

数亿美金,竟输给了一台相机? 一边,是硅谷明星机器人初创Physical Intelligence,用数亿美金算力砸出来的明星大模型π0.5。另一边,是一家中国公司,加一台随手能买到的运动相机。 7月15日,银河通用发布WAM-TTT,全球首个面向具身智能大模型的测试时后训练框架。 随框架一起公布的跨环境实测里,双方正式pk,结果令人意外—— 光照一变、物体一换、背景一乱,π0.5的平均成功率直接砍半,而WAM-TTT泛化保持率为76%! 想象机器人进家的第一天:你家的马克杯它没见过,厨房灯也偏暖,台面还比它训练时高5厘米。看起来只是这一点细微的差别,但足以让一台千锤百炼的机器人当场卡壳。 对

AI技术文章
0
全球首个!银河通用新框架仅需人类视频即可部署,特斯拉蚌埠住了

全球首个!银河通用新框架仅需人类视频即可部署,特斯拉蚌埠住了(在新窗口打开)

终于,现学现用的风也是吹到了具身智能。 要说这两年,大模型最重要的变化之一,就是越来越不依赖预训练一锤定音,部分能力开始留到推理时刻再兑现。 OpenAI o1如此,DeepSeek-R1也是如此。模型推理能力提升,靠的是在应用过程中的持续自我提升。 但机器人不一样,它面对的是比文本更复杂的物理世界,任意一次误判都有可能损坏抓取对象。想让机器人像大模型一样在部署时进化,行业内一直没有人做到。 直到今天,这条路线第一次被银河通用走通了。  刚刚,银河通用正式发布全球首个面向具身智能大模型的测试时后训练框架WAM‑TTT(World-Action Model Test-Time Training

AI技术文章
0
让VLA更懂接触,优理奇UniTac让机器人拥有“触觉想象力”

让VLA更懂接触,优理奇UniTac让机器人拥有“触觉想象力”(在新窗口打开)

机器人,也开始拥有“触觉想象力”了。 过去一年,随着具身基础模型的快速发展,机器人已经能完成不少轮廓清晰、位置明确的操作任务。 可一旦涉及柔性物体、易损物体或密集接触,机器人往往就开始力不从“脑”。 △AI生成 无论是捏起一颗葡萄而不将它捏破,还是抓住一只纸杯而不让它变形,视觉只能帮助机器人找到目标,想要完成任务,机器人还需要人类与物体交互时不可或缺的触觉感知。 也正因为如此,现在也有越来越多团队开始将触觉作为建构机器人大脑的重要模态。比如,UniTouch、AnyTouch尝试统一不同传感器的触觉表征,FuSe、Tactile-VLA把触觉送进通用策略与VLA,近期的TacImag则开始探索

AI技术文章
0
为什么说以Xmax X2.0为代表的实时交互视频模型值得重视?

为什么说以Xmax X2.0为代表的实时交互视频模型值得重视?(在新窗口打开)

我们先来看两个画面。 第一个画面: 把手机镜头对准桌上一只手办玩偶,屏幕里,这只塑料小玩偶开始眨眼睛,一下从沉睡的状态醒了过来。 第二个画面: 三位女生在一间普通的办公室面对摄像头随意做动作,右边立马输出了她们实时变成了机械美少女的造型。 机械结构和光影跟着身体实时变化,几乎0延迟。 没错,你可能会说这个不是很简单吗,随便一个AI视频模型都能做到。 但这个东西厉害的地方在于,它是实时的,流式输出的,不需要上传和等待。 这个体验有点意思,今天我们就来盘一盘它—— 这个东西叫Xmax X2.0,一个通用实时交互视频模型,今天0点官方刚刚在X上官宣发布,同步开放API。 一起来看一看它背后那条正在悄

AI技术文章
0

参与交流

查看 AINRK 交流群说明

了解加入交流群的方式,阅读内容无需登录。

查看交流群说明(在新窗口打开)