内容栏目

AI技术文章

分享不同 AI 工具、模型与相关技术的使用方法和实践文章。

蚂蚁具身智能明牌了:做大脑,和宇树们错位竞争

蚂蚁具身智能明牌了:做大脑,和宇树们错位竞争(在新窗口打开)

从3000小时到整整20000小时。 真实世界数据里的Scaling Law,直接喂出了个最强VLA(Vision-Language-Action)基座模型! 这就是蚂蚁灵波今天开源的具身智能基座模型——LingBot-VLA。 为什么说它是目前最强?先看数据。 从“20000小时”这个量上来看,LingBot-VLA已经解锁了迄今为止开源的最大规模真实机器人数据之一。 并且性能也是够打,在权威评测中也全面超越了此前公认最强Physical Intelligence的π0.5,以及英伟达GR00T N1.6等一众国际顶尖模型。 再看实际表现。 此前具身智能圈子一个很头疼的问题,就是一旦环境发生

AI技术文章
0
曾在一线手搓材料,如今他要为每家企业配一位AI CTO | 专访律动造物谢童

曾在一线手搓材料,如今他要为每家企业配一位AI CTO | 专访律动造物谢童(在新窗口打开)

在 AI 浪潮席卷全球的今天,大模型在写诗、作画、敲代码上已经展现出惊人的天赋。然而,在面对严谨、硬核的物质科学(物理、化学、材料)时,却常常表现得像个“偏科生”:它们能侃侃而谈化学理论,却在最基础的分子式、晶体结构书写和反应推理上频繁出现不稳定输出:说的像那么回事,写出来却漏洞百出。

AI技术文章
0
大模型哪里出问题、怎么修,这篇可解释性综述一次讲清

大模型哪里出问题、怎么修,这篇可解释性综述一次讲清(在新窗口打开)

过去几年,机制可解释性(Mechanistic Interpretability)让研究者得以在 Transformer 这一 “黑盒” 里追踪信息如何流动、表征如何形成:从单个神经元到注意力头,再到跨层电路。但在很多场景里,研究者真正关心的不只是 “模型为什么这么答”,还包括 “能不能更稳、更准、更省,更安全”。

AI技术文章
0
机器人看不清,蚂蚁给治好了

机器人看不清,蚂蚁给治好了(在新窗口打开)

天下苦机器人看不清透明和反光物体久矣。 毕竟就连小动物甚至人,有时候一个不小心,都会搞笑地撞到干净的玻璃门…… 不仅如此,若是让机器人拿起透明的玻璃杯、反光的不锈钢物体,他们也会经常出现“突然看不清了”的情况。 这一切的问题,正是出在了机器人的眼睛——深度相机。 因为无论是基于结构光还是双目立体视觉的深度相机,它们的工作原理都是依赖物体表面对光线的稳定反射。 而透明材质会让光线直接穿透,高反光材质则会将光线漫反射到四面八方,导致传感器无法接收到有效的回波信号,从而产生大量缺失或错误的深度值。 对比一下我们人类看到的场景和机器人眼中的场景,就一目了然了: 毫不夸张地说,这类让机器人睁眼看不清的问

AI技术文章
0
多模态大模型中Attention机制暗藏「骗局」,需用一个公式修正丨上大×南开

多模态大模型中Attention机制暗藏「骗局」,需用一个公式修正丨上大×南开(在新窗口打开)

Attention真的可靠吗? 近年来,Vision-Language Models(VLMs)在多模态理解任务中取得了显著进展,尤其是在视觉问答、图像理解和视频理解等场景中,模型通常通过language-to-vision attention来衡量视觉token与文本之间的相关性,并据此进行visual token pruning,以降低推理成本、提升运行效率。 然而,一个长期被忽视的问题是:attention本身是否真的能够作为“语义重要性”的可靠指标? 在最新研究中,上海大学曾丹团队系统分析了主流VLM中attention的行为模式,发现一个关键却容易被忽略的现象——attention并

AI技术文章
0
斯坦福英伟达推出测试时强化学习:微调开源模型胜过顶级闭源模型,仅需几百美元

斯坦福英伟达推出测试时强化学习:微调开源模型胜过顶级闭源模型,仅需几百美元(在新窗口打开)

大模型持续学习,又有新进展! 来自斯坦福、英伟达等研究机构的最新研究,针对解决开放的科学问题,提出全新思路—— Test-Time Training to Discover (TTT-Discover)。 其基于开源模型gpt-oss-120b,在多个领域达到SOTA,优于人类专家与闭源前沿模型。 该方法不再沿用“测试时缩放”(Test-time Scaling)只通过Prompt调度冻结模型的做法。 而是在测试阶段,针对单个具体问题,引入强化学习(RL)对模型权重进行更新。 这种“测试时训练”使模型能够从该问题的失败尝试中实时获取经验,更新参数,实现模型能力的定向进化。 数学:给出了Erdő

AI技术文章
0
北大AI研究颠覆认知:我们看到的不是真实,而是被语言润色过的现实

北大AI研究颠覆认知:我们看到的不是真实,而是被语言润色过的现实(在新窗口打开)

近日,北京大学朱毅鑫教授课题组、北京大学毕彦超教授课题组和山西医科大学第一医院王效春团队通过结合 AI 模型和大脑损伤患者的数据,发现语言其实是一副无形的智能眼镜,时刻在悄悄修饰着我们看到的世界。我们可能以为视觉就是眼睛看到什么就是什么,但是这项成果说明了视觉从来都不是孤立的。事实上,当我们在看图片的时候,其实不只是在看,而是在进行被语言调制过的看。

AI技术文章
0

参与交流

查看 AINRK 交流群说明

了解加入交流群的方式,阅读内容无需登录。

查看交流群说明(在新窗口打开)