内容栏目

AI技术文章

分享不同 AI 工具、模型与相关技术的使用方法和实践文章。

CVPR 2026 | GaussianDWM:用3D高斯表示统一自动驾驶场景理解与多模态生成

CVPR 2026 | GaussianDWM:用3D高斯表示统一自动驾驶场景理解与多模态生成(在新窗口打开)

自动驾驶世界模型的研究目标已经从单纯预测未来视觉帧,扩展到构建可用于场景理解、空间定位和后续决策的世界表示。如果模型只能生成外观上合理的未来图像,却无法回答场景中有哪些目标、目标位于何处,以及不同视角下的空间结构如何变化,那么它仍然缺少对三维驾驶环境的显式建模能力。

AI技术文章
0
争论几十年的水之谜,被AI一举破解!港城大&中石大成果登Nature Physics

争论几十年的水之谜,被AI一举破解!港城大&中石大成果登Nature Physics(在新窗口打开)

香港城市大学曾晓成教授与中国石油大学(华东)钟杰教授团队给出了终结级的分子水平证据,成果发表于《Nature Physics》。他们首创了一套无监督深度学习框架,不给AI任何预设条件,直接把海量水系统中7400多万个水分子结构扔给模型,让AI自己去悟。结果不仅直接证明常压水里确实存在两种「暗」组份,还把A/B水分子相互变身的「立交桥」路线图给完整画了出来。

AI技术文章
0
CVPR 2026 | 视觉脑机迈向双向交互!神经流模型 NeuroFlow 打通视觉与神经的双向通道

CVPR 2026 | 视觉脑机迈向双向交互!神经流模型 NeuroFlow 打通视觉与神经的双向通道(在新窗口打开)

来自上海人工智能实验室、香港大学、香港中文大学等机构的研究团队,提出首个基于统一神经流模型的视觉-神经双向建模框架NeuroFlow,相关成果入选 CVPR 2026。它首次将视觉编码(写脑)与解码(读脑)整合到同一可逆流结构中,打通视觉感知与神经活动之间的双向通路,为理解人类视觉认知机制、构建下一代通用视觉假体与双向脑机接口提供了全新范式。

AI技术文章
0
Anthropic宣告「递归自我提升」时代到来,LLM如何实现自我进化?全景综述带你一探究竟

Anthropic宣告「递归自我提升」时代到来,LLM如何实现自我进化?全景综述带你一探究竟(在新窗口打开)

近日,Anthropic 发布了一篇引发广泛关注的文章《When AI builds itself》。文中披露了极其惊人的内部数据:截至 2026 年 5 月,Anthropic 超过 80% 的合并代码已由 Claude 编写,工程师的日常代码产出飙升了 8 倍;更令人瞩目的是,AI 智能体已经可以自主提出假设、执行长达数百小时的强化安全实验。

AI技术文章
0
陶哲轩First Proof二期结果出炉!最低8美元1题,AI烧出7道论文级解法

陶哲轩First Proof二期结果出炉!最低8美元1题,AI烧出7道论文级解法(在新窗口打开)

陶哲轩又发成绩单了。 由他主导的First Proof项目第二批评测结果出炉。 本次评测延续了项目核心规则:选取10道从未在网络、期刊上公布过解法的前沿研究级数学新题,交由AI系统作答。 但相比第一次评测,本次测试进一步提高了标准。 评测全程采用专业的双盲同行评议机制,经专家评定,最终有7道题的AI解答达到学术发表标准, 其中,解得最漂亮的Problem 5—— 一道关于随机偏微分方程的问题,AI提出的解法跟人类完全不同,推导得出了比人类解法更强的中间结论。 双盲同行评议 这次的题目是来自数学家真实研究中的新问题。 本次的问题覆盖了可计算理论、离散几何(和经典的莫比乌斯带猜想相关)、离散概率、

AI技术文章
0
指令遵循媲美Seedance 2.0!复旦腾讯联合提出Baton,多说话人场景M-WER暴降76%

指令遵循媲美Seedance 2.0!复旦腾讯联合提出Baton,多说话人场景M-WER暴降76%(在新窗口打开)

视频生成,早已不止于视觉。 随着生成式AI发展,联合视频—音频生成正成为重要研究方向。与视频优先、音频后期合成的传统流水线相比,原生同步生成的视听内容跨模态一致性更强,用户体验更沉浸。 但问题在于,现有开源模型面对复杂语义时力不从心。 遇到多阶段动作的组合式指令、涉及人与物体交互的复杂任务时,模型往往无法准确建模场景中的时序逻辑和因果关系——不仅要求长程语义推理能力,还必须在推理中维持视频与音频的时空一致性。 核心矛盾在于:现有方法依赖粗粒度全局文本嵌入指导扩散过程,无法将多阶段动作与多说话人对话分解为具有时间对齐的指导信息,视频和音频去噪轨迹因此各自演化,最终跨模态失配。 为解决这一问题,复

AI技术文章
0
ACL 2026 Oral|语义推理如鲠在喉:大模型被「短语」难住了

ACL 2026 Oral|语义推理如鲠在喉:大模型被「短语」难住了(在新窗口打开)

AI 的能力边界正在不断被刷新。从数学推理到代码生成,再到数字化白领,语言模型和语言智能体在诸多基准测试中已展现出超越人类专家的表现。一个看似顺理成章的判断早已成为共识:语言模型已经具备了扎实的语言理解和语义推理能力。然而,ACL 2026 Oral 的一项研究工作从一个更基础的层面重新审视了这个问题:语言模型真的理解(短语)语义吗?

AI技术文章
0

参与交流

查看 AINRK 交流群说明

了解加入交流群的方式,阅读内容无需登录。

查看交流群说明(在新窗口打开)