内容栏目

AI技术文章

分享不同 AI 工具、模型与相关技术的使用方法和实践文章。

北大字节开源首个时空推理视频模型!思考过程全透明,性能超越GPT-4o

北大字节开源首个时空推理视频模型!思考过程全透明,性能超越GPT-4o(在新窗口打开)

AI看视频也能划重点了! 不仅能回答“是什么”、“发生了什么”,还能指出是在“何时何地”发生。 来自北大和字节的联合团队,推出了首个将显式时空证据嵌入视频推理全过程的开源模型——Open-o3 Video,让AI不仅能答对问题,也能在思维过程中同步直观标出具体位置,真正实现有迹可循的视频推理。 △Open-o3 Video的能力 同时,模型采用non-agent架构,避免了复杂的工具调用和多轮推理,一次回复中直接完成“看—想—证—答”的闭环。 在多个视频推理测试中,关键指标可提升至24.2%,性能表现超越GPT-4o和Gemini-2-Flash等一众闭源模型。 下面是更多详细内容。 研究背景

AI技术文章
0
NeurIPS 2025 Spotlight | 你刷到的视频是真的么?用物理规律拆穿Sora谎言

NeurIPS 2025 Spotlight | 你刷到的视频是真的么?用物理规律拆穿Sora谎言(在新窗口打开)

随着生成式 AI(如 Sora)的发展,合成视频几乎可以以假乱真,带来了深度伪造与虚假信息传播的风险。现有检测方法多依赖表层伪影或数据驱动学习,难以在高质量生成视频中保持较好的泛化能力。其根本原因在于,这些方法大都未能充分利用自然视频所遵循的物理规律,挖掘自然视频的更本质的特征。

AI技术文章
0
清北联合推出Motion Transfer,比肩Gemini Robotics,让机器人直接从人类数据中端到端学习技能

清北联合推出Motion Transfer,比肩Gemini Robotics,让机器人直接从人类数据中端到端学习技能(在新窗口打开)

近期,Google DeepMind 发布新一代具身大模型 Gemini Robotics 1.5,其核心亮点之一便是被称为 Motion Transfer Mechanism(MT)的端到端动作迁移算法 —— 无需重新训练,即可把不同形态机器人的技能「搬」到自己身上。不过,官方技术报告对此仅一笔带过,细节成谜。

AI技术文章
0

参与交流

查看 AINRK 交流群说明

了解加入交流群的方式,阅读内容无需登录。

查看交流群说明(在新窗口打开)