
打通感知-理解-交互链路,全栈视频理解大模型VideoChat3开源了(在新窗口打开)
视频是描述物理世界的重要数据形态,更是人类与物理世界交互的重要载体,视频理解大模型是让 AI 从数字世界走向物理世界最基础、最原生的组成部分。
内容栏目
分享不同 AI 工具、模型与相关技术的使用方法和实践文章。

视频是描述物理世界的重要数据形态,更是人类与物理世界交互的重要载体,视频理解大模型是让 AI 从数字世界走向物理世界最基础、最原生的组成部分。

就在最近,英伟达亲自下场,发布了一篇名为《AI Model Co-Design: Hardware-Friendly LLM Design》的技术博客。整篇文章洋洋洒洒,其实就想点醒行业一件事:别光顾着堆算力了,来看看你们是怎么把顶级显卡逼成“磨洋工”的吧。

近日,围绕搜索、推荐、广告等核心业务中的大规模向量检索成本与性能问题,小红书引擎架构团队在 OSDI 2026 会议上发表了论文《The Clustering Strikes Back: Building Cost-Effective and High-Performance ANNS at Scale with HELMSMAN》。

VLA模型已经会做任务,但真实机器人还是慢!PolicyTrim是一种优化VLA机器人执行效率的方法,无需重新训练。它通过扩展可靠动作序列并减少冗余步骤,帮助机器人更直接完成任务,提升整体速度。

刚刚结束的 2026 年世界人工智能大会(WAIC) ,具身智能与 AI 终端占据了最显眼的位置,人形机器人、灵巧手和各类智能硬件吸引了大量目光。

多智能体系统(Multi-Agent Systems,MAS)展示了令人印象深刻的能力:一个模型负责提出方案,另一个模型进行批评,还有模型承担投票、规划或执行。通过角色分工和多轮协作,系统能够解决单个模型难以稳定完成的数学推理、代码生成和知识问答任务。

针对这一挑战,腾讯内容服务部 BAC 提出了一个名为 ProLaViT(Progressive Latent Visual Thought) 的全新框架。它的核心思想是:别急着下结论,先在连续隐空间里像人一样「步步推导」。 即让模型遵循 「定位 → 聚焦 → 分离」(Locate → Focus → Isolate) 的因果链,逐步收紧视觉注意力,最终精准锁定目标。

外界第一次认识苏度,是在今年 4 月。彼时,sudo R1 的开放物体抓取能力给行业留下深刻印象:在开放环境中面对随机物体,机器人能够稳定完成抓取。抓取,这是一个足够基础、又足够难的技能。

这一天,整个数学圈震撼了。 一个让无数顶尖数学家折戟,让华人天才数学家张益唐苦熬七年、被迫在赛百味洗盘子的超级数学难题——雅可比猜想,被Fable 5证伪! 昨天傍晚,Anthropic的研究人员Levent Alpoge发布推文: 大家好,雅可比猜想是错的,感谢我的好友akhil问了这个问题,也感谢我的另一位好友Fable在世界杯决赛期间还在工作。 配文下方,是一个简洁的数学公式。 一个有着87年历史的核心数学难题问题,就这样被 Fable 5在一个周日的傍晚轻松解决。 雅可比猜想问题极其困难。或许人类还需要一百年才能解决它。你的尝试值得尊敬,也许奥林匹斯众神终有一天会眷顾你。 雅可比猜想的

过去两年,AI智能体(Agent)完成了一次身份转变。

最近喜欢用Flova做点AI小视频。 发现很多AI视频的产品,界面长得越来越像了。 从Agent定位,到具体的交互方式、功能模块,还有操作流程,好像都在往同一个方向靠。 打开一个产品,右侧一个对话窗口,左侧是故事板,底下是时间线。 再打开另一个产品,差不多的布局。再打开 C 产品,还是这个结构。 当一个赛道里,大家开始疯狂对齐某个产品的交互范式时,意味着这个产品率先定义了这个品类的标准形态。 就像当年 ChatGPT 出现之后,所有对话类 AI 产品都在抄它的对话框布局。 就像 Notion 出现之后,所有文档类产品都在抄它的块编辑器。 在我看来,Flova是AI视频赛道那个一直以来的开创者,

让大模型 "读得更长" 一直是 Agent、深度推理和海量资料整合等场景的刚需,但标准全注意力机制的计算量随序列长度呈平方级增长,始终是横亘在长上下文建模面前的三座大山。

在计算历史的绝大部分时间里,编程的本质是一项翻译工作:开发者需要在人类理解的维度上剖析问题,设计抽象方案,随后将其转译为机器能够执行的语法。当前的软件工程领域正在经历自高级编程语言问世以来最为显著的变化。

让大模型给一张图片打“质量分”,它其实经常看走眼。

Digital AI和Physical AI之间,曾有一道难以跨越的鸿沟。

人工智能(AI)模型在科学发现中的角色,正经历着一场从「工程缝合者」向「智能推演者」的深刻蜕变。

过去一年,Deep Research Agent 被视为大模型落地的下一个突破口,它们会检索、能用工具、可多步推理,在一个个榜单上高歌猛进。但把它们放到真实世界的专业场景里,表现是否也同样亮眼?

市面上已有几十种Agent记忆方案,有的基于向量检索,有的基于知识图谱,有的靠定期总结“压缩”对话,有的则完全依赖模型自身的上下文窗口。它们各有各的说法,但在系统层面,到底哪种方案靠得住?哪种方案在你的工作负载下既不贵又准?

在讨论 RGB-IR 目标检测时,「两种模态互补」几乎是默认前提。RGB 擅长保留纹理和颜色,红外图像在弱光条件下更稳定,于是最直接的路线是搭建双分支网络,让它们在中间层不断交换信息。InfraNet 的出发点却来自一个不太符合这一直觉的现象。

WAIC期间,中数睿智发布了“AI for Reasoning”因果智能体系,针对的就是这些痛点。比如油气钻井的井控场景,井下压力和流量突然不对劲,系统不只是输出一句“存在风险”,而是能沿因果链定位病因,并推演多条干预路径:不处置会怎样?立即关井会怎样?延迟处置能撑多久、代价是什么?辅助企业在事故发生前做出最优决策。
参与交流
了解加入交流群的方式,阅读内容无需登录。