
多模态大模型训练的显存与吞吐困局,被小红书开源的BigMac打破了(在新窗口打开)
BigMac 是原生多模场景下的流水并行训练新范式。它针对多模态大模型训练中计算效率与显存占用难以兼顾的问题,提出了依赖安全的嵌套流水线:以成熟的 LLM 流水线为主干,在不打乱 LLM 执行顺序的前提下,有序嵌入编码器和生成器计算,从而在不增加 LLM 流水线空泡、保持激活显存有界的同时,高效实现多模态流水训练。
内容栏目
分享不同 AI 工具、模型与相关技术的使用方法和实践文章。

BigMac 是原生多模场景下的流水并行训练新范式。它针对多模态大模型训练中计算效率与显存占用难以兼顾的问题,提出了依赖安全的嵌套流水线:以成熟的 LLM 流水线为主干,在不打乱 LLM 执行顺序的前提下,有序嵌入编码器和生成器计算,从而在不增加 LLM 流水线空泡、保持激活显存有界的同时,高效实现多模态流水训练。

新智元报道 大模型变强,过去靠两条路。 做大——Scaling Law出现后,参数从百亿推向千亿,算力支出一路飙升。 想久——o1带火思考模型,用更长的思维链、更多推理时间换结果。 问题是,除了Sca

如果要让机械臂把咖啡机旁的杯子移到桌上,需要经历哪几个步骤?

数据市场的故事,正在进入新一轮周期。来自企业真实工作流的 Real-world Data,成为越来越多 AI Labs 争夺的新资源。比如 GitHub 就是典型的 Real-world Data,它几乎完整保留了一个问题从出现到解决的全过程。相比之下,今天绝大多数 Human Data 公司提供的,仍是人为构造的数据。

当大模型 Agent 被部署到工具调用、长程任务和开放环境中,一个关键问题会随之出现:能否在不更新模型参数的情况下,将执行经验沉淀下来,并在下一次做得更好?

你可能已经在各种 benchmark 榜单上看过 GUI Agent 的 "大胜" 了。

向ChatGPT问一个看起来挺简单的问题:“Lasha Talakhadze之前的奥运举重纪录是多少?”

记得何同学做过一个超复杂的流水线项目吗?

逛过WAIC具身智能展区的人,多半有同一个疑问: 都2026年了,机器人干活,怎么还是慢吞吞的?

最新研究发现,AI幻觉不只会骗你了,还能喂大你的自信心、削弱你的判断力。

在近日的具身智能顶会 RSS(Robotics: Science and Systems)2026 上,最高奖项 Outstanding Paper Award 提名名单里,出现了一个不太 “机器人” 的名字 —— 影眸科技,一家头部 3D 生成大模型公司。

国防科技大学虚拟现实与视觉计算团队(SAW Lab)联合先进制导与控制技术国家级重点实验室等推出面向航拍几何 3D 视觉的统一大规模数据集与评测基准 「AirZoo」。

嗨大家好!我是阿真! 刷短视频就是这点不好,上次看到一个 AI 视频拆解分析的教程,感觉很有意思,刷完了过两天忘记在哪里刷的了。

最尴尬的一刻,往往不是AI PPT生成失败。

智能的下一阶段,已从“模型”转向“系统可靠性和进化性”的比拼。

迁移学习里的“源数据”,未必非得是图像、文本或音频。

一夜之间,Tokenmaxxing成为硅谷热议话题!

炒股到现在最对不起的,就是家人。 而智谱的这一轮暴跌,确实已经到需要认真向家人解释的程度了。 7月17日(周五),智谱收跌28.49%,股价报1107港元,单日市值蒸发超过2000亿港元。 7月20日(周一),股价盘中再度跌超16%,跌破1000港元。若按6月22日盘中2980港元的历史高点计算,累计最大回撤已超过66%。 对于智谱的这波“回撤”,外界已经有很多说法,但最扎眼的导火索可能来自同行。 7月16号,月之暗面放出了Kimi K3。总参数2.8万亿,原生支持视觉理解和100万Token上下文,Kimi称它为全球首个开源的3万亿级模型。 接下来的几天,大家都知道了。 不过,也就是这周开盘

交互式视频世界模型正在从「一次性生成短片」走向「像游戏一样边操作边生成」。但长轨迹交互会迅速放大上下文、显存和多步去噪开销。Light Interaction不改模型参数、不重新训练,只在推理阶段把相机轨迹变成调度信号,动态选择历史上下文、在回访状态复用去噪输出,并用面向自回归生成的3D稀疏注意力降低计算。

商业地图可以告诉机器人「前方右转」,却无法直接告诉它眼前应该从哪里转、沿哪一侧通过;即使已经生成路线,控制误差、地面变化和动态障碍,也可能让机器人在行进过程中逐渐偏离。
参与交流
了解加入交流群的方式,阅读内容无需登录。