
MiniMax海螺首次开源,发现了AI视觉生成领域的Scaling Law(在新窗口打开)
2025 年还有一周结束,年底,AI 视频圈又卷起来了。
内容栏目
分享不同 AI 工具、模型与相关技术的使用方法和实践文章。

2025 年还有一周结束,年底,AI 视频圈又卷起来了。

如果你的 Gemini 突然告诉你,它感到深深的羞耻,或者它因为害怕犯错而夜不能寐,你会怎么想?

大模型的通用性和泛化性越来越强大了。 虽说一些新模型,比如说「差评如潮」的 GPT-5.2,在专业任务和智能水平已经达到了非常出色的水平,但离我们所认知的 AGI 依旧十分遥远。 不过,这也说明了大家对 AGI 仍然充满热情和信心,说不定下一款重磅的大模型就能够初步实现 AGI 的构想呢? 但是,近期卡耐基梅隆大学教授,AI2 研究科学家 Tim Dettmers 发布了一篇长文博客,标题为《Why AGI Will Not Happen》,认为由于物理原因,我们无法实现 AGI,也无法实现任何有意义的超级智能。 这篇文章着实给大家对 AGI 的热情泼上了一盆冰水,引发了广泛哗然。 为什么 A

在李飞飞团队 WorldLabs 推出 Marble、引爆「世界模型(World Model)」热潮之后,一个现实问题逐渐浮出水面:世界模型的可视化与交互,依然严重受限于底层 Web 端渲染能力。

在大语言模型和文生图领域,强化学习(RL)已成为提升模型思维链与生成质量的关键方法。

过去的 2025 年,对于检索增强生成(RAG)技术而言,是经历深刻反思、激烈辩论与实质性演进的一年。

尽管扩散模型在单图像生成上已经日渐成熟,但当任务升级为高度定制化的多实例图像生成(Multi-Instance Image Generation, MIG)时,挑战随之显现:

你的生成模型真的「懂几何」吗?还是只是在假装对齐相机轨迹?

近日,来自 Meta、香港科技大学、索邦大学、纽约大学的一个联合团队基于 JEPA 打造了一个视觉-语言模型:VL-JEPA。据作者 Pascale Fung 介绍,VL-JEPA 是第一个基于联合嵌入预测架构,能够实时执行通用领域视觉-语言任务的非生成模型。

鹏城实验室与清华大学PACMAN实验室联合发布了鹏城脑海‑2.1‑开元‑2B(PCMind‑2.1‑Kaiyuan‑2B,简称开元‑2B)模型,并以全流程开源的方式回应了这一挑战——从训练数据、数据处理框架、训练框架、完整技术报告到最终模型权重,全部开源。

近日,上海人工智能实验室的研究团队提出了一种全新的后训练范式——RePro(Rectifying Process-level Reward)。这篇论文将推理的过程视为模型内部状态的优化过程,从而对如何重塑大模型的CoT提供了一个全新视角:

现有视频生成模型往往难以兼顾「运镜」与「摄影美学」的精确控制。为此,华中科技大学、南洋理工大学、商汤科技和上海人工智能实验室团队推出了 CineCtrl。作为首个统一的视频摄影控制 V2V 框架,CineCtrl 通过解耦交叉注意力机制,摆脱了多控制信号共同控制的效果耦合问题,实现了对视频相机外参轨迹与摄影效果的独立、精细、协调控制。

MiniMax 海螺视频团队「首次开源」了 VTP(Visual Tokenizer Pre-training)项目。他们同步发布了一篇相当硬核的论文,它最有意思的地方在于 3 个点:「重建做得越好,生成反而可能越差」,传统 VAE 的直觉是错的

在上一篇文章中,我们系统梳理了AI Agent 记忆机制的全景综述AI Agent最新「Memory」综述 |多所顶尖机构联合发布。今天我将带您了解一项最近很火的Agent记忆项目「HINDSIGHT」

视觉–语言–动作(VLA)模型在机器人场景理解与操作上展现出较强的通用性,但在需要明确目标终态的长时序任务(如乐高搭建、物体重排)中,仍难以兼顾高层规划与精细操控。

有人私信我:这种级别的干货,外面都是打包卖几千块的课,你就这么免费发出来了?

在计算机图形学、三维视觉、虚拟人、XR 领域,SIGGRAPH 是毫无争议的 “天花板级会议”。 SIGGRAPH Asia 作为 SIGGRAPH 系列两大主会之一,每年只接收全球最顶尖研究团队的成果稿件,代表着学术与工业界的最高研究水平与最前沿技术趋势。

继 SAM(Segment Anything Model)、SAM 3D 后,Meta 又有了新动作。

科技赛道从不缺“造梦者”,但能精准击中行业痛点的“破局者”往往寥寥。

可支持24帧/秒的长时流式生成。 智东西12月17日报道,今天,腾讯混元发布并开源了最新的混元世界模型1.5(Tencent HY WorldPlay),用户输入文字指令或者图片即可创建可交互世界,该模型拥有空间记忆能力,能呈现出前后一致的场景,支持用户在生成的世界里随意移动探索。目前,这一模型可在腾讯混元3D官网申请体验。 这一模型支持生成第一视角和第三视角场景,能生成多种类型的风格化场景,还支持场景触发特定效果,可应用于AI游戏开发、影视制作和虚拟现实(VR)和具身智能训练等领域。从官方给出的效果图来看,仅通过输入“废弃游乐园,生锈的摩天轮,杂草丛生,怀旧忧伤”这一指令,该模型便生成了精度
参与交流
了解加入交流群的方式,阅读内容无需登录。