内容栏目

AI技术文章

分享不同 AI 工具、模型与相关技术的使用方法和实践文章。

单个tokenizer胜任图像视频理解生成!南大&腾讯混元HYDRA打通多模态统一难题

单个tokenizer胜任图像视频理解生成!南大&腾讯混元HYDRA打通多模态统一难题(在新窗口打开)

南大王利民团队&腾讯混元的HYDRA系列(HYDRA,HYDRA-X)工作挑战了这个惯例,用一个基于ViT的统一视觉Tokenizer,帮助原生多模态模型更好地“看懂”和“创作”。训练一个基于ViT的Unified Tokenizer,使其同时具有理解和生成的能力,进而同时作为理解和生成的Autoencoder,来支持原生多模态模型(Unified Multimodal Models)的训练。

AI技术文章
0
刚刚,DeepSeek V4更新DSpark,推理速度提升80%

刚刚,DeepSeek V4更新DSpark,推理速度提升80%(在新窗口打开)

刚刚,DeepSeek V4 进行了一次更新。新推出了投机解码(Speculative Decoding)框架 DSpark,并同步开源了支撑该版本的全栈推测性解码框架 DeepSpec。DeepSeek-V4-Pro-DSpark 并非全新架构模型,而是在 DeepSeek-V4-Pro 基础上引入了推测性解码模块。此次更新的重点在于工程落地,而非模型能力本身的迭代。

AI技术文章
0
让机器人学会「预判接触」:它石智航牵头四大顶尖机构发布TacForeSight,破解精细操作难题

让机器人学会「预判接触」:它石智航牵头四大顶尖机构发布TacForeSight,破解精细操作难题(在新窗口打开)

机器人已经学会看见世界,也开始学会摸到世界。但对于真实接触操作而言,仅仅感知当前状态远远不够,机器人还需要预测物理世界接下来会如何变化。擦拭、插接、拧紧,这些人类几乎凭感觉就能完成的动作,对机器人来说却并非易事:接触力度会变化,物体位置会偏移,反馈慢一步,就可能打滑、卡住或丢失。

AI技术文章
0
扩散模型自引导新范式:直接交换token就能变强! | CVPR‘26 Oral

扩散模型自引导新范式:直接交换token就能变强! | CVPR‘26 Oral(在新窗口打开)

扩散模型又被玩出新花样了。 一直以来,提高扩散模型生成质量的关键手段,是在推理阶段加入引导(guidance)。 要么依赖文本条件(如CFG)——需要专门的训练策略,没有文本条件就不能用; 要么靠显式加噪破坏模型推理——然而效果有限。 现在,一种全新的思路来了: 不需要文本条件,不加噪声,不改模型,只在内部交换token。 来自上海交大和vivo的研究者提出了一种十分简单但非常有效的方法:自交换引导(Self-Swap Guidance,SSG)。该工作已被CVPR 2026国际会议接收为Oral。 一句话总结: 通过在空间和通道维度上交换token特征,把模型“搞差”,再用这个“变差”的路径

AI技术文章
0

参与交流

查看 AINRK 交流群说明

了解加入交流群的方式,阅读内容无需登录。

查看交流群说明(在新窗口打开)