内容栏目

AI技术文章

分享不同 AI 工具、模型与相关技术的使用方法和实践文章。

英伟达3D模型打造“AI建筑师特工队”,8位华人合著,包括千问实习生

英伟达3D模型打造“AI建筑师特工队”,8位华人合著,包括千问实习生(在新窗口打开)

英伟达新论文让AI学会先盖房、再装修。 智东西2月3日报道,近期,英伟达宣布其全新3D通用模型论文将发表于2026国际3D视觉会议,论文的预印本已于去年7月发表。这篇论文构建出了一种建构3D世界的新范式,验证了“AI生成的3D合成数据”可规模化替代人工标注数据,能够大幅降低视觉模型预训练的成本。 论文的主要成果为3D-GENERALIST模型,该模型使用统一化框架,将3D环境生成的四大核心要素即布局、材质、光照、资产等统一到序贯决策框架中。研究团队还提出了基于CLIP评分的自改进微调策略,可以让模型在下一轮生成中能自主修正前序错误。 这篇论文的作者有8位华人,第一二作者都是中国留学生,清华“姚

AI技术文章
0
大道至简,何恺明团队新作pMF开启像素级「无潜、单步」生成范式

大道至简,何恺明团队新作pMF开启像素级「无潜、单步」生成范式(在新窗口打开)

何恺明团队新论文,再次「大道至简」。 此次研究直指当前以 DiT 为代表的主流扩散模型与流匹配模型存在的通病,并提出了一种用于单步、无潜空间(Latent-free)的图像生成新框架。 论文标题:One-step Latent-free Image Generation with Pixel Mean FlowsarXiv 地址:https://arxiv.org/pdf/2601.22158v1 在生成式 AI 领域,追求更高效、更直接的生成范式一直是学界的核心目标。 当前,以 DiT 为代表的主流扩散模型与流匹配模型主要依赖两大支柱来降低生成难度,一是通过多步采样将复杂的分布转换分解为微小

AI技术文章
0
AI看不懂的色盲测试背后,藏着一场像素与诗意的战争。

AI看不懂的色盲测试背后,藏着一场像素与诗意的战争。(在新窗口打开)

AI,是色盲吗? 这个问题听起来很蠢。 毕竟现在的AI能识别人脸、读懂图片、生成图像,甚至可以按RGB色值给你改颜色。 怎么可能是色盲,看不见颜色呢? 但最近发生的一件事,让我开始开始觉得,这事不对。。。 昨天正好在办公室和同事闲聊,聊到了颜色,我们刚来的实习生小朋友说,说他是红绿色盲,然后我们的话题,就不知道怎么就聊到了色盲测试。 在现场找了几张图一起测试, 就那种一堆小点点里藏数字的图。 能看到的兄弟们可以把数字回复在公屏上。 我们那个实习生小朋友,居然真的有看不见的。 当时大家还挺欢乐的,说,要不然,发给AI看看。 然后我们就发了,本来觉得,这么明显的数字,对现在这种级别的AI来说,肯定

AI技术文章
0
何恺明带大二本科生颠覆扩散图像生成:扔掉多步采样和潜空间,一步像素直出

何恺明带大二本科生颠覆扩散图像生成:扔掉多步采样和潜空间,一步像素直出(在新窗口打开)

何恺明,再次出手精简架构。 新方法Pixel Mean Flow(pMF),突破传统扩散模型/流模型限制。 两大传统组件多步采样和潜空间都被砍了,现在只需一步,直接在像素空间生成图像。 在ImageNet 256×256分辨率上,pMF达到了2.22 FID;512×512分辨率上则是2.48 FID。这是目前单步、无潜空间扩散模型在该基准上取得的最佳成绩之一。 砍掉扩散模型的两大件 现代扩散模型生成图像,一直离不开多步采样和潜空间编码。 多步采样意味着生成一张图需要跑几十甚至上百次神经网络,潜空间则需要先把图像压缩到一个低维空间再进行操作。两者的共同目的是把一个极度复杂的生成问题拆解成若干个

AI技术文章
0
DeepSeek之后,智源大模型登Nature:事关“世界模型”统治路线!

DeepSeek之后,智源大模型登Nature:事关“世界模型”统治路线!(在新窗口打开)

▲图片由AI生成 一场押注AI未来的技术豪赌。 智东西2月1日报道,北京时间1月29日,北京智源人工智能研究院推出的多模态大模型“悟界·Emu”登上Nature正刊,成为继DeepSeek之后第二个达成此成就的中国大模型团队研究成果,也是中国首篇围绕多模态大模型路线的Nature论文。 ▲Nature官网截图 Nature编辑点评道:“Emu3仅基于‘预测下一个token’实现了大规模文本、图像和视频的统一学习,其在生成与感知任务上的性能可与使用专门路线相当,这一成果对构建可扩展、统一的多模态智能系统具有重要意义,有望推动原生多模态助手、世界模型以及具身智能等方向的发展。” ▲Emu3有望推动

AI技术文章
0

参与交流

查看 AINRK 交流群说明

了解加入交流群的方式,阅读内容无需登录。

查看交流群说明(在新窗口打开)