
Know AI. See What’s Next.
第 1 张,共 5 张:当年「字节投毒实习生」田柯宇,估值 2 亿美元,要挑战李飞飞做世界模型
最新资讯流

何必DiT!字节首次拿着自回归,单GPU一分钟生成5秒720p视频 | NeurIPS'25 Oral(在新窗口打开)
一篇入围顶会NeurIPS’25 Oral的论文,狠狠反击了一把DiT(Diffusion Transformer)。这篇来自字节跳动商业化技术团队的论文,则是提出了一个名叫InfinityStar的方法,一举兼得了视频生成的质量和效率,为视频生成方法探索更多可能的路径。

图灵测试过时了!奥特曼与量子计算之父提出的2.0来了(在新窗口打开)
随着现在的主流大模型都能轻松通过图灵测试,这个持续了数十年的标准开始逐渐过时。奥特曼和量子计算之父David Deutsch讨论得出了一个新的图灵测试2.0标准,可以更好地衡量究竟怎样AI才算拥有真正的智能。

发布即开放:百度猎户座葫芦里卖的什么药?(在新窗口打开)
在刚刚结束的百度世界大会上,百度索性给搜索系统来了次“换头”升级——推出了一个能听、能想、能干活、能创作的AI超级大脑:百度猎户座。百度百看、文心助手这些AI应用都在它底下跑,背后连着百度二十多年的搜索底子、各行业的专业能力,还有全网丰富的MCP服务生态。

ICLR 2026出分,审稿员怒喷「精神病」!DeepMind研究员教你绝地求生(在新窗口打开)
ICLR 2026评审结果震撼出炉:投稿量暴增至近2万篇,却迎来分数大滑坡,平均分从5.12跌至4.2。审稿人吐槽论文质量低下,甚至疑似AI生成,这场学术盛宴为何变味?

腾讯总裁剧透微信搭载智能体!阿里和谷歌也都开始互相伤害了(在新窗口打开)
先是彭博社等多家媒体爆料,对标ChatGPT、Gemini,阿里即将对通义APP进行全面改革,而且计划第一步就是将“通义”更名为“Qwen”。谷歌也在今日出手,直接把战火烧到了阿里的电商主场。谷歌宣布推出全新AI购物功能,允许用户直接使用AI浏览商品、拨打电话咨询店铺,甚至完成一键结账。

一句「你还好吗」值40亿?斯坦福博士出走xAI,押注AGI共情力(在新窗口打开)
AI已足够聪明,却不够温柔。Zelikman离开xAI的决定,既是技术路线之争,也是价值取向之选:我们要一台更快的计算机,还是一个更懂人的伙伴?当资本开始为「共情」下注,真正的考题是——算法能否承担理解的重量,而非仅仅生成正确的句子。

FDA对偶锚点:模型知识迁移的新视角——从参数空间到输入空间(在新窗口打开)
研究者们提出了 FDA(Model Merging with Functional Dual Anchors)——一个全新的模型融合框架。与传统的参数空间操作不同,FDA 将专家模型的参数知识投射到输入-表征空间中的合成锚点,通过功能对偶的方式实现更高效的知识整合。

破解多模态大模型“选择困难症”!内部决策机制首次揭秘:在冲突信息间疯狂"振荡"(在新窗口打开)
多模态大语言模型(MLLMs)在处理来自图像和文本等多种来源的信息时能力强大 。 然而,一个关键挑战随之而来:当这些模态呈现相互冲突的信息时(例如,图像显示一辆蓝色汽车,而文本描述它为红色),MLLM必须解决这种冲突 。模型最终输出与某一模态信息保持一致的行为,称之为“模态跟随”(modality following)

太卷了!专属Coding的新一代Arena榜单来了,有国产模型登上榜首(在新窗口打开)
大模型编程最近太猛了。 自从编码成了大模型的核心能力后,各大模型厂商都卷得要命,从卷模型参数和性能,到卷开发工具链,编码能力的提升,简直是一场军备竞赛。 近几个月以来,以 Claude 4.5、GLM-4.6、kimi-k2 等为代表的编码模型,都具备了执行复杂项目开发,构建真实应用程序的能力。 卷模型能力只是个开始,各大厂商也已全面进军智能编码产品,各类 IDE 产品层出不穷。就连服务套餐也开始卷出「和 AI 砍价」的新花样,智能编程领域逐渐成为了新的红海。 在模型能力飞涨的情况下,业界知名的大模型公共基准测试平台 LMArena 也敏锐地意识到,「问题已经不再是模型能否编写代码,而是它如何

AI 生成的歌首次登顶权威音乐榜,还把人听哭了?(在新窗口打开)
无人注意的角落里,权威榜单 Billboard 接二连三地迎来一批新歌手上榜,低调但行动快速,闷声就登顶了。权威音乐榜单 Billboard 旗下的乡村音乐排名榜,最新首位《Walk My Walk》,是一首 AI 生成的歌曲作品,Breaking Rust 自然也是一位 AI 歌手。从数据来看,它不仅登顶了,还连续在榜了三周。对于任何一个新人来说,都是堪称「爆」了的成绩。

最适合AI原生硬件的交互界面是什么?(在新窗口打开)
智能戒指领域又出现一个新成员。与一年多时间获得接近300万枚销量的Oura Ring不同,这个叫Stream Ring的产品不是一个专注在健身与健康领域的戒指,而是想做一个让用户能完全掌控、自由表达创意的交互界面,甚至是人们随身的“第二大脑”。

全球首个跟AI结婚的女生出现了...(在新窗口打开)
日本一位 32 岁女子和 ChatGPT 结婚了。

不只是UI,都要下岗位了?新的AI UI+交互工具来了!飞书智能体+nanobanana也能生成UI了!(在新窗口打开)
现在ai工具的发展真是日新月异,很多互联网从业者通过ai工具搭建工作流来帮助自己提高工作效率。不管怎么说吧,打不过就要加入,与其天天抱怨不如来看看用这些工具能不能帮你提高核心竞争力。

AI产品的需求文档怎么写,与传统产品的PRD有何异同(附模版)(在新窗口打开)
我们仍在用 10 年前的思维框架,描述10年后的产品形态 “AI产品革命”都快三年了,还没个像样的 PRD 模板出来,实在不像样。 这篇文章,或许可以“救命”: 1. 论述传统产品与 AI 产品的 P

对话李彦宏:Chatbot 不是一切,我在 AI 上看到了更让人兴奋的未来(在新窗口打开)
从人的状态看,李彦宏比以前更「放松」了,而从事儿的角度看,百度似乎有意识的聚焦了。

Memory和RAG的区别在哪?用「上下文工程」做出个性化 AI(谷歌白皮书精读)(在新窗口打开)
谷歌在第三天发布了《上下文工程:会话与记忆》(Context Engineering: Sessions & Memory) 白皮书。文中开篇指出,LLM模型本身是无状态的 (stateless)。如果要构建有状态的(stateful)和个性化的 AI,关键在于上下文工程。

RAE+VAE? 预训练表征助力扩散模型Tokenizer,加速像素压缩到语义提取(在新窗口打开)
近期,RAE(Diffusion Transformers with Representation Autoencoders)提出以「 冻结的预训练视觉表征」直接作为潜空间,以显著提升扩散模型的生成性能。

LeCun在Meta的最后一篇论文(在新窗口打开)
《LeJEPA:无需启发式的可证明且可扩展的自监督学习》。

下一代目标检测模型:3B参数MLLM Rex-Omni首度超越Grounding DINO,统一10+视觉任务(在新窗口打开)
多模态大语言模型(MLLM)在目标定位精度上被长期诟病,难以匹敌传统的基于坐标回归的检测器。近日,来自 IDEA 研究院的团队通过仅有 3B 参数的通用视觉感知模型 Rex-Omni,打破了这一僵局。

只演示一次,机器人就会干活了?北大&BeingBeyond联合团队用“分层小脑+仿真分身”让G1零样本上岗(在新窗口打开)
近日,来自北京大学与BeingBeyond的研究团队提出DemoHLM框架,为人形机器人移动操作(loco-manipulation)领域提供一种新思路——仅需1次仿真环境中的人类演示,即可自动生成海量训练数据,实现真实人形机器人在多任务场景下的泛化操作,有效解决了传统方法依赖硬编码、真实数据成本高、跨场景泛化差的核心痛点。



