
Know AI. See What’s Next.
第 1 张,共 5 张:当年「字节投毒实习生」田柯宇,估值 2 亿美元,要挑战李飞飞做世界模型
最新资讯流

速递|成立一年的开源编程Agent初创OpenHands,完成1880万美元融资(在新窗口打开)
在我们探讨今日关于Gemini 的新闻之前,需要提及今晨微软与英伟达宣布,将投资 Anthropic。该公司承诺在未明确时限内投入至少 300 亿美元租赁微软 Azure 云平台上配备英伟达芯片的服务器。至此,三大云服务商均已注资这家 OpenAI 的竞品,再次释放微软已从 ChatGPT 制造商分散投资的信号。

Sora 想做的 IP 内容生态,这个国产 AI 已经先走了一步(在新窗口打开)
今年不少出圈的 AI 视频,基本都有一个共同点:套了个熟悉的 IP 壳。

大模型:从 .txt 到 .exe(在新窗口打开)
下面这个,来自《人类的认知协议》的最后一个章节,写于一年前

对话斑马口语:如何用 AI Agent 造出「超人类外教」?(在新窗口打开)
真人外教会累、会忘、会不稳定,无法实现「千人千面」的颗粒度。这是 AI Agent 的机会。

何恺明团队新作:扩散模型可能被用错了(在新窗口打开)
何恺明又一次返璞归真。 最新论文直接推翻扩散模型的主流玩法——不让模型预测噪声,而是直接画干净图。 如果你熟悉何恺明的作品,会发现这正是他创新的典型路径,不提出更复杂的架构,而是把问题拆回最初的样子,让模型做它最擅长的那件事。 实际上,扩散模型火了这么多年,架构越做越复杂,比如预测噪声、预测速度、对齐latent、堆tokenizer、加VAE、加perceptual loss…… 但大家似乎忘了,扩散模型原本就是去噪模型。 现在这篇新论文把这件事重新摆上桌,既然叫denoising模型,那为什么不直接denoise? 于是,在ResNet、MAE等之后,何恺明团队又给出了一个“大道至简”的结

对谈 Sora 核心团队:Sora 其实是一个社交产品,视频生成模型会带来科研突破(在新窗口打开)
上个月 OpenAI 在发布 Sora 2 的同时将其作为独立应用发布,产品一经上线便登顶苹果应用商店榜首的现象级产品。本篇内容是对 Sora 2 的三位核心负责人的访谈:研发负责人 Bill Peebles、产品负责人 Rohan Sahai 以及工程与产品负责人 Thomas Dimson,Dimson 还参与过 Instagram 产品的搭建。

AI内容首超人类,意味着什么?(在新窗口打开)
AI内容就像是快餐,可以快速填饱肚子;而人类创作更像是私房菜,可能有瑕疵,但更有味道。现在的问题是,我们是否愿意为了效率而放弃味道?

NeurIPS 2025 Spotlight | 香港大学提出无需数据标记的ViT密集表征增强方法(在新窗口打开)
在视觉处理任务中,Vision Transformers(ViTs)已发展成为主流架构。然而,近期研究表明,ViT 模型的密集特征中会出现部分与局部语义不一致的伪影(artifact),进而削弱模型在精细定位类任务中的性能表现。因此,如何在不耗费大量计算资源的前提下,保留 ViT 模型预训练核心信息并消除密集特征中的伪影?

如视发布空间大模型Argus1.0,支持全景图等多元输入,行业首创!(在新窗口打开)
近来,世界模型(World Model)很火。多个 AI 实验室纷纷展示出令人惊艳的 Demo:仅凭一张图片甚至一段文字,就能生成一个可交互、可探索的 3D 世界。这些演示当然很是炫酷,它们展现了 AI 强大的生成能力。

世界第一「空间智能」引擎!苹果没做成的,95后博士拿下了(在新窗口打开)
2024年以来,从苹果Vision Pro将「空间计算」推向巅峰,到Peloton Guide、Nex Playground等「AI摄像头」硬件开始在小规模市场中验证可行性,风口已然初现。

“日本版OpenAI”创下估值新高!Transformer八子之一创办,老黄也投了(在新窗口打开)
刚刚,创下日本估值新高的AI初创公司诞生了!

首个AI神作!一人分饰全角,万人围观外星人嘲讽人类灭绝(在新窗口打开)
在AI时代,一个洛杉矶电影人用AI工具打造出「电影宇宙」——外星格隆人研究人类文明的搞笑伪纪录片,从健身到橄榄球,全是滑稽误解!

谷歌抢跑L3级AI,Gemini连续工作40分钟,Agent自动生成评审百条创意(在新窗口打开)
OpenAI定义的L3 AI,要被谷歌抢先一步了。

终于不用为GPU算力发愁了,10块钱训练一个GPT!(在新窗口打开)
前不久写了一期卡神做的 nanochat ,听朋友说咱们国产早就有类似的开源项目了:miniMind 。

原腾讯Robotics X算法研究员创业,4个月获3轮融资,要在3-5年将人形机器人送进家庭(在新窗口打开)
在腾讯四年,朱庆旭曾将多种训练数据喂给具身模型,最终他得出结论:“基于遥操作数据训练的主流方案,有着原理性缺陷。”

融资数亿、营收过亿!黄仁勋频频关注的具身赛道隐形冠军浮出水面(在新窗口打开)
刚刚,一家AI公司的融资引发了圈内热议。

盘点:2025 年最值得关注的 18 家 AI Voice Agent 创业公司(在新窗口打开)
「大家严重低估了 Voice 作为 AI 交互界面的潜力。」

文献、报告、合同翻译的老大难被国产工具治了?三大翻译神器横评后,这家稳得离谱(在新窗口打开)
“开组会是一场巨大的精神霸凌。” 哪怕毕业了这么多年,在社交软件看到这几个字的时候心里还是咯噔了一下… 毕竟,导师一句“这些文献你先读一读哈~”往往意味着:马上要啃几十页外文PDF、上百条术语、无数个长难句!!!!(难啊……) 就在我们“苦中作业”的时候,我发现了百度翻译里的一个隐藏板块——叫「文档翻译」,据说不仅翻译水平在线,支持200+种语言翻译,连文章的排版、格式都能高度还原? 这么好的功能当然不放过,我立刻把它拉进横评跑了一遍,测下来最直观的感受是—— 翻译够准、排版能打,连对照阅读都安排上了: 不仅如此,翻的时候旁边还挂着个AI助手,能一边总结文章内容、一边帮你划重点,嗯..感觉像是

何恺明重磅新作:Just image Transformers让去噪模型回归基本功(在新窗口打开)
大家都知道,图像生成和去噪扩散模型是密不可分的。高质量的图像生成都通过扩散模型实现。

分享我的 AI 独立开发技术栈(2025 终极版)(在新窗口打开)
周末和几个老同学聚了聚。大家都在互联网行业,聊着聊着话题自然绕到 AI。



