
Know AI. See What’s Next.
第 1 张,共 5 张:当年「字节投毒实习生」田柯宇,估值 2 亿美元,要挑战李飞飞做世界模型
最新资讯流

医疗AI智能体全面综述:行业爆发,年增长130%!(在新窗口打开)
AI智能体正把医疗AI从「看片子」升级成会思考、能行动的「医生搭档」。研究人员发表的最新综述,用通俗语言拆解智能体如何读懂多模态数据、像专家一样规划决策,又能扮演医生、护士、健康管家等多重角色;同时提醒:越智能越危险,必须配套严格评估、隐私保护与伦理护栏,才敢让它走进真实诊疗。

视频模型真在推理,还是「表演」推理?港中文等质疑:Chain-of-Frame是真的吗?(在新窗口打开)
近年来,以 Veo、Sora 为代表的视频生成模型展现出惊人的合成能力,能够生成高度逼真且时序连贯的动态画面。这类模型在视觉内容生成上的进步,表明其内部可能隐含了对世界结构与规律的理解。更令人关注的是,Google 的最新研究指出,诸如 Veo 3 等模型正在逐步显现出超越单纯合成的 “涌现特性”,包括感知、建模和推理等更高层次能力。

Agent 如何用搜索?这家最懂 AI 搜索的团队,把踩过的坑都分享出来了(在新窗口打开)
「过去,我们作为人类用户使用搜索的习惯和要求,与现在 AI 对搜索的需求截然不同。」

烧掉700亿!他为谷歌赢得诺奖,却将ChatGPT拱手让人(在新窗口打开)
11年前,谷歌收购DeepMind,花巨资买来一个「诺贝尔奖 + 顶级科学家 + 世界级实验室」,没想到却被OpenAI抢先推出ChatGPT,几乎动摇谷歌核心搜索业务,这一切背后的核心人物正是谷歌的AI掌门人哈萨比斯。

Gemini 3 来了:忘掉聊天,一句话生成一个世界 (附与Gemini 团队沟通实录)(在新窗口打开)
Gemini3太强了。 11月18日,在所有人的期待中,Google的最新AI模型Gemini3正式发布。这次,一切都回到了Google的节奏。 彻底屠榜 这是一个几乎“屠榜”了所有评测集的模型,而且

被东北雨姐舔耳10小时后,我终于被AI asmr睡服了(在新窗口打开)
谁能想到,AI把ASMR也给干了...... 那是一个困倦的午后,吃饱饭的我正瘫在工位上准备入眠。我瘫在椅子上,耳机里传来轻柔的ASMR助眠声音。那里的毛刷轻轻刮着麦克风,发出微弱的、令人神经愉悦的摩擦音。而我也在这声音的安抚下昏昏欲睡。

速递|日本AI独角兽Sakana AI,以26.5亿美元估值完成1.35亿美元B轮融资(在新窗口打开)
当美国巨头如Google、OpenAI 和 Anthropic 竞相开发支撑其 AI 产品的大型语言模型时,Sakana AI、Mistral AI、DeepSeek 和 AI21 Labs 等初创公司正凭借为特定地区、行业或独特功能设计的专业模型开辟自己的细分市场。

32个随机数字,1分钟推演地球未来15天丨谷歌DeepMind(在新窗口打开)
天气预报的时代真的变了。谷歌DeepMind最新发布的WeatherNext 2,让查天气这件事升级成了小时级、实时化。它的运行速度比上一代快8倍,分辨率提高到小时级,也就是说不再是传统预报里的“明天下午有雨”,而是可以细到“明天2–3点有小雨,3–4点雨势增强,5–6点逐渐停止”的节奏。

啊?微博7800美元训的大模型,数学能力超了DeepSeek-R1(在新窗口打开)
近日,微博正式发布首个自研开源大模型VibeThinker,这个仅拥有15亿参数的“轻量级选手”,在国际顶级数学竞赛基准测试上击败了参数量是其数百倍的、高达6710亿的DeepSeek R1模型。

真机RL!最强VLA模型π*0.6来了,机器人在办公室开起咖啡厅(在新窗口打开)
本周,美国具身智能创业公司 Physical Intelligence(简称 PI 或 π)发布了旗下的最新机器人基础模型 π*0.6。PI 是一家总部位于旧金山的机器人与 AI 创业公司,其使命是将通用人工智能从数字世界带入物理世界:他们的首个机器人通用基础模型名为 π₀,让同一套软件控制多种物理平台执行各类任务。

速递|AI机器人数据管理Foxglove,获Bessemer领投4000万美元,估值翻三倍达1.5亿美元(在新窗口打开)
最近风投机构对所谓"新实验室"有一系列投资动向。

两个世界首富吵起来了!贝索斯融资 447 亿复出搞 AI,马斯克:跟屁虫(在新窗口打开)
本该是前世界首富杰夫·贝索斯的高光时刻,结果被一只猫咪表情包搅了局。

4万亿刀,仅3.6万人!英伟达揭残酷真相:劳动正与财富大脱钩(在新窗口打开)
当沃尔玛十年营收增长2000亿却员工零增长时,「劳动力脱钩」已渗透非科技领域。英伟达以4万亿市值创造新纪录时,劳动与资本大脱钩早已开始。此时,需要重新理解AGI:它并非突发事件,而是渐进革命。

上下文工程:为什么你的 AI Agent 总是“断片”?(在新窗口打开)
AI Agent 在处理复杂任务时经常“掉链子”。你刚告诉它的信息,它很快就忘了。给它的工具越多,它反而越混乱。这不是个例。

金山与华科发布多模态模型MonkeyOCR v1.5:文档解析能力超越PaddleOCR-VL,复杂表格解析首次突破90%(在新窗口打开)
是金山派来的猴子,复杂文档解析有救了! 2025年6月以来,多模态文档解析领域迎来新一轮研究热潮,该方向逐渐成为多模态理解及大模型数据来源的重要前沿课题。 在数字化办公与AI技术深度融合的今天,文档智能解析技术已成为信息抽取、检索增强生成和自动化文档分析的核心基石。然而,现实世界中的文档往往布局复杂、表格嵌套、内含图片公式,甚至跨页分布,这让许多现有的OCR(光学字符识别系统,Optical Character Recognition)系统感到棘手。 MonkeyOCR v1.5是一个全新的统一视觉-语言文档解析框架。它在全能多模态文档解析基准OmniDocBench v1.5,OCRFlux

韩松等提出FlashMoBA,比MoBA快7.4倍,序列扩到512K也不会溢出(在新窗口打开)
今年 2 月,月之暗面提出了一种名为 MoBA 的注意力机制,即 Mixture of Block Attention,可以直译为「块注意力混合」。

Gemini 3.0还在预热,中国AI抢先!30秒造APP全网首测(在新窗口打开)
Gemini 3.0还未杀到,一系列惊艳实测就已宣告:AI「生成涌现」时代,真的来了!几乎同一时间,国内一款新生AI神器,竟将这股超能力塞进手机,30秒手搓一个APP。

谢赛宁盛赞字节Seed新研究!单Transformer搞定任意视图3D重建(在新窗口打开)
单Transformer搞定任意视图3D重建!

让大模型学会「心灵感应」:基于思维沟通的多智能体合作范式来了(在新窗口打开)
如果多个大模型能读懂彼此的想法,会发生什么?

Agent的RL和LLM的RL是一回事吗?牛津用500+论文写成综述,一次说清Agentic RL(在新窗口打开)
当我们谈论大型语言模型(LLM)的"强化学习"(RL)时,我们在谈论什么?从去年至今,RL可以说是当前AI领域最炙手可热的词汇。



