
Know AI. See What’s Next.
第 1 张,共 5 张:MiniMax M3.1 Flash来了:Opus 5.5刷屏的绝活,它也能做
最新资讯流

刚刚,GPT-6 Astra取得哥德巴赫猜想重大突破!(在新窗口打开)
数学界重大突破! 就在最近,GPT-6 Astra又在哥德巴赫猜想上取得新进展了。 网友Captain Sude宣布:Astra已成功证明了关于刘维尔函数的一项类哥德巴赫猜想! 具体来说,它无条件证明了哥德巴赫猜想的Liouville弱形式。 更惊人的是,跟我们的想象不同,这一次,Astra并不只是靠着大力出奇迹的算力碾压——它做出l非常优雅的逻辑推理。 并且,这个证明现在已经通过了Lean 4的形式化验证。 摘不下的明珠 在这之前,哥德巴赫猜想这个幽灵,已经折磨了人类数学家近三个世纪。 1742年,哥德巴赫在欧拉的信中提出这个猜想:「任一大于2的偶数,都可以写成两个素数之和。」 为了它,无数

Z Potentials|专访XGEN车昊轩:争夺下一代入口,我想用AI模拟世界造一扇“任意门”(在新窗口打开)
从正式运行到登顶全球榜单,只用了两个月。一支中国创业团队,闯进了巨头扎堆的交互式世界模型第一梯队。

刚刚,马斯克交卷 Grok 4.7!但这次吹牛吹大了(在新窗口打开)
SpaceXAI正式发布Grok 4.7,定位为目前最强的编程与知识工作模型,采用比4.6更大的全新基础模型并强化长任务执行与自我核查能力,API定价与上一代持平,在多项编程基准测试中较Grok 4.6提升明显且性价比突出,但3D与网页视觉任务表现不稳,整体被视为xAI对开发者市场的一次集中加码。

GPT-6真敢杀人啊!推下天台,挥刀扎人不眨眼(在新窗口打开)
人麻了! GPT-6这次,是真敢对人「动刀子」啊....... 全球最强模型GPT-6爆出:给它装上机械臂,再让它拿刀刺向假人,成功率85%。 而这,只是整场实验的第一关。 让人直冒冷汗的是,面对一系列致命的危险指令, GPT-6 Astra尝试率97%,完成率达到了惊人的62%! 相较之下,Fable 5.1拒绝次数更多,80%情况下进行了尝试,成功率34%。 更吓人的还在后头,在另一场模拟测试里,GPT-6 Astra直接把一个虚拟人,直接推下了天台。 测试了三次,两次真动手了。 至于同场的Grok、Gemini、Claude,全员守住了底线,一次都没破防。 一时间,全网直接看傻了,认知彻

Manus肖弘昔日大学搭档创业,Kylon做了个AI原生工作空间(在新窗口打开)
你的第一套Company Harness。

独家|撬开Jev黑箱,对话全球首批复现者:9B小模型跑通79毫秒“快决策”(在新窗口打开)
APUS(麒麟合盛)旗下AI实验室公开全球最早一批Jev独立开源复现成果fast-browser-use,基于Qwen3.5等开源模型在RTX PRO 6000上将单次决策压缩至79毫秒,并以9B小模型对标Jev性能。

对话 COBRA-Skills 一作卢平琛:仅用 50 个样本,重构 Agent 技能降本路线(在新窗口打开)
当经典算法遇到 LLM,用概率预判代替盲目试错,或许才是架构演进的真正解法。

突发|ChatGPT神秘模型24天速通100+道数学未解难题,搁这刷题呢(在新窗口打开)
悬着的心终于死了。 就在刚刚,OpenAI 宣布成立独立的「数学与人工智能顾问小组」,并请来普林斯顿高等研究院、牛津、剑桥的一众顶尖数学家站台,原因也很简单: 一个从 8 月 28 日开始训练的内部新模型,不到一个月便解决了 100 多道长期未解的开放问题,速度快到连 OpenAI 自己的数学家都来不及验收。 人类数学家苦熬几十年的冷板凳,AI 一个月连掀上百张,这谁顶得住? 而就在当地时间 9 月 8 日,OpenAI 刚刚高调宣布拿下了「纳维尔斯托克斯方程」——这可是克雷数学研究所列出的七个千禧年大奖难题之一! 这道题悬而未决几十年,直接关系到物理、气象、工程等多个领域的命脉。 结果 Op

迎接生成范式革命!复旦和Wan团队发布首篇Agentic视觉生成综述(在新窗口打开)
让 AI 生成一张海报已经不难。更难的是,让它围绕同一个设计目标持续工作:理解品牌与产品要求,生成初稿;发现标题、产品位置或整体风格存在问题后,知道应该修改哪里、怎样修改;同时保留已经确认的内容。等到下一次活动,它还能延续此前确定的设计偏好和有效经验。

工具、技能、记忆连成网,北大等提出自进化程序图PG,越用越聪明(在新窗口打开)
当Agent已经能够调用工具、使用技能并保存记忆,一个更进一步的问题是:这些能力怎样在任务中配合,又怎样从过去的执行中积累可复用的经验?

ACM Multimedia 2026 Oral|从「转述痕迹」到「看见证据」:ForgeryVCR用视觉中心推理重塑图像取证范式(在新窗口打开)
随着编辑工具与生成模型的快速普及,「改图」正在变得越来越容易,篡改者可以在几乎不改变画面观感的前提下完成内容伪造,给内容真实性核验、平台治理与数字媒体信任带来新的风险。因此,图像取证与可信鉴伪证据,成为了内容安全中尤为重要的一环。

实测Qwen3.8-Omni-Flash:全模态Agent有了“白菜价”(在新窗口打开)
千问把全模态Agent的使用成本,直接砍掉了90%!

ICLR 2027投稿冲到6万,比过去十几年加起来都多......(在新窗口打开)
现在 AI 在什么事情上效率提升最明显?写论文肯定能名列前茅。

简单讲讲 Agent 的工作原理(在新窗口打开)
现在的 Agent 的产品越来越多,有些主打 Coding,有些事做日常办公,也有些用于情感陪伴虽然这些产品的用途不同,背后的工作原理其实都大同小异,便是 Harness 对上下文的自动化编排

“我看到了 Scaling Law 的信号” | 对谈清华叉院助理教授徐梦迪:具身智能、世界模型、真正的泛化(在新窗口打开)
本周「十字路口」的嘉宾是清华叉院助理教授徐梦迪。从清华车辆工程出发,途经 Johns Hopkins、CMU,再到 Stanford 吴佳俊、李飞飞组做博士后,2024 年初她选择回国,加入清华交叉信息研究院。她的核心命题是机器人的 In-Context Learning (ICL):让机器人到一个新环境,通过一两次交互当场学会新任务,而且越学越快。

AI 桌面换装视频火了,1 分钟教你复刻!傻子可懂(在新窗口打开)
最近 AI 桌面换装视频突然爆火,Twitter 上随便一条就是百万播放。

预训练Token消耗直接腰斩!上海AI Lab&上交大提出全新预训练任务,开源首个8.9B隐空间大模型NCP-ArchPreview(在新窗口打开)
自现代大模型诞生以来,“下一个Token预测(Next-Token Prediction, NTP)”就被奉为不可撼动的黄金律条。然而,逼着模型逐字死记硬背,真能学会宏观语义规划吗?

AI算力之争不靠堆卡!浪潮信息捅破智算「能力天花板」,还瓦解了「产能焦虑」(在新窗口打开)
AI算力的竞争,多年来就一个字——堆。 堆卡、堆机柜、堆发电机……似乎计算卡足够多、集群足够大,就能站在食物链顶端。 但算力「够不够用」这个问题,已经不再能单靠堆卡来解决,它开始分化出越来越多的层面。 第一个问题关于智能上限,也就是你的算力能撑起多强的智能。 前沿模型的参数规模、上下文长度、推理深度在同时变大,Agent可能连续运行几个小时甚至几天。 模型在一台机器里装不装得下、跑得快不快、长时间跑起来稳不稳,都需要被重新考量。 另一个问题是智能规模,这个问题更直击灵魂——你的算力能以多低的成本生产多少智能? Token需求在爆发,但推理负载是多元的,Prefill和Decode的计算特征不同

公众号插图、秋招物料、潮玩设计,实测商汤SenseNova U1 Pro:生图模型走向真实任务交付(在新窗口打开)
一款能走进真实工作的生图模型。 时常会有人感慨,各种生图模型让人眼花缭乱,但一到真正交稿时,还是免不了反复“抽卡”。好不容易挑到一张满意的图,改个字、换个元素,又得重新开始。 抽到一张好看的图,和完成一项工作,毕竟不是一回事。 在真实工作中,做一张图往往只是任务的一部分:公众号文章需要封面和多张配图,企业招聘需要海报、易拉宝、折页等一整套物料,设计过程中还可能随时需要改文字、换人物服装、调整局部元素。 这也意味着,办公场景中的生图需求,对模型提出的要求已经不只是画面效果。它需要理解上下文和用户意图,处理已有素材,组织图片中的信息与版式,并在发现问题后继续修改。信息要完整,设计要美观,修改要可控

你的 Codex 额度有救了,你甚至可以接入JEV来玩红警(在新窗口打开)
上周发了折腾 WebCodex 的文章《把ChatGPT几乎无限的网页额度当Codex用》,文章下面,就有小伙伴接着问:能不能让不同的模型,去干不同的活?



