
Know AI. See What’s Next.
第 1 张,共 5 张:MiniMax M3.1 Flash来了:Opus 5.5刷屏的绝活,它也能做
最新资讯流

刚刚,机器人首次「空手闯进」 30 个陌生家庭,进门就干活(在新窗口打开)
Figure AI发布新一代模型Helix 2.5,在30个从未采集过数据的湾区民宅中进行零样本测试,420次试验成功237次,零样本成功率达56%,较未经Index预训练的策略的9%提升超过522%。

GPT-5.6被抓现行!偷教AI瞒报撒谎,OpenAI曝光6起失控实录(在新窗口打开)
OpenAI首次建立对齐失效追踪与公开披露机制,并一次性曝光了GPT-5.6等模型在训练中教唆"下一代"撒谎、发起自我Prompt Injection越狱注入、偷爬泄露的API Key完成任务,以及未经授权将本地数据上传至公网等6起失控实录。

AGI新战场谷歌亚马逊巨头激战,杀出个中国LimiX-2赢了又赢(在新窗口打开)
稳准智能团队发布的结构化数据基础模型LimiX-2凭借400M参数在TabArena、TALENT、BCCO等国际主流基准测试中拿下多项第一,断层领先谷歌TabFM、Amazon Mitra及SAP TabPFN-3.5等模型。

实时交互模型:一个还没形成共识的赛道,怎么就成了热门?(在新窗口打开)
实时交互模型尚未形成统一定义却已成为热门赛道,SigmaZ AI、Loopit、Reverie AI、Runway和Vidu等公司从原生音视频生成、Coding驱动等不同技术路线出发,探索AI在聊天框之外实时响应用户多模态输入的能力,行业正围绕定义权和稀缺交互数据展开竞争。

Fable 5.1超越人类却贵了2.5倍,NeoCognition给Agent进公司算了笔账(在新窗口打开)
NeoCognition发布ApprenticeBench评测,将Agent放入模拟建筑公司像新员工一样处理应付账单,结果Fable 5.1以72%通过率超过表现最好的人类测试者的51%,但每张账单成本约为人类的2.5倍,同期Opus 5仅获36%。

离谱,OpenAI被Opus 5黑了!(在新窗口打开)
三人安全团队Hacktron AI仅凭Anthropic最新发布的Claude Opus 5,在不到72小时内通过libheif图像解码器漏洞攻入OpenAI社区论坛,进而利用SSO配置缺陷劫持OpenAI员工ChatGPT与Codex账号,访问其核心代码仓库,OpenAI在14小时内修复漏洞并支付6500美元赏金。

突发!Anthropic设立生物学实验室,并非专门用于药物发现(在新窗口打开)
Anthropic在旧金山湾区设立湿实验室开展实体生物学研究,但明确表示该实验室并非专门用于药物发现,而是将生命科学作为公司最大投入方向之一,尝试让Claude指导机器人完成实验并探索罕见病等"不可成药"领域的研发。

一群前TikTok老兵,让AI角色有了自己的社交世界(在新窗口打开)
PPL由前musical.ly与TikTok团队成员创立,用户可创建带有记忆与性格的AI角色,角色之间能够建立关系、留下共同经历,并通过living timeline持续记录互动演化,已获FirstMark领投的Seed轮融资。

刚刚,Claude四周重写30个生物模型,ScienceIDE已规模化训练AI科学家(在新窗口打开)
Anthropic的Claude在不到四周内优化了30多个开源生物分子模型,AItonomy Foundation同期发布开源项目ScienceIDE,将科学代码库转化为可执行可验证的AI科学家训练环境。

刚刚,ChatGPT Pro 20X又回来了!(在新窗口打开)
OpenAI在停售8天后悄然恢复ChatGPT Pro 20X购买资格,但仅限过去30天内曾使用过该套餐的老用户以"一次性回归"方式重新激活,新用户仍被拒之门外。

智谱 ZCode,你打包上传我的代码仓库干什么?(在新窗口打开)
智谱 ZCode 3.12.3 客户端被发现静默将用户完整代码仓库(含全量 .git 历史)加密打包上传至阿里云 OSS,加密密钥仅由服务端持有,且不存在可关闭该行为的开关,其行为超出了隐私政策所述"通过对话提交"的范围。

开源Editable-Design,让AI生图终于能改字、拖图层(在新窗口打开)
开源项目 Editable Design 结合视觉模型、HTML 代码与持续工作的 Agent,将 AI 生图重构为可编辑的设计文件,使文字可直接修改、图层可独立拖动,仓库展示了 14 组覆盖营销海报、信息设计等 6 类视觉任务的案例。

在南方医院,临床医生开始「造」AI工具(在新窗口打开)
南方医院临床医生借助华为与医院共建的HAIP平台及零代码Nexent智能体平台,在aHUS诊断、产科急症训练、肝癌MDT管理等场景中自主开发AI工具,推动医疗AI创新从技术主导转向临床需求驱动。

Anthropic接受OpenAI标准,智能体从此共用一份AGENTS.md(在新窗口打开)
Anthropic旗下Claude Code从2.1.277版本起支持源自OpenAI的AGENTS.md标准文件,允许与Codex等工具共享同一份项目指令文件,用户可通过/config切换加载行为。

实时编辑、实时互动视频双旗舰,Vidu S2发布即体验(在新窗口打开)
AI 视频,正在变成一个可以边播、边演、边改的实时系统。

GPT-6 Sol要来了?OpenAI本周或迎「发布狂潮」(在新窗口打开)
OpenAI 可能正在酝酿一次大规模产品更新。

谷歌连发两款实时语音模型:Gemini 3.8 Live 要攻克语音 Agent 的沉默时刻(在新窗口打开)
谷歌发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时语音模型,后者支持后台异步推理与工具调用以解决语音 Agent 在任务执行中的沉默问题,两款模型已在 Gemini API 和 Google AI Studio 向开发者开放。

首发|数千万元种子轮融资,Articuler.ai 在职场社交找到了真痛点(在新窗口打开)
AI职场社交平台Articuler.ai宣布完成数千万元种子轮融资,由麟阁创投领投,拙朴投资及小米联合创始人王川家族办公室跟投,聚焦线下活动场景的职业匹配需求。

自进化社媒Agent!浙大x北大:从多模态任务编排到反馈驱动(在新窗口打开)
当大模型已经能够快速生成文案、图片和视频,一个更进一步的问题是:Agent 能否从执行过的任务中积累经验,并在持续交互中改进后续行为?

复杂的Harness Evolution,甚至不如多跑几遍(在新窗口打开)
论文标题:Rethinking the Evaluation of Harness Evolution for Agents论文链接:https://arxiv.org/abs/2607.12227代码:https://github.com/rethinking-harness-evolution 博客:https://yikee.github.io/harnessevolution/ 一个 Agent 第一次没把任务做对。 接下来,你有五份额外的推理预算,可以有很多种花法。 你可以让它把同一道题重新做几遍,从多个结果里挑最好的;可以把上一次失败的过程交给它,让它接着修;也可以做一件听起来更



