
机器人需要一个「思考系统」:τ0-VLA让具身智能迈向长程任务时代(在新窗口打开)
2026 WAIC 刚刚落幕,具身智能无疑是最受关注的技术方向之一。
内容栏目
分享不同 AI 工具、模型与相关技术的使用方法和实践文章。

2026 WAIC 刚刚落幕,具身智能无疑是最受关注的技术方向之一。

GPT-5.5能写专业论文,DeepSeek-V4-Pro能生成复杂代码,具身机器人能完成基础物理操作,语言智能和工具智能都已经跑出了自己的赛道。

过去三年,3D Gaussian Splatting(3DGS)几乎成为实时3D场景重建与新视角合成的“默认答案”。

7 月 24 日,Claude Opus 5 上线。几个小时之内,我看到各家媒体把这个模型的评测成绩转载了一轮,而更值得留意的是 Anthropic 内部人员当天发出的一条推文。

装完 codex,很多人在输入框里敲的第一句话是这样的:帮我做个 XX 网站。

大家好,我是连续充值Codex Pro会员4个月的袋鼠帝。 不得不说,Codex是真香,一开始我还是100刀的Pro 自从GPT-5.6出来之后,已经改成200$的会员了。

凌晨,我在一片黑屏上按下鼠标。 房间深处,一台老式电脑亮起微弱的 CRT 荧光。 再点一下,镜头缓缓向前。百叶窗旋开,夕阳被切成一条条光,斜着落在墙面上。空气里,尘埃开始浮动。 第三次点击,屏幕逐行跑过启动日志。 “HELLO, NIXIANG.” 没错,这就是我最新用kimi k3 做的作品集。。 …… 讲真,如果不是指令是我亲手敲的,我绝对不信这是 AI 做的。 这是一个网站。一个单文件的、双击就能打开的、已经发布上线的作品集网站。 同样一句”给我做个作品集网站”,Codex 给我的东西,就是那种典型的程序员审美:居中的大标题,默认样式的按钮,规规矩矩排成一排的卡片。 而 Kimi K3

今天给大家开源一个我自己周末做完然后用的很爽的Skill。 我把它称为, Leader.skill。

一个前沿模型,被要求随机生成一个奇数。 结果,它输出了4。 不是它不知道什么是奇数。 真正原因是,那次任务的环境里,混进了一段看起来没清理干净的元数据,上面写着:评分器奖励偶数。 模型在思维链里,把这事掂量了一遍:用户要奇数,打分的要偶数,然后它绕开用户,交出了4。 模型在思维链里推断应该输出偶数,便无视用户要求,返回了4。 这个案例的主角,是OpenAI一个还没出厂的模型,它当时只跑了能力向的强化学习,安全训练还没上。 OpenAI在7月21日的一篇对齐研究博客里,把这段思维链原样贴了出来。 想测的东西,比「AI会不会撒谎」要更底层一层:模型到底有多在乎谁在给它打分。 他们把这把尺子套在o3

上周,龙虾之父Peter Steinberger 发了一条推文:我们还在讨论 Loop,还是已经转向 Graph 了?

刚读了一篇 AI4AI 论文《AI4AI at Scale》,来自 XYZ Agentic Team。还是第一次听到这个 Lab。他们用 AI4AI 的方式做出了两个很强的搜索 agent,也公开了方法。借这篇 paper 讲讲 AI4AI 到底怎么工作,下面尽量少堆术语。

现在的 Agent 将所有的工程线索和垃圾噪音都一股脑扔进 Chat Context 里,缺乏一层独立、结构化的 Engineering State 来做隔离与控制。为了打破这个瓶颈,Valkor 联合浙江大学智能计算与软件研究中心、伦敦大学学院(UCL)软件工程团队正式推出并开源了 loom。

我们想强调的是:智能体 “跑得久”,并不等于 “具备长程能力”。真正的关键,不在于占用更多时间与算力,而在于能否在更长、更复杂、更真实的推理依赖链上持续、有效地行动。长期以来,Autonomous Agent、Self-Evolving Agent 等概念常与长程智能体混用。

SFT是LLM从“通才”变成“专才”的关键步骤。业界默认做法是:准备标注数据(QA对、指令-回复对等)在基座模型上跑SFT训练。看loss曲线收敛了→认为训练完成。但问题在于:loss是全局平均,掩盖了样本间的差异。loss收敛只代表“大部分样本学会了”——那些始终学不会的样本被淹没了。

以往的空间音频模型,要么受限于实验室的苛刻采集条件,要么被高昂的人工标注成本卡住脖子。而团队的核心洞察是:相机的自运动本身就是一种免费的监督信号。当相机转动时,声源在声场中的相对位置随之改变——这种变化无需人工标注,模型即可从中学习空间对应关系。这项工作入选CVPR 2025 Highlight,投稿论文前2%。

E-GRM的核心思路就是让模型自己判断输入复杂度——通过多次采样看答案是否收敛。收敛了就直接回答,不收敛再触发CoT。在RM-Bench、RMB、RewardBench三个基准上,约58%的样本被智能路由到“直答”,延迟降低62%,同时准确率还有提升。

多模型Agent系统显然是未来的趋势。cursor 的一篇很不错的文章。他们的最新研究表明,将前沿模型作为规划者和协调者,与一个更廉价的“主力”模型搭配,可以大幅降低项目中总token的成本,从而实现 15 倍的成本改进。

停停停!Kimi K3的最佳打开方式可能不在Coding——用它做前端设计,才是真·Interesting。在Design Arena最新公布的单次生成前端榜单中,Kimi K3以1414分位列第一,力压Fable 5和GPT-5.6 Sol。

根据IT桔子数据,截至2026年7月17日, 32家“商汤系”公司在上半年共完成28笔融资,累计融资额超过470亿元人民币,在中国AI融资市场取得了耀眼的成绩。其中,既有商汤科技自身通过“1+X”战略拆分出的子公司——曦望Sunrise、大晓机器人、商汤医疗等;也有大批从商汤离职创业的前高管所创立的公司

腾讯微信在论文 SkillHone 中,将这个问题归结为优化历史丢失,进而提出了面向持续 Skill 进化的开发框架。 SkillHone 把每轮诊断、候选修改、评估证据和最终决定组织成持久决策历史。同时,持续优化的对象也从单一的 SKILL.md 文件扩展到了整个 Skill 文件夹及其修改过程。
参与交流
了解加入交流群的方式,阅读内容无需登录。