
李飞飞的世界模型,终于开始训练机器人了(在新窗口打开)
李飞飞老师的World Labs,补了块关键拼图。
内容栏目
分享不同 AI 工具、模型与相关技术的使用方法和实践文章。

李飞飞老师的World Labs,补了块关键拼图。

每逢重要的新模型发布,我们编辑部通常比新闻本身更早进入工作状态:提前打开官网、直播和社交媒体,等结果陆续出来,大家一边热火朝天地开始写文章,一边梳理参数、榜单和演示案例,判断这一次技术究竟向前走了多远。

鸿蒙PC用户终于不用再等。 就在上周,由华为2012实验室、华为云、终端小艺等团队联合构建的开源Al Agent平台openjiuwen又有新动向,其联合华为终端平板与PC产品线、软件部等团队,推出了JiuwenSwarm蜂群智能体的鸿蒙PC版本,这也是首个面向鸿蒙PC的开源AI统一工作台。 桌面办公、编程,不必再在多个应用间来回切换,一个工作台里就能派活、推进、交付。 同时openJiuwen社区还发布了人机协同的新范式HITS(Human in the Swarm)。 人不仅能站在团队外智慧(HOTS,Human on the Swarm),还可以和智能体共同组队,支持多人、多机协同。 这

是时候讨论一下 AI 的 “第三极”—— 社会智能了。

在真实工业环境中,数据并不是静止不变的。

大规模视频扩散模型,画面越来越真,却总在“物理定律”上栽跟头。

随着网络系统研究复杂度的提升,研究结果复现通常需要研究人员依据论文描述重新实现完整系统。

终于!Agent赛道,不再是自回归(AR)模型一家独大。

哈喽,大家好,我是刘小排。 刚才,有关注我 Token 消耗的小伙伴已经发现:我今天的 Codex 消耗突然很低。

一个Agent可以完整读过任务要求,亲手执行过失败命令,也能在十分钟前准确定位错误根因,但到了下一轮决策,它仍可能像第一次遇到问题一样重走旧路:再次写入已经确认不可写的目录,重新尝试已经被证伪的参数,或者修好局部测试后忘掉最初的验收条件。

给图像生成模型一张人物参考图,它大概率能抓住身份特征。

刚刚,BeingBeyond智在无界发布首个基于人类视频数据的隐式触觉世界动作模型—— Being-H0.8。

JEPA世界模型的底层是Yann LeCun自2017年起持续倡导的自监督学习(Self-Supervised Learning, SSL)。

即使到了人手 N 个 Agent 产品的时代,大部分人还在用 Agent 产品的默认搜索与策略。

还记得「苦涩的教训」(The Bitter Lesson)吗?

训练一个顶级文生图模型,到底需要多少钱?

让 Agent 上网查资料,已经不算新鲜事。

人类可以轻松想象一个还没做出的动作会带来什么:手一松,杯子会掉;往前一推,抽屉会合上。动作尚未发生,大脑已经预演了可能的结果。对机器人来说,具身世界模型(Embodied World Model)会根据当前观察和未来的动作,预测动作执行后的未来画面。

别无脑把Opus 5推理强度拉到max当冤大头。

上周我们发了一篇Agent大横评的文章三家评测,结果评论区出现了一个高频问题: “字节的TRAE Work建议测一下。”
参与交流
了解加入交流群的方式,阅读内容无需登录。