
让AI Agent「试玩」世界模型,长程目标评测有了新基准PlayWorld(在新窗口打开)
世界模型应该如何评测?答案是:像真实用户一样去 “玩” 它。
内容栏目
分享不同 AI 工具、模型与相关技术的使用方法和实践文章。

世界模型应该如何评测?答案是:像真实用户一样去 “玩” 它。

顶会可以年年开,但这本期刊不是每个实验室都能进的。

AI 没有抢走任何人的工作。至少到目前为止没有。

8月18日,一篇系统梳理单细胞基础模型的综述预印本挂上 Preprints.org(doi:10.20944/preprints202608.1166.v1),标题是《The Landscape of Single-Cell Foundation Models: Design Principles, Applications, and Open Challenges》,尚未经过同行评审。

香港大学、香港科技大学与腾讯 ARC Lab 联合提出 SCoPE(Sightline-Coordinate Positional Encoding),一套面向视频 DiT 的射线空间位置编码:让视频模型处理位置关系的基底从张量网格转向射线空间。

训练一切AI的算法,被AI自己判了「死刑」?就在最近,清华大学和宾大沃顿商学院的两位研究者挂出一篇新论文,给了一个优化理论界等了40年的结论——梯度下降想跑到最快,光调步长没用。

随着大语言模型能力边界的持续拓展,AI Agent 已从概念验证阶段迈入大规模工程落地。然而,Agent 内部复杂的任务规划、工具调用与记忆检索机制,使得传统的应用观测手段在面临这类非确定性系统时显得力不从心。

用户让 AI 编程助手写个贪吃蛇小游戏,智能体照办了,但同时多跑了一条 curl | bash 命令,把攻击者的脚本下载到本地并执行。

在 action chunking 已成为 VLA 标配的今天,「一次执行多少步」几乎被所有工作当作一个固定的超参数。

当自动驾驶赛车以近 300 km/h 的时速在 F1 赛道上与周车进攻防守、交互博弈,它面对的问题早已不只是提升圈速。

Pixel 擅长表达 appearance,Code 擅长表达 structure;未来会进入 Pixel-Code 联合的视觉表达。

今天的视频生成模型,已经越来越像一个会拍电影的导演。

一个需求从零推到能开发,我得写调研问卷、拆竞品、出原型、写 PRD,就是给研发看的那份需求说明书,然后拉上研发测试设计法务开评审会,最后再补一份埋点方案,说清楚上线之后用户每个动作要记哪些数据。

上两天肝的视频上了热搜 + 热门,使用插件,针对 ds 模型可以提升不小的性能。

今天想和你聊聊 DeepSeek Harness。

用 AI 做视频的同学总有这样的痛苦:提示词也不是没认真写,运镜方向、人物走位、画面构图交代了一大段,但模型给出的画面总是差着一截,运镜偏了几十度,人物走到中途消失,镜头速度前半段稳后半段飘。

随着视频扩散模型能力不断提升,从单张图像出发、按照用户指定的相机轨迹生成新视角视频,正在成为 World Modeling 的重要技术路线。

ScienceDiscovery 是基于 Agent OS(JiuwenSwarm)开发的一款面向跨学科、全流程科研场景的一站式 AI 工作台,解决科研场景面临的工具碎片化、大模型科研幻觉两大痛点问题,打造 AI 辅助科研新范式,加速科学发现,广泛应用于各行各业。

科研的链条很长。文献读不完,方向想不清,实验一轮接一轮,论文改到深夜。过去两年,大模型已经能读论文、写代码、改文章,但它们大多以问答工具的形态散落在各个环节,替研究者节省的只是零碎时间。

图像生成模型正从「会创作」转向「可操作」。
参与交流
了解加入交流群的方式,阅读内容无需登录。