
CVPR2026 | 鬼手想点谁就点谁?LaSM让GUI智能体把注意力「收回来」(在新窗口打开)
如果把手机屏幕想象成一个舞台,GUI 智能体就是台下那个 “被授权动手” 的人:它能看懂屏幕上的按钮、输入框和弹窗,能按你的指令去点、去滑、去输入。
内容栏目
分享不同 AI 工具、模型与相关技术的使用方法和实践文章。

如果把手机屏幕想象成一个舞台,GUI 智能体就是台下那个 “被授权动手” 的人:它能看懂屏幕上的按钮、输入框和弹窗,能按你的指令去点、去滑、去输入。

真赞叹啊,一行指令,而且,速度还贼快! 书游时代,一本书,一行指令,一个游戏 24年把刘和平的《大明王朝1566》书,以及剧都看完了,那时候就在想—— 如果我能扮演嘉靖帝,在纱幔之后操控严嵩和徐阶的生死;如果我能扮演海瑞,买好棺材写下那封骂皇帝的奏疏;如果我能扮演戚继光,用鸳鸯阵在台州把倭寇杀得片甲不留—— 那该多过瘾。要是体验不同角色,上体视角,更改结局,那多爽。 此刻实现了,就用了一行给claude code的指令! 这一行: “我想基于这个做一个沉浸式游戏,可以任意选角色,做出不同选择,大杀四方” 这是我唯一的输入。一行字,32个汉字,两个逗号。 一个完整的、可以玩的、有8个角色和7个章

就在大家都急头白脸地等待DeepSeek-V4的时候,冷不丁一篇新论文引起了网友们的注意—— 提出新稀疏注意力机制HISA(分层索引稀疏注意力),突破64K上下文的索引瓶颈,相比DeepSeek正在用的DSA(DeepSeek Sparse Attention)提速2-4倍。

生成式模型当检索器大材小用效果还不好? 当多模态大模型(MLLM)凭借强大的图文理解与逻辑推理能力成为AI领域的核心抓手,将其应用于图像检索尤其是组合图像检索(CIR)任务,本应是降维打击的最优解。 然而现实却相悖:把生成式大模型强行改造为判别式检索器后,模型会出现严重的能力退化,连原本100%能精准解决的问题都频频出错,生成式与判别式的范式冲突,成为大模型向检索领域落地的核心壁垒。 如今,这一行业难题被AI国家队紫东太初团队联合新加坡国立大学成功攻克。其最新研究成果ReCALL框架,凭借独创的“诊断-生成-校准”闭环体系,从根本上解决了大模型从生成式到判别式的范式冲突问题,让大模型在保留原生

OpenAI Codex 团队的产品规格文档只有 10 个要点。不是说每个功能的文档只有 10 个要点,而是整个产品的 spec 就这么多。设计师写的代码量超过了六个月前工程师写的。50 到 100 人的团队,直到最近才有了第二个产品经理。

通过一晚上的睡眠,AI 模型就能监控最多 130 种疾病。

大模型技术正在经历一场从 “对话助手” 向 “自主智能体(Agent)” 的深刻演进。智能体不再局限于被动地理解与生成,而是具备了多步规划、工具调用、长期记忆与管理物理 / 数字世界的能力,正逐步深度嵌入企业侧的核心业务流程。这意味着,AI 的边界已从虚拟屏幕的对话框,正式延伸到了真实的生产系统中。

人形机器人全身灵巧操作是通向通用具身智能的核心目标之一。在这一愿景下,机器人不仅需要双臂与高自由度多指灵巧手的精细协调,还需要与全身位姿(如行走、弯腰)进行动态配合。

最近,飞书、钉钉、企业微信接连推出 CLI,智能体生态战役再次打响。

来自复旦大学、上海创智学院的研究人员提出 LifeSim,一个面向个性化助手评测的长程用户生活模拟框架。LifeSim 同时建模用户内部认知过程与外部物理环境,生成连贯的生活轨迹、事件序列与多轮交互行为;在此基础上,研究团队进一步构建了 LifeSim-Eval,用于系统评测模型在长期个性化交互中的能力边界。

近日,Bessemer Venture Partners发布AI+生命科学路线图,分析今年AI医药的发展趋势。 该报告的核心观点是:AI正在彻底改变制药和生命科学行业,每年能创造超1000亿美元新价值,但目前只有5%的企业真正用起来。

快手的这篇论文,正是对这一问题交出的一份沉甸甸的工业级答卷。他们提出了 GR4AD(Generative Recommendation for ADvertising),一个横跨表征、学习、服务三大层面协同设计的生成式广告推荐系统,并已全量部署于快手广告平台,服务超过 4 亿用户。

AI不再只是把两个物体「放一起」,而是真正造出一个新实体。VMDiff模型通过分阶段策略:先拼接保留信息,再插值融合成整体,并自动调节平衡,让生成结果既像两者,又自然统一。 过去,很多图像生成模型都能同时画出两个物体;但要让它们真正「长成一个新物体」,其实远没有那么简单。

Harness(驾驭)的风,终究还是从大模型,吹到了机器人!

这两天,我被一张图反复种草。 就是终端里一打开,先蹦出一段很酷的 ASCII 动画——名字不是 Claude code,是你自己的品牌名、你自己的启动方式、你自己的欢迎语。 对啊,最近好多人都在玩 DIY Claude code,从源码开始一点点改,但我估计那要浪费不少词元,能不能做一个快速 DIY skill,给大家省点 token? 先说结果,我做出来了。上效果图: 为什么要自己搭一个? 官方 Claude Code 不是挺好用吗,为什么要折腾 DIY? 其实有一些实际场景:比如我想接 DeepSeek 或其他国产模型,但官方支持度不够;想给团队统一配一个内部版,不想每个人都走官方认证;或

去年讨论Agent落地时,重点往往是Context Engineering。大家都在琢磨怎么放 Few-shot,怎么优化 RAG 检索的文本片段。但随着 Agent 任务复杂度的上升,控制数据流向、工具调度和异常处理的底层脚手架代码,往往比单纯拼接文本对系统性能的影响更大。

3 月 31 日下午,技术圈炸了锅: Claude Code,这款被公认为当前最强的 AI 编程助手,因为一次内部失误,核心代码逻辑暴露在了全球开发者面前。

在现实世界中通过强化学习训练智能体,往往需要大量在线试错与环境探索,这不仅成本高昂,还可能带来显著安全风险:机器人可能因试错而损坏,自动驾驶的在线探索可能危及行车安全,而持续采集交互数据本身也代价巨大。

什么这code那code,先别code了,因为—— 中国最强编程模型来了!

在时间序列预测领域,深度模型如iTransformer、PatchTST虽然性能强劲,却长期困于“黑盒”困境——预测准,但说不出为什么。
参与交流
了解加入交流群的方式,阅读内容无需登录。