
突破万次连续编辑极限!中科院提出首个理论保稳的知识保留方法(在新窗口打开)
LyapLock首次让大模型在上万次知识更新中稳住旧记忆、精准学新知。它用「虚拟队列」实时监控遗忘风险,动态平衡新旧知识,理论保证长期不崩盘,编辑效果比主流方法提升11.89%,还能赋能现有模型,让AI真正学会「持续成长」。
内容栏目
分享不同 AI 工具、模型与相关技术的使用方法和实践文章。

LyapLock首次让大模型在上万次知识更新中稳住旧记忆、精准学新知。它用「虚拟队列」实时监控遗忘风险,动态平衡新旧知识,理论保证长期不崩盘,编辑效果比主流方法提升11.89%,还能赋能现有模型,让AI真正学会「持续成长」。

上周有个朋友跟我吐槽,说他们线上跑的 Agent,单次任务 token 消耗到了六位数。

随着大语言模型 Agent 开始在对话、问答与复杂交互环境中长期运行,“记忆该如何设计” 正在成为一个绕不开的核心问题。

一段几十秒的音视频,上万Token,一半以上是冗余——Omni-LLM的计算浪费,比想象中更严重。

近年来,大规模视频扩散模型在视频生成领域取得了显著进展。然而,采样效率低下仍然是这类模型的核心瓶颈。

当前,大语言模型(LLMs)和视觉语言模型(VLMs)在语义领域的成功未能直接迁移至物理机器人,归根结底在于其互联网原生的基因。

对比学习已成为表征学习中的一种强大范式,能够在不依赖标签的情况下有效利用无标注数据。

朋友们,先问你们个问题:你们的 Claude Code 里装了多少个 skills?
![[小山译] Claude Skill 编写与实战指南](https://ainrk.com/uploads/a659f881_1cf1_11f1_af9f_fa163e47d677_b88fc161d6.webp)
最近沉迷折腾龙虾,想把日常工作都 Skill 化,试了挺多方法都不怎么好用。正好最近 Anthropic 出了一份官方指南,我边学边翻,分享给你。

最近在研究 OpenClaw,这个工具的火热程度不用再赘述。

让AI像Kaggle顶尖选手一样设计算法,需要几步?

大家是否有这样的感觉?给定几张场景中拍摄的图片,往往能够在脑海中想象出这个场景的三维布局,然而当前的多模态大模型还停留于纯文本或者 2D 视觉的推理表示,限制了图像中隐含几何结构的表达能力。

扩散模型终于学会“看题下菜碟”了! 一直以来,文生图模型都是“凭直觉”作画——不管提示词是“黑色的天空”还是“梵高风格的漩涡星空”,都死板地用同一套固定步数采样。 结果就是:简单题算力过剩,复杂题细节崩坏。 中国联通数据科学与人工智能研究院联合高校提出的新框架“轨迹链”(CoTj),彻底打破了这一僵局。它让扩散模型拥有了“系统2”的规划能力,能根据提示词的复杂程度,动态分配计算资源。 更颠覆的是,在5步的极端压缩下,CoTj规划出的轨迹配上最朴素的1阶求解器,画质居然吊打了传统方法配高阶求解器——证明“找对路”比“用什么交通工具”更重要。 目前,该研究的论文已在arXiv发布,推理代码也已开源

NUS、ZJU、UW、Stanford、CUHK 联合提出 「ThinkMorph」,主张让文字与图像在统一架构里「原生协作」、「共同演化」,而不是像当下大多数多模态模型那样,看完图像就闭上眼睛,后续完全靠文字链条推进。仅用 2.4 万条数据微调 7B 统一模型,视觉推理平均提升 34.74%,多项任务比肩甚至超越 GPT-4o 和 Gemini 2.5 Flash。

用强化学习微调扩散模型,还有更好的办法吗?

如果有价值 $100 万美金的顶级专家任务,AI 能完成其中多少?

三年前,我们发布了这份榜单的第一版,目标很简单:找出哪些生成式 AI 产品真正被主流消费者使用。在当时,「AI 原生」公司和其他公司之间的界限很清晰。ChatGPT、Midjourney 和 Character.AI 都是围绕基础模型从零构建的产品,而软件行业的其他玩家还在摸索这项技术该怎么用。

视频生成进入大规模时代,但计算成本也炸了。

DragStream,首次实现视频生成时的实时拖拽编辑。用户可随时拖动画面中的物体,自由平移、旋转或变形,系统自动保持后续帧连贯自然,无需重训模型,无缝适配主流AI视频生成器,真正实现「所见即所得」。

如果你在过去一年关注过大模型训练的技术,大概率听过 Muon 这个名字 —— 这个在月之暗面 K2 模型的相关讨论中走红的优化器,被视为是可能挑战 Adam 的新秀。它的思路很直接:对动量矩阵进行正交化,让各个奇异方向上的更新速率一致,提升训练效率。
参与交流
了解加入交流群的方式,阅读内容无需登录。