内容栏目

AI技术文章

分享不同 AI 工具、模型与相关技术的使用方法和实践文章。

TPAMI 2026 | 北大彭宇新团队提出CPL++框架,实现视觉定位模型的「自知之明」和「自我纠错」

TPAMI 2026 | 北大彭宇新团队提出CPL++框架,实现视觉定位模型的「自知之明」和「自我纠错」(在新窗口打开)

本文是北京大学彭宇新教授团队在视觉定位方向的最新研究成果,相关论文已被顶级国际期刊 IEEE TPAMI 接收。为视觉定位模型赋予「自知之明」能力 —— 通过自监督的关联校正与验证模块,在训练过程中动态识别、衰减并纠正错误的监督信号。大量实验证明,让模型学会「自我纠错」,是突破弱监督视觉定位瓶颈的有效途径。

AI技术文章
0
我给星露谷的 NPC 接入了 Hermes Agent

我给星露谷的 NPC 接入了 Hermes Agent(在新窗口打开)

我和周围朋友都特别爱玩《星露谷物语》。 这个游戏特别上头。种菜、钓鱼、挖矿、跟村里的人聊天,日出而作日落而息,有一种田园牧歌的治愈感,跟我的日常生活极其反差。是我个人爱好榜第三,(第一老头环,第二塞尔达) 但玩久了会发现一个问题,NPC 太呆了。 他们永远只有那几句台词,今天问他「今天过得怎么样」,明天再问,答案一模一样。你送他礼物,他说谢谢,你不送,他也不记得。你没法真的跟阿比盖尔聊天,只能看固定的动画。 我跟朋友吐槽了好几次:这 NPC要是能「活」过来就好了。 前几天 Hermes Agent 发布之后,我突然想到一件事,能不能给星露谷的 NPC 都接入 Hermes Agent? 29

AI技术文章
0
万帧实时!流式3D重建天花板,被国产开源模型打破了

万帧实时!流式3D重建天花板,被国产开源模型打破了(在新窗口打开)

蚂蚁灵波,下了盘大棋。 今年 1 月,蚂蚁灵波一口气开源了 4 款大模型,包括高精度空间感知模型 LingBot-Depth、具身大模型 LingBot-VLA 与具身世界模型 LingBot-VA,以及世界模型 LingBot-World。 其中,LingBot-Depth 负责从图像中估算深度、感知空间距离,LingBot-World 负责对环境进行模拟和理解,LingBot-VLA/VA 负责机器人的决策和动作控制。 这四款模型「各司其职」,分别覆盖感知底层、环境理解和行动输出,但中间一直缺少一个关键环节,就是如何把连续的感知数据实时构建成稳定的三维空间模型,让后续模块有据可依。 现在,

AI技术文章
0
训练提速4.6倍!FP4+BF16双轨并行,NVIDIA×港大×MIT联手重新定义扩散模型训练速度上限

训练提速4.6倍!FP4+BF16双轨并行,NVIDIA×港大×MIT联手重新定义扩散模型训练速度上限(在新窗口打开)

当强化学习后训练的大规模 rollout 已经被证明能够提升图像生成模型的偏好对齐能力,推理负担就成了制约训练速度的核心瓶颈。来自 NVIDIA、港大和 MIT 的团队提出的 Sol-RL,通过「FP4 先探索、BF16 再训练」的后训练框架,将达到等效 reward 水平的收敛速度最高提升到 4.64x,在训练速度与对齐效果之间给出了一条更具工程可行性的解法。

AI技术文章
0
1.8万部漫剧上线、行业拐点已至,Vidu发布AI漫剧白皮书

1.8万部漫剧上线、行业拐点已至,Vidu发布AI漫剧白皮书(在新窗口打开)

如何工业化生产AI漫剧。 根据《AI 漫剧视频模型行业白皮书 - v1.0》,2025 年市场规模预计达 168 亿元,同比增长超 80%,高速增长的市场吸引大量从业者进入,月度内容供给量从 2024 年的约 0.3 万部,激增至约 1.8 万部。与此同时,AI 技术在漫剧生产环节的渗透率已提升至 60%-85%,制作成本下降 50%-75%,生产周期缩短至传统模式的 1/3,进一步搅动市场。 在供给极大丰富的当下,AI 漫剧行业也从“产能井喷期”迈入“质量竞争与价值深化期”,依托 Vidu 在 AI 漫剧行业的引领性实践经验,结合 AI 漫剧行业发展现状与核心痛点,AI 新榜联合生数科技旗下

AI技术文章
0
「双线实测」Qwen 3.6-Plus,Agentic Coding 已经这么能“扛活儿”了?

「双线实测」Qwen 3.6-Plus,Agentic Coding 已经这么能“扛活儿”了?(在新窗口打开)

全球最强编程模型,中国造。 你可以从同事.skill 的爆火中看到两种截然不同的时代情绪,其一固然是对 Markdown 文件“大变活人”这一魔幻现实的试探,而反面则是如今对模型能力的评价,已经离不开工作级任务的场景。 “AI 能不能替代程序员”的老生常谈之下,今天的真问题是,国产大模型能在多大程度上接管开发工作流。 这背后是一个被反复验证的痛点:当 AI Agent 被放进真实项目,它并没有想象中那么“能扛活”。它能开始任务,但执行过程反复中断,多轮对话后上下文丢失,结果前后不一致。面对非标准需求时,工具调用也频频失误。你一觉醒来,发现流程早已卡死,标准结局总是如此。 问题的根源不在 Age

AI技术文章
0

参与交流

查看 AINRK 交流群说明

了解加入交流群的方式,阅读内容无需登录。

查看交流群说明(在新窗口打开)