内容栏目

AI技术文章

分享不同 AI 工具、模型与相关技术的使用方法和实践文章。

北大彭一杰教授课题组提出RiskPO,用风险度量优化重塑大模型后训练

北大彭一杰教授课题组提出RiskPO,用风险度量优化重塑大模型后训练(在新窗口打开)

当强化学习(RL)成为大模型后训练的核心工具,「带可验证奖励的强化学习(RLVR)」凭借客观的二元反馈(如解题对错),迅速成为提升推理能力的主流范式。从数学解题到代码生成,RLVR 本应推动模型突破「已知答案采样」的局限,真正掌握深度推理逻辑 —— 但现实是,以 GRPO 为代表的主流方法正陷入「均值优化陷阱」。

AI技术文章
0
谢赛宁新作:VAE退役,RAE当立

谢赛宁新作:VAE退役,RAE当立(在新窗口打开)

谢赛宁团队最新研究给出了答案——VAE的时代结束,RAE将接力前行。其中表征自编码器RAE(Representation Autoencoders)是一种用于扩散Transformer(DiT)训练的新型自动编码器,其核心设计是用预训练的表征编码器(如DINO、SigLIP、MAE 等)与训练后的轻量级解码器配对,从而替代传统扩散模型中依赖的VAE(变分自动编码器)。

AI技术文章
0
灵巧手能帮女友拧瓶盖了!同济清华上海交大等新成果 | CoRL 2025

灵巧手能帮女友拧瓶盖了!同济清华上海交大等新成果 | CoRL 2025(在新窗口打开)

灵巧手技能+1,能帮女友拧瓶盖了! 不仅如此,还能帮忙挤牙膏、插充电器。 来自同济大学、清华、上海交大、香港大学等研究团队提出面向灵巧操作任务的示教与策略学习新方法KineDex框架—— 真·手把手指导的方式,让人类动作直接传递到灵巧手,并同步采集高保真触觉信息。 结果让星动纪元灵巧手星动XHAND 1成功解锁了各种复杂精细操作。 在瓶盖旋紧、牙膏挤压、注射器按压等九项复杂任务中,KineDex平均成功率达74.4%,且数据采集效率相较于遥操提升两倍以上。 该论文已被CoRL 2025接收。 真·手把手引导灵巧操作学习 当前,机器人学习精细操作(尤其那种需要精确力度控制的任务)的难点在于缺乏高

AI技术文章
0

参与交流

查看 AINRK 交流群说明

了解加入交流群的方式,阅读内容无需登录。

查看交流群说明(在新窗口打开)