内容栏目

AI技术文章

分享不同 AI 工具、模型与相关技术的使用方法和实践文章。

「马嘉祺」让大模型翻车,而他一年前洗澡时就发现了问题

「马嘉祺」让大模型翻车,而他一年前洗澡时就发现了问题(在新窗口打开)

一家名为脸谱心智(FaceMind)的初创公司就在顶级学术会议 EMNLP 主会上系统性地揭示了这个问题,并给出了解法。更有意思的是,就在「马嘉祺」事件前不到两周,全球最强 AI 公司之一 Anthropic 也在自家产品中悄悄落地了一次高度相关的改造 —— 方向与脸谱心智一年前的论文几乎完全一致。

AI技术文章
0
让机器人动作流畅丝滑如「连音」,千寻智能高阳团队提出Legato,入选RSS 2026

让机器人动作流畅丝滑如「连音」,千寻智能高阳团队提出Legato,入选RSS 2026(在新窗口打开)

近日,千寻智能高阳团队的研究成果 《Learning Native Continuation for Action Chunking Flow Policies》 被机器人顶会 RSS 2026 接收!这项工作从训练机制出发,让机器人动作天然具有连续性,实现了 "连音" 般的流畅执行,在五个真实世界操作任务上超越了现有方法,为具身智能领域的动作生成研究提供了新的思路。

AI技术文章
0
大模型也需要睡觉!让AI打个盹,醒来更聪明

大模型也需要睡觉!让AI打个盹,醒来更聪明(在新窗口打开)

7×24,AI也吃不消。 卡内基梅隆大学和马里兰大学发了篇论文,《Language Models Need Sleep》—— 大模型处理长上下文的时候,硬撑着不休息,真的会累傻。 这项研究的灵感源自人脑运作机制。 人睡觉的时候海马体会把白天的短期记忆一遍遍回放,巩固进皮层突触,变成长期知识。 研究团队认为模型也可以这样,设计了一个睡眠机制,让大模型上下文窗口快满的时候别硬撑了,打个盹把最近的上下文反复咀嚼几遍,压缩进长期权重,清空缓存,醒了再接着干。 测试发现,合理增加“睡眠”迭代轮次,能明显提升模型在深度推理类任务上的表现。 尤其是那些需要一步接一步推导的难题,越复杂,模型越需要多睡一会儿。

AI技术文章
0
首次!DeepSeek-V4-Pro全参数后训练,被第三方在国产卡上跑通

首次!DeepSeek-V4-Pro全参数后训练,被第三方在国产卡上跑通(在新窗口打开)

近期,深圳河套学院(SLAI)AI训练平台项目团队,联合哈尔滨工业大学(深圳)、深圳大数据研究院、华为GTS(全球技术服务)团队与深智城AI算力平台,仅用1个月,共同基于昇腾910C国产算力集群实现DeepSeek-V4-Pro全参数续训练/SFT稳定运行,完成长稳训练1500+步,训练MFU超30%,关键训练算子效率提升14%。

AI技术文章
0

参与交流

查看 AINRK 交流群说明

了解加入交流群的方式,阅读内容无需登录。

查看交流群说明(在新窗口打开)