内容栏目

AI技术文章

分享不同 AI 工具、模型与相关技术的使用方法和实践文章。

突破一亿Token极限:EverMind提出MSA架构,实现大模型高效端到端长时记忆

突破一亿Token极限:EverMind提出MSA架构,实现大模型高效端到端长时记忆(在新窗口打开)

人的智能能力主要由推理能力和长期记忆能力构成。近年来,大模型的推理能力一直处于快速发展过程,但大模型的长期记忆能力一直受限于上下文长度,无法取得突破。在历史上,曾经有多种路线进行尝试,但都无法突破扩展性(Scalability)、精度(Precision)和效率(Efficiency)的不可能三角。

AI技术文章
0
第二代PPTAgent来了!中科院软件所开源首个本地通用幻灯片智能体,9B参数打平GPT-5

第二代PPTAgent来了!中科院软件所开源首个本地通用幻灯片智能体,9B参数打平GPT-5(在新窗口打开)

天下苦 PPT 久矣。 体验过市面上各种 AI 生成 PPT 工具的人,往往都会遇到同样的痛点:排版崩坏、内容空洞、经不起推敲。 为什么会这样?因为目前的通用大语言模型(LLM)写 PPT,本质上是在对话框里 “盲写” 代码或文本。它们既没有真正的 “手” 去查阅权威文献,也没有真正的 “眼睛” 去审视自己排版出来的最终效果。 近日,中国科学院软件研究所中文信息处理实验室开源了第二代 PPTAgent -- DeepPresenter。这是业界首次将幻灯片智能体模型与完整的智能体沙箱环境一同开源,更能支持在单张 3090/MAC 上一键部署。它彻底重构了 AI 制作 PPT 的逻辑,让智能体不

AI技术文章
0
腾讯纯文本LLM训视觉encoder,拿捏图表长视频,达到开源小模型SOTA!

腾讯纯文本LLM训视觉encoder,拿捏图表长视频,达到开源小模型SOTA!(在新窗口打开)

打破多模态视觉+语言拼接套路! 腾讯开源Penguin-VL,直接用纯文本LLM训视觉编码器。 这项研究跳出了先有传统视觉 backbone,再接语言模型的常规路径,直接从text-only LLM初始化vision encoder。 并在2B/8B紧凑参数规模下的文档理解、长视频时序定位等复杂任务中表现出极强竞争力。 从LLM出发的视觉编码器重构 如果把这两年的多模态模型拆开看,一个很有意思的现象是: 大家在语言模型上卷得很凶,但到了vision encoder这一层,路线却出奇一致。 很多VLM最后都会回到那套熟悉配方,先拿CLIP、SigLIP这类通过对比学习训出来的视觉模型做encod

AI技术文章
0
TPAMI 2026 | 仅用两个变量破解混杂因素:CIC实现动力学因果推断与混杂变量重构

TPAMI 2026 | 仅用两个变量破解混杂因素:CIC实现动力学因果推断与混杂变量重构(在新窗口打开)

从观测时间序列数据中准确识别因果关系,是生命科学、地球科学、经济学以及人工智能等诸多领域的核心科学问题。尤其在复杂生物系统中,基因、蛋白质和代谢物之间高度耦合,并常常受到大量不可观测因素的干扰——这些「隐形混杂」无法被直接测量,却会严重误导因果推断结果,产生虚假的因果关联。

AI技术文章
0

参与交流

查看 AINRK 交流群说明

了解加入交流群的方式,阅读内容无需登录。

查看交流群说明(在新窗口打开)