内容栏目

AI技术文章

分享不同 AI 工具、模型与相关技术的使用方法和实践文章。

文献、报告、合同翻译的老大难被国产工具治了?三大翻译神器横评后,这家稳得离谱

文献、报告、合同翻译的老大难被国产工具治了?三大翻译神器横评后,这家稳得离谱(在新窗口打开)

“开组会是一场巨大的精神霸凌。” 哪怕毕业了这么多年,在社交软件看到这几个字的时候心里还是咯噔了一下… 毕竟,导师一句“这些文献你先读一读哈~”往往意味着:马上要啃几十页外文PDF、上百条术语、无数个长难句!!!!(难啊……) 就在我们“苦中作业”的时候,我发现了百度翻译里的一个隐藏板块——叫「文档翻译」,据说不仅翻译水平在线,支持200+种语言翻译,连文章的排版、格式都能高度还原? 这么好的功能当然不放过,我立刻把它拉进横评跑了一遍,测下来最直观的感受是—— 翻译够准、排版能打,连对照阅读都安排上了: 不仅如此,翻的时候旁边还挂着个AI助手,能一边总结文章内容、一边帮你划重点,嗯..感觉像是

AI技术文章
0
登顶开源SOTA!上交大&小红书LoopTool实现工具调用任务的「数据进化」

登顶开源SOTA!上交大&小红书LoopTool实现工具调用任务的「数据进化」(在新窗口打开)

在过去两年,大语言模型 (LLM) + 外部工具的能力,已成为推动 AI 从 “会说” 走向 “会做” 的关键机制 —— 尤其在 API 调用、多轮任务规划、知识检索、代码执行等场景中,大模型要想精准调用工具,不仅要求模型本身具备推理能力,还需要借助海量高质量、针对性强的函数调用训练数据。

AI技术文章
0
周靖人署名,通义实验室开源智能体自进化系统:让模型学会“自我反思”,14B也能越级打怪

周靖人署名,通义实验室开源智能体自进化系统:让模型学会“自我反思”,14B也能越级打怪(在新窗口打开)

智能体自进化,阿里开源了新成果。 通义实验室提出了一种能够自进化的智能体系统——AgentEvolver。 通过自我提问、自我导航、自我归因三个模块,AgentEvolver可以在开放环境中自主演化出行为能力。 在相同规模的14B模型上,AgentEvolver将基准模型的平均完成率从29.8%大幅提高到57.6%。 目前该系统已在GitHub上线,技术报告也同步发布,作者署名当中包括了阿里副总裁、阿里云智能CTO周靖人。 模型智能体效果飞升 从综合性能来看,AgentEvolver在AppWorld和BFCL v3等长程复杂任务基准测试中展现了惊人的爆发力。 以14B模型为基座,其任务平均完

AI技术文章
0
NeurIPS 2025 | 上下文元学习实现不微调跨被试脑活动预测

NeurIPS 2025 | 上下文元学习实现不微调跨被试脑活动预测(在新窗口打开)

人类高级视觉皮层在个体间存在显著的功能差异,而构建大脑编码模型(brain encoding models)—— 即能够从视觉刺激(如图像)预测人脑神经响应的计算模型 —— 是理解人类视觉系统如何表征世界的关键。传统视觉编码模型通常需要为每个新被试采集大量数据(数千张图像对应的脑活动),成本高昂且难以推广。

AI技术文章
0
MiniMax M2 太猛了,推出9.9元编程套餐,又打中开发者心趴!

MiniMax M2 太猛了,推出9.9元编程套餐,又打中开发者心趴!(在新窗口打开)

MiniMax,今年真猛。 两周前,我在写 MiniMax M2 开源首发那篇文章的时候,当时就被它的性能和价格震撼到了——全球榜单第五,价格却只有 Claude 的 8%。 果然,M2 火了。 收到很多粉丝和朋友反馈,有人已经接入 Claude Code 在用,有人在 Cursor 里跑起来了,也有几个创业公司的伙伴把 AI 后端从 Claude 换成了 M2,大大节省了成本。 再说个数据,M2 发布仅有两周,在全球最大的 AI 模型聚合平台 OpenRouter 上,MiniMax M2 的 token 调用量已经冲到了 Top5,成为调用量最大的国产模型,增速也是最猛的。 OpenRou

AI技术文章
0
医疗AI智能体全面综述:行业爆发,年增长130%!

医疗AI智能体全面综述:行业爆发,年增长130%!(在新窗口打开)

AI智能体正把医疗AI从「看片子」升级成会思考、能行动的「医生搭档」。研究人员发表的最新综述,用通俗语言拆解智能体如何读懂多模态数据、像专家一样规划决策,又能扮演医生、护士、健康管家等多重角色;同时提醒:越智能越危险,必须配套严格评估、隐私保护与伦理护栏,才敢让它走进真实诊疗。

AI技术文章
0
视频模型真在推理,还是「表演」推理?港中文等质疑:Chain-of-Frame是真的吗?

视频模型真在推理,还是「表演」推理?港中文等质疑:Chain-of-Frame是真的吗?(在新窗口打开)

近年来,以 Veo、Sora 为代表的视频生成模型展现出惊人的合成能力,能够生成高度逼真且时序连贯的动态画面。这类模型在视觉内容生成上的进步,表明其内部可能隐含了对世界结构与规律的理解。更令人关注的是,Google 的最新研究指出,诸如 Veo 3 等模型正在逐步显现出超越单纯合成的 “涌现特性”,包括感知、建模和推理等更高层次能力。

AI技术文章
0
真机RL!最强VLA模型π*0.6来了,机器人在办公室开起咖啡厅

真机RL!最强VLA模型π*0.6来了,机器人在办公室开起咖啡厅(在新窗口打开)

本周,美国具身智能创业公司 Physical Intelligence(简称 PI 或 π)发布了旗下的最新机器人基础模型 π*0.6。PI 是一家总部位于旧金山的机器人与 AI 创业公司,其使命是将通用人工智能从数字世界带入物理世界:他们的首个机器人通用基础模型名为 π₀,让同一套软件控制多种物理平台执行各类任务。

AI技术文章
0
金山与华科发布多模态模型MonkeyOCR v1.5:文档解析能力超越PaddleOCR-VL,复杂表格解析首次突破90%

金山与华科发布多模态模型MonkeyOCR v1.5:文档解析能力超越PaddleOCR-VL,复杂表格解析首次突破90%(在新窗口打开)

是金山派来的猴子,复杂文档解析有救了! 2025年6月以来,多模态文档解析领域迎来新一轮研究热潮,该方向逐渐成为多模态理解及大模型数据来源的重要前沿课题。 在数字化办公与AI技术深度融合的今天,文档智能解析技术已成为信息抽取、检索增强生成和自动化文档分析的核心基石。然而,现实世界中的文档往往布局复杂、表格嵌套、内含图片公式,甚至跨页分布,这让许多现有的OCR(光学字符识别系统,Optical Character Recognition)系统感到棘手。 MonkeyOCR v1.5是一个全新的统一视觉-语言文档解析框架。它在全能多模态文档解析基准OmniDocBench v1.5,OCRFlux

AI技术文章
0

参与交流

查看 AINRK 交流群说明

了解加入交流群的方式,阅读内容无需登录。

查看交流群说明(在新窗口打开)