
终于不用为GPU算力发愁了,10块钱训练一个GPT!(在新窗口打开)
前不久写了一期卡神做的 nanochat ,听朋友说咱们国产早就有类似的开源项目了:miniMind 。
内容栏目
分享不同 AI 工具、模型与相关技术的使用方法和实践文章。

前不久写了一期卡神做的 nanochat ,听朋友说咱们国产早就有类似的开源项目了:miniMind 。

“开组会是一场巨大的精神霸凌。” 哪怕毕业了这么多年,在社交软件看到这几个字的时候心里还是咯噔了一下… 毕竟,导师一句“这些文献你先读一读哈~”往往意味着:马上要啃几十页外文PDF、上百条术语、无数个长难句!!!!(难啊……) 就在我们“苦中作业”的时候,我发现了百度翻译里的一个隐藏板块——叫「文档翻译」,据说不仅翻译水平在线,支持200+种语言翻译,连文章的排版、格式都能高度还原? 这么好的功能当然不放过,我立刻把它拉进横评跑了一遍,测下来最直观的感受是—— 翻译够准、排版能打,连对照阅读都安排上了: 不仅如此,翻的时候旁边还挂着个AI助手,能一边总结文章内容、一边帮你划重点,嗯..感觉像是

大家都知道,图像生成和去噪扩散模型是密不可分的。高质量的图像生成都通过扩散模型实现。

在过去两年,大语言模型 (LLM) + 外部工具的能力,已成为推动 AI 从 “会说” 走向 “会做” 的关键机制 —— 尤其在 API 调用、多轮任务规划、知识检索、代码执行等场景中,大模型要想精准调用工具,不仅要求模型本身具备推理能力,还需要借助海量高质量、针对性强的函数调用训练数据。

智能体自进化,阿里开源了新成果。 通义实验室提出了一种能够自进化的智能体系统——AgentEvolver。 通过自我提问、自我导航、自我归因三个模块,AgentEvolver可以在开放环境中自主演化出行为能力。 在相同规模的14B模型上,AgentEvolver将基准模型的平均完成率从29.8%大幅提高到57.6%。 目前该系统已在GitHub上线,技术报告也同步发布,作者署名当中包括了阿里副总裁、阿里云智能CTO周靖人。 模型智能体效果飞升 从综合性能来看,AgentEvolver在AppWorld和BFCL v3等长程复杂任务基准测试中展现了惊人的爆发力。 以14B模型为基座,其任务平均完

无需重新训练,也能一键恢复模型的安全意识了。

人类高级视觉皮层在个体间存在显著的功能差异,而构建大脑编码模型(brain encoding models)—— 即能够从视觉刺激(如图像)预测人脑神经响应的计算模型 —— 是理解人类视觉系统如何表征世界的关键。传统视觉编码模型通常需要为每个新被试采集大量数据(数千张图像对应的脑活动),成本高昂且难以推广。

无需额外训练即可适配预训练生成模型的编辑方法,凭借灵活、高效的特性,已成为视觉生成领域的研究热点。这类方法通过操控 Attention 机制(如 Prompt-to-Prompt、MasaCtrl)实现文本引导编辑,但当前技术存在两大核心痛点,严重限制其在复杂场景的应用

MiniMax,今年真猛。 两周前,我在写 MiniMax M2 开源首发那篇文章的时候,当时就被它的性能和价格震撼到了——全球榜单第五,价格却只有 Claude 的 8%。 果然,M2 火了。 收到很多粉丝和朋友反馈,有人已经接入 Claude Code 在用,有人在 Cursor 里跑起来了,也有几个创业公司的伙伴把 AI 后端从 Claude 换成了 M2,大大节省了成本。 再说个数据,M2 发布仅有两周,在全球最大的 AI 模型聚合平台 OpenRouter 上,MiniMax M2 的 token 调用量已经冲到了 Top5,成为调用量最大的国产模型,增速也是最猛的。 OpenRou

Claude 近期发布的 Skills 功能很火,不少开发者都在尝试、试用。

在基础模型领域,模型规模与性能之间的缩放定律(Scaling Law)已被广泛验证,但模型增大也伴随着训练成本、存储需求和能耗的急剧上升。如何在控制参数量的前提下高效扩展模型,成为当前研究的关键挑战。

视频创作中,你是否曾希望复刻变成 Labubu 的特效,重现吉卜力风格化,跳出短视频平台爆火的同款舞蹈,或模仿复杂有趣的希区柯克运镜?

从浪漫订婚到失落痛哭,AI爱情正在撕开新的社会裂缝。在哈佛MIT,一项研究揭示:AI伴侣既能抚慰孤独,也可能让人陷入依赖。当《Her》变成现实,我们或许才刚刚面对真正的挑战。

AI智能体正把医疗AI从「看片子」升级成会思考、能行动的「医生搭档」。研究人员发表的最新综述,用通俗语言拆解智能体如何读懂多模态数据、像专家一样规划决策,又能扮演医生、护士、健康管家等多重角色;同时提醒:越智能越危险,必须配套严格评估、隐私保护与伦理护栏,才敢让它走进真实诊疗。

近年来,以 Veo、Sora 为代表的视频生成模型展现出惊人的合成能力,能够生成高度逼真且时序连贯的动态画面。这类模型在视觉内容生成上的进步,表明其内部可能隐含了对世界结构与规律的理解。更令人关注的是,Google 的最新研究指出,诸如 Veo 3 等模型正在逐步显现出超越单纯合成的 “涌现特性”,包括感知、建模和推理等更高层次能力。

本周,美国具身智能创业公司 Physical Intelligence(简称 PI 或 π)发布了旗下的最新机器人基础模型 π*0.6。PI 是一家总部位于旧金山的机器人与 AI 创业公司,其使命是将通用人工智能从数字世界带入物理世界:他们的首个机器人通用基础模型名为 π₀,让同一套软件控制多种物理平台执行各类任务。

AI Agent 在处理复杂任务时经常“掉链子”。你刚告诉它的信息,它很快就忘了。给它的工具越多,它反而越混乱。这不是个例。

是金山派来的猴子,复杂文档解析有救了! 2025年6月以来,多模态文档解析领域迎来新一轮研究热潮,该方向逐渐成为多模态理解及大模型数据来源的重要前沿课题。 在数字化办公与AI技术深度融合的今天,文档智能解析技术已成为信息抽取、检索增强生成和自动化文档分析的核心基石。然而,现实世界中的文档往往布局复杂、表格嵌套、内含图片公式,甚至跨页分布,这让许多现有的OCR(光学字符识别系统,Optical Character Recognition)系统感到棘手。 MonkeyOCR v1.5是一个全新的统一视觉-语言文档解析框架。它在全能多模态文档解析基准OmniDocBench v1.5,OCRFlux

今年 2 月,月之暗面提出了一种名为 MoBA 的注意力机制,即 Mixture of Block Attention,可以直译为「块注意力混合」。

单Transformer搞定任意视图3D重建!
参与交流
了解加入交流群的方式,阅读内容无需登录。