内容栏目

AI技术文章

分享不同 AI 工具、模型与相关技术的使用方法和实践文章。

AI模型大战:Gemini 3 Pro、GPT-5.1-Codex-Max与Claude Sonnet 4.5如何选择?

AI模型大战:Gemini 3 Pro、GPT-5.1-Codex-Max与Claude Sonnet 4.5如何选择?(在新窗口打开)

前沿AI竞赛在2025年11月达到高潮。48小时内,谷歌推出Gemini 3 Pro宣称在主要推理基准测试中领先,而OpenAI立即用GPT-5.1-Codex-Max反击,这是一款专门训练用于通过创新"压缩"(compaction)技术自主工作超过24小时的专业编码模型[43]。加上Claude Sonnet 4.5已确立的编码统治地位和激进的安全过滤器,开发者面临前所未有的选择:

AI技术文章
0
4K超分Agent修图师来了!一键救活所有模糊照片

4K超分Agent修图师来了!一键救活所有模糊照片(在新窗口打开)

由德克萨斯A&M大学、斯坦福大学、Snap公司、CU Boulder大学、德克萨斯大学奥斯汀分校、加州理工大学、Topaz Labs以及加州大学Merced分校的研究者联合提出的基于AI智能体的方法4KAgent针对不同类型的图像以及需求对图像进行智能修复并放大到4K分辨率,带来优秀的视觉感知效果。该工作已被NeurIPS 2025接收。

AI技术文章
0
分割一切并不够,还要3D重建一切,SAM 3D来了

分割一切并不够,还要3D重建一切,SAM 3D来了(在新窗口打开)

沉默后爆发? 深夜,Meta 有了重大更新,接连上线 SAM 3D、SAM 3(Segment Anything Model,SAM)。 其中,SAM 3D 是 SAM 系列的最新成员,它将人们对图像的 3D 理解带入通俗易懂的世界,其包含两个模型: SAM 3D Objects:支持物体与场景重建SAM 3D Body:专注于人体形状与姿态估计 这两个模型都具备强大且稳定的 SOTA(业界领先)性能,能够将静态的 2D 图像转化为细致的 3D 重建结果。 SAM 3 可通过文本、示例和视觉提示,对图像和视频中的物体进行检测、分割与跟踪。 作为本次发布的一部分,Meta 同步开放了 SAM 3

AI技术文章
0
零门槛deepfake!75.8k Star 的Deep-Live-Cam 一张照片秒换脸,开源 deepfake 神器本地跑!

零门槛deepfake!75.8k Star 的Deep-Live-Cam 一张照片秒换脸,开源 deepfake 神器本地跑!(在新窗口打开)

Deep-Live-Cam 是一款开源的实时换脸与视频深度伪造(deepfake)工具,只需要一张人脸图片,就能在本地电脑上对摄像头画面或视频进行实时换脸。 支持 Windows / Linux / macOS,多种硬件加速(CPU / CUDA / CoreML / DirectML / OpenVINO),并内置不良内容检测与合规提示,定位是服务 AI 生成媒体行业的高效生产力工具。

AI技术文章
0
通往通用人工智能的关键一步?DeepMind放大招,3D世界最强AI智能体SIMA 2

通往通用人工智能的关键一步?DeepMind放大招,3D世界最强AI智能体SIMA 2(在新窗口打开)

您的 AI 伙伴「游戏陪玩」版已上线。 今天,Google DeepMind 发布了 SIMA 2,一个在虚拟 3D 世界中能自主游戏、推理并持续学习的通用 AI 智能体。 DeepMind 创始人哈萨比斯将其定义为通往通用人工智能的关键一步。 去年,谷歌 DeepMind 推出了 SIMA (Scalable Instructable Multiworld Agent,可扩展、可指导的多世界智能体),这是一个能够跨越多种虚拟环境、遵循基本指令的通才 AI,标志着 AI 在 3D 世界中将语言转化为行动的初步探索。 SIMA 2 则代表了这一研究的重大飞跃,是创建通用和有益 AI 智能体研究的

AI技术文章
0
“最强具身VLA大模型”,究竟强在哪儿?

“最强具身VLA大模型”,究竟强在哪儿?(在新窗口打开)

看似轻描淡写,实则力透纸背。 Physical Intelligence刷屏全网的机器人基础模型π*0.6,一亮相就秀出了实力: 让机器人连续一整天制作意式浓缩咖啡,数小时不间断折叠各类衣物,还能精准组装工厂所需的包装纸箱。 在π*0.6的加持下,这些任务的成功率都达到了90%以上。 然而,仔细阅读论文就会发现,比起连做13个小时咖啡,π*0.6真正的突破在于引入了一种更直觉的学习方法——Recap: 指导:用人类示范教它基础动作辅导:纠错指导让它修正错误练习:从自主经验中不断优化、变得更强 这彻底扭转了过去机器人只会逼近 “真值” 的模仿学习模式,让机器人能从自己的错误中成长。 就连网友也直

AI技术文章
0
何恺明团队新作:扩散模型可能被用错了

何恺明团队新作:扩散模型可能被用错了(在新窗口打开)

何恺明又一次返璞归真。 最新论文直接推翻扩散模型的主流玩法——不让模型预测噪声,而是直接画干净图。 如果你熟悉何恺明的作品,会发现这正是他创新的典型路径,不提出更复杂的架构,而是把问题拆回最初的样子,让模型做它最擅长的那件事。 实际上,扩散模型火了这么多年,架构越做越复杂,比如预测噪声、预测速度、对齐latent、堆tokenizer、加VAE、加perceptual loss…… 但大家似乎忘了,扩散模型原本就是去噪模型。 现在这篇新论文把这件事重新摆上桌,既然叫denoising模型,那为什么不直接denoise? 于是,在ResNet、MAE等之后,何恺明团队又给出了一个“大道至简”的结

AI技术文章
0
NeurIPS 2025 Spotlight | 香港大学提出无需数据标记的ViT密集表征增强方法

NeurIPS 2025 Spotlight | 香港大学提出无需数据标记的ViT密集表征增强方法(在新窗口打开)

在视觉处理任务中,Vision Transformers(ViTs)已发展成为主流架构。然而,近期研究表明,ViT 模型的密集特征中会出现部分与局部语义不一致的伪影(artifact),进而削弱模型在精细定位类任务中的性能表现。因此,如何在不耗费大量计算资源的前提下,保留 ViT 模型预训练核心信息并消除密集特征中的伪影?

AI技术文章
0

参与交流

查看 AINRK 交流群说明

了解加入交流群的方式,阅读内容无需登录。

查看交流群说明(在新窗口打开)