内容栏目

AI产品评测

介绍和评测不同 AI 产品的功能、使用体验与适用场景。

DeepSeek、Claude、GPT、Gemini、Qwen实测五大旗舰模型AI编程能力,看Qwen3.7 Max 是否实至名归?!

DeepSeek、Claude、GPT、Gemini、Qwen实测五大旗舰模型AI编程能力,看Qwen3.7 Max 是否实至名归?!(在新窗口打开)

超越 GPT-5.5、Gemini 3.5 Flash、DeepSeek V4 Pro,阿里的最新旗舰模型 Qwen3.7 Max 在编程竞技榜拿下第二名,仅次于 Claude Opus 4.7。除了真实场景的用户选择,在传统的大模型固定评测榜单上,像是终端能力 Terminal Bench、编程能力 SWE Bench 等,Qwen3.7 Max 的表现也是拿下了国产模型的冠军。

AI产品评测
0
Gemini 3.5 Flash 实测:当模型速度进入 4G 时代,Agent 的游戏规则变了 | AI上新

Gemini 3.5 Flash 实测:当模型速度进入 4G 时代,Agent 的游戏规则变了 | AI上新(在新窗口打开)

天下武功,唯快不破。 本周 Google I/O 大会上,谷歌发布了最新模型 Gemini 3.5 Flash。 Google I/O 大会发布 Gemini 3.5 Flash|图片来源:youtube 有趣的是,隔一天国内 Qwen3.7-Max 也发布了,并且两个模型都号称自己在 Agent 场景上做了深度优化。 我看到他们的第一反应是:又是新一轮「模型大战」,国内外厂商再次开启跑分竞赛。 但这次我花了两天时间实测之后,我发现Gemini 3.5 Flash 给我最大的感受不是它有多聪明,而是它的速度快到让我不得不重新想一个问题: 当模型的响应速度从「能用」变成「实时」,整个 Agent

AI产品评测
0
实测 OmniWork:搞调研、做动画、造游戏,用 AI 攒一个「全干班子」是什么体验?

实测 OmniWork:搞调研、做动画、造游戏,用 AI 攒一个「全干班子」是什么体验?(在新窗口打开)

下一代创作软件比的不是模型能力,而是谁能把完整的创作流程跑通。 能让 Agent 从接到目标开始,一路协作推进到交付成品的系统,才是真正的竞争力。 OmniWork 是我们最近看到的明确在朝这个方向走的产品。它给自己的定位是「The Agent OS for Creative Work」,面向创作工作的 Agent 操作系统。

AI产品评测
0
阿里Qwen3.7竞技场杀至国产第一!一手实测:分分钟破解奥赛难题,图文视觉全都难不倒

阿里Qwen3.7竞技场杀至国产第一!一手实测:分分钟破解奥赛难题,图文视觉全都难不倒(在新窗口打开)

阿里正加速Qwen主模型的迭代节奏。 智东西5月19日报道,今天,阿里的Qwen3.7系列预览版模型已上线,共有Max和Plus两个版本。大模型竞技场也放出了Qwen3.7-Max-Preview的评测结果。在大模型竞技场覆盖主流基座大模型的总榜上,Qwen3.7-Max-Preview排名第13,介于GPT 5.5和Grok 4.2之间,是这一榜单上排名最高的国产模型。 在具体的细分榜单上,Qwen3.7-Max-Preview在数学领域排名第7、在专家任务中排名第9、在软件与信息技术任务中排名第9、在编程任务中排名第10。 ▲Arena.ai公布Qwen3.7-Max-Preview的成绩

AI产品评测
0
Agent创业的下一站,是重做「人-A」关系 | 实测Bloome

Agent创业的下一站,是重做「人-A」关系 | 实测Bloome(在新窗口打开)

一群人,一群 AI,一起玩。 最近一个月,「十字路口」关注的重点议题之一是:Agent 如何与团队更好地协作。 我们先后访谈了 Moxt、Multica、Helio、Bridge 四款产品的创始人。他们都在尝试以不同路径,挑战并解决同一个问题:Agent 能力越来越强,且正进入团队的日常工作之中——这是否意味着一个新的产品机会正在出现? 你可以把它称为 Agent Workspace 赛道,也可以称为 Agent OS 赛道。每个人都有自己的定义,而这些定义各有道理。 这是一种典型的时代性机会:Coding 能力 + 长程任务能力让 Agent 越来越强,技术进步解锁了大量的新可能性,但最优的

AI产品评测
0

参与交流

查看 AINRK 交流群说明

了解加入交流群的方式,阅读内容无需登录。

查看交流群说明(在新窗口打开)