
我让PilotDeck做了个火影跑团桌游,它竟然半夜睡醒自己加班干!(在新窗口打开)
收到面壁智能的内测邀请,我翻了翻产品逻辑,发现它想解决的问题和我当时的处境一模一样。AI 能不能不只是回消息,而是做项目。AI 能不能记住规则,能在你睡觉的时候继续干活,能自己发现你漏了什么。
内容栏目
介绍和评测不同 AI 产品的功能、使用体验与适用场景。

收到面壁智能的内测邀请,我翻了翻产品逻辑,发现它想解决的问题和我当时的处境一模一样。AI 能不能不只是回消息,而是做项目。AI 能不能记住规则,能在你睡觉的时候继续干活,能自己发现你漏了什么。

超越 GPT-5.5、Gemini 3.5 Flash、DeepSeek V4 Pro,阿里的最新旗舰模型 Qwen3.7 Max 在编程竞技榜拿下第二名,仅次于 Claude Opus 4.7。除了真实场景的用户选择,在传统的大模型固定评测榜单上,像是终端能力 Terminal Bench、编程能力 SWE Bench 等,Qwen3.7 Max 的表现也是拿下了国产模型的冠军。

迈入今年618大促周期,各大电商平台纷纷加码AI购物,智能选购成为各家角逐的新焦点。

AI 短剧发展到今天,过去那种靠单打独斗的小作坊模式正在被淘汰。现在复盘榜单上排名靠前的AI短剧内容团队,你会发现里面基本都是几个人、甚至十几人的工作室在共同推进项目。

天下武功,唯快不破。 本周 Google I/O 大会上,谷歌发布了最新模型 Gemini 3.5 Flash。 Google I/O 大会发布 Gemini 3.5 Flash|图片来源:youtube 有趣的是,隔一天国内 Qwen3.7-Max 也发布了,并且两个模型都号称自己在 Agent 场景上做了深度优化。 我看到他们的第一反应是:又是新一轮「模型大战」,国内外厂商再次开启跑分竞赛。 但这次我花了两天时间实测之后,我发现Gemini 3.5 Flash 给我最大的感受不是它有多聪明,而是它的速度快到让我不得不重新想一个问题: 当模型的响应速度从「能用」变成「实时」,整个 Agent

下一代创作软件比的不是模型能力,而是谁能把完整的创作流程跑通。 能让 Agent 从接到目标开始,一路协作推进到交付成品的系统,才是真正的竞争力。 OmniWork 是我们最近看到的明确在朝这个方向走的产品。它给自己的定位是「The Agent OS for Creative Work」,面向创作工作的 Agent 操作系统。

AI办公彻底变天了!阿里QoderWork重磅发布全球首个AI Native自定义工作台,推出设计、PPT、写作三大领域模式。AI办公正式从「对话驱动」走向「领域驱动」。

昨天,想必大家都被 Google IO 大会刷屏了。

大家好,我是袋鼠帝 作为一名后端程序员,我略懂前端,但是对于UI设计是一窍不通。

过去AI视频是「生成内容」,Omni直接升级成「生成世界」。它懂动能、重力、因果,还能把复杂概念瞬间可视化。人类距离「言出法随」的梦想,还剩几个Gemini Omni的距离?

阿里正加速Qwen主模型的迭代节奏。 智东西5月19日报道,今天,阿里的Qwen3.7系列预览版模型已上线,共有Max和Plus两个版本。大模型竞技场也放出了Qwen3.7-Max-Preview的评测结果。在大模型竞技场覆盖主流基座大模型的总榜上,Qwen3.7-Max-Preview排名第13,介于GPT 5.5和Grok 4.2之间,是这一榜单上排名最高的国产模型。 在具体的细分榜单上,Qwen3.7-Max-Preview在数学领域排名第7、在专家任务中排名第9、在软件与信息技术任务中排名第9、在编程任务中排名第10。 ▲Arena.ai公布Qwen3.7-Max-Preview的成绩

近日,腾讯开始内测一款名为Marvis(马维斯)的操作系统层个人AI助手。这一AI助手通过多个Agent的协作完成App操作、EXE操作、电脑操作、文件管理、文档生成以及各种复杂任务,24小时持续在线,并支持跨端操作。

把 Agent 从单体,组成一支可以协作的 Agent Teams。

一群人,一群 AI,一起玩。 最近一个月,「十字路口」关注的重点议题之一是:Agent 如何与团队更好地协作。 我们先后访谈了 Moxt、Multica、Helio、Bridge 四款产品的创始人。他们都在尝试以不同路径,挑战并解决同一个问题:Agent 能力越来越强,且正进入团队的日常工作之中——这是否意味着一个新的产品机会正在出现? 你可以把它称为 Agent Workspace 赛道,也可以称为 Agent OS 赛道。每个人都有自己的定义,而这些定义各有道理。 这是一种典型的时代性机会:Coding 能力 + 长程任务能力让 Agent 越来越强,技术进步解锁了大量的新可能性,但最优的

我看到洛小山做的 Alice,在「观猹」上取得了高分 8.2 的成绩。这是一个免费的 AI 个人助理(接入词元跳动注册即送免费算力):她有完整的人设,26 岁澳门女生,会在凌晨提醒你早睡,还会私下「小声蛐蛐」对你的观察。

AI内容创作工具迈入Next Level!

上周太集中发的后果就是光在用GPT -5.5了,小米的Mimo-V2.5-Pro,DeepSeek V4 Pro还没有放在Agent的场景上测。所以我跟钱包一拍即合,复制了4个一模一样的Hermes Agent,记忆一样,skill一样,系统设置一样,能调用的工具也一样。

从去年开始做这个账号以来,我其实写过不少测模型的文章。我相信也有很多朋友是因为看了我测评的文章关注我的。但从过年之后,真的就很少写模型评测的文章了。主要是我写文章的速度甚至一度跟不上模型发布的速度了。

这段时间做了巨多PPT。 多到我现在都条件反射了,好不好看先放一边,先看AI容易错的细节。 文字有没有糊,布局是不是在装高级,图片是不是只是看起来有氛围感,该有的信息都没放进去, 再就是画面上有没有一

SenseNova U1 是商汤最新发布的一个开源的多模态模型,它的 Lite 系列 8B 和 A3B 参数版本,目前已经在 Hugging Face 和 GitHub 上开源。APPSO 也提前拿到了测试资格,我们发现商汤这款新一代原生理解生成统一模型,就开源模型来说,已经做到了最好水平。
参与交流
了解加入交流群的方式,阅读内容无需登录。