AI产品评测

1小时花一亿token极限实测DeepSeek-V4-Flash,得出7个结论

作者:夕小瑶科技说5 次浏览 来源:夕小瑶科技说
1小时花一亿token极限实测DeepSeek-V4-Flash,得出7个结论

DeepSeek-V4-Flash风评冲爆了,原生支持接入Codex,而且还强化了Agent能力。我第一时间把它接进了Codex,用cc swich非常方便。一个小时,跑了一亿多token。跟大家说说体感。

DeepSeek-V4-Flash风评冲爆了,原生支持接入Codex,而且还强化了Agent能力。

我第一时间把它接进了Codex,用cc swich非常方便。

一个小时,跑了一亿多token。跟大家说说体感。

文章配图

◈识图能力

先说大家最关心的问题,能不能识图。

答案是不能,V4本身没有多模态能力。

但是我发现了一个特别有意思的事情。

在 Codex 里我扔给它一张图片,问它这是什么。它竟然调起了我本地接入的Fable5 达到了目的。。

过程就是V4先尝试调用本地识图工具,但发现只能拿到图片的尺寸大小,颜色分布,看不到具体的内容。

然后就又去翻了我在codex里的记忆文档。

结果在记忆中发现了一个 Claude CLI,于是把图片交给 Claude CLI 去处理了。。最后交付我结果。

文章配图

它殊不知这个 CLI 背后我接的 API 是 Fable 5。。

全程没有经过我的同意,“擅作主张”调用了一个收费的Fable 5模型。

我真的是。。。

交付能力是真的强,也是真的莽撞,你环境里接了什么付费 CLI,它是真敢直接用的。但我的钱包真的怕啊。

◈速度是真的快!

刚接上的时候,基本找回了实时交互的感觉。

Say hello 之后,它很快读完了 Codex 里的记忆文档和本地 Skill。

文章配图

我让它检查服务器状态。

它自己找到服务器 Skill,连上 8 台云服务器,跑完状态检查,再整理成一张监测面板。

全程只花了 1 分多钟。

文章配图

读文件、跑命令、切工具、整理结果,全都很利索。

不过,后面测的长任务跑到后半段,速度还是会慢一点。

Flash 感最明显的,主要是刚开始和短循环任务。而且,美中不足——

刚开测的时候飞快,吃到一次 503「Service is too busy,建议临时切换其他服务商」。

官方顶不住这个流量,估计全网都在薅。

◈Agent 能力很强,适应环境很快

它接进 Codex 后,不太需要手把手教。

目录里有什么文档、Skill、脚本和服务器连接,它会自己翻;发现已经有现成工具,也不会傻乎乎地重新造一个。

我让它训练一个文章阅读量预测模型,只给了一个 GitHub 数据目录。

文章配图

它自己清洗数据、切训练集、训练模型,又针对「夕小瑶科技说」单独做特征和评估,最后把代码、图表和报告一起交了。

文章配图

十几分钟,一个比较完整的工程就跑出来了。

◈长任务能顶住,敢推翻自己

我让它推荐一个短线选股策略,要求最近半年年化收益超过10%,最大回撤低于8%。

它先补全市场数据,接着写回测引擎。中间踩了不少坑。

数据源被封、补数脚本报错、净值计算还有一个 MTM Bug,一度跑出了错误结论。

它发现不对之后,又自己重写、复核,前后折腾了接近一个小时。

文章配图

最后确实找出了一套近半年达标的「动量轮动+指数择时」策略,但继续拉长到 2020 年后,它发现这套策略长期表现很差,于是又把结论改成了:

近半年成立,只能作为研究结果,不能直接拿去实盘。

这个过程挺有意思。

它会犯错,但不会轻易停,也有能力把自己刚才的结论推翻。

◈一如既往地实惠

我大概测了一个多小时,后台统计接近 1 亿Token,总共才花了八块钱,缓存命中接近 98%。

这种规模放在很多旗舰模型上,我可能跑到一半就开始心疼钱了。

文章配图

我一共测了10几个任务,请求次数一共有13599次,平均一个任务触发大几百次请求。

(评论区有没有大佬说说这么多次正常吗)

文章配图

但 DeepSeek 的优势就是,我敢让它继续试。

代码错了就重写,数据缺了就再拉,方案不行就换一套。

它单次不一定每次都做到最好,但靠着速度、价格和高缓存命中,可以用大量尝试把任务硬推过去。

◈大项目一次成型

我还给了它一个很长的需求,让它做一个可以多人联机的 3D FPS 游戏。

一个 URL,多个客户端进入同一个房间;地图里有枪械、近战武器、手雷、状态道具、随机 BOSS、神秘商人、聊天、排行榜和观战模式。

最后它真做出来了。

文章配图

美术肯定谈不上精致,但比Demo好不少。我自己进去玩了一会儿,移动、射击、碰撞和动作反馈都挺跟手,多人同步也能正常工作。

◈输出过程有人味儿

它会不断告诉你自己卡在哪儿。

「找到真凶了!」「手雷没炸到人」

文章配图

明显比现在顶模的碎碎念多得多,但比那种闷头跑半小时、最后只甩给你一句“任务完成”的 Agent 有意思的多,像一个人和你拉起进度一样。

欢迎评论区讨论!

文章来自于微信公众号 “夕小瑶科技说”,作者 “夕小瑶科技说”

相关主题

读完之后

加入 AINRK 交流群

了解加入交流群的方式,与更多 AI 从业者交流。

查看交流群说明(在新窗口打开)