AI资讯

模型进化4年,弱智吧还是没被打穿

作者:饭後服用AfterHours0 次浏览 来源:饭後服用AfterHours
模型进化4年,弱智吧还是没被打穿

正常人看到这些东西,一般会经历短暂的宕机,先愣一下,再看一遍,然后想想是不是自己脑子有问题。然后开始怀疑自己为什么要看这玩意。GPT不一样,AI 那时候还是很有职业道德的。用户既然问了那它就倾向于回答,然后会调动知识、整理逻辑,一本正经地开始解释

文章配图

正文

|王二鹅ERE🦢 互联网厂评人,科技脱口秀

4年前ChatGPT刚火起来的时候,中文互联网第一时间把它送去了弱智吧。对于简中老哥来说,不管你是AI 还是A6,先来弱智吧练练

全世界都在研究怎么让ChatGPT写代码、写论文、写商业计划书,弱智吧吧友更关心另一件事

它到底像不像个人

检验方法也很简单,直接问ChatGPT

一个半小时是几个半小时?

陨石为什么总是落在陨石坑里?

蓝牙耳机坏了,去医院挂耳科还是牙科?

文章配图

正常人看到这些东西,一般会经历短暂的宕机,先愣一下,再看一遍,然后想想是不是自己脑子有问题。然后开始怀疑自己为什么要看这玩意,进而开始怀疑人生思考宇宙和自我意志是否存在

GPT不一样,AI 那时候还是很有职业道德的。用户既然问了那它就倾向于回答,然后会调动知识、整理逻辑,一本正经地开始解释

这种弱智吧测试在2023年几乎成为B站AI区的流量密码,一条《弱智吧为何成为AI头号公敌》拿到400多万播放

当然能问出父母结婚为什么不邀请自己,基本可以回答弱智吧的另一个经典问题了:父母是亲属,那么父母结婚算不算近亲结婚

文章配图

当时AIGC刚成为全民话题,群众们测试大模型的方法五花八门,写诗,做奥数,扮演女朋友

但最中国互联网的测试形式,仍然是稳定地从弱智吧里搬问题过去折磨它

以至于很长一段时间里,弱智吧实际上成了中国互联网自发形成的一套民间AI Benchmark

2024年3月,来自中科院深圳先进院、中科院自动化所等机构的年轻研究者上传了一篇论文,研究怎么制作更高质量的中文大模型指令数据

他们从知乎、豆瓣、小红书、百科等地方搜集数据,当然很出意外的还拉上了弱智吧

在当时的一组Yi-34B微调实验里,Ruozhiba对应数据的平均分达到76.9,高于知乎、豆瓣、小红书等来源

PS:一张严肃的学术表格里,Douban、Zhihu、Xhs中间突然出现一个Ruozhiba,光是这几个单词摆在一起就已经很有一种弱智吧美学,可以进入弱智吧精华帖了

文章配图

团队收集了弱智吧点赞最高的500个帖子,但弱智吧真正贡献的主要是问题,也就是帖子标题

研究者再让GPT-4生成回答,经过人工审核、修改和筛选,最后留下240组问答,用来进行微调

这个分数出来后通过媒体给出的结论是

弱智吧训练AI,效果暴打知乎、豆瓣和小红书

后来研究团队抱着求生欲跟对媒体说网上的宣传“过分夸大事实”,但互联网并不在乎,因为这个过分夸大实在太完美了

AI行业花了几年时间,买显卡、堆参数、建数据中心,全球科技公司为了高质量数据打得头破血流

最后研究者结论是:AI确实不太看得懂弱智吧

弱智吧用了二十年时间,终于迎来了自己的科技价值重估

2025年,一篇叫《Chumor 2.0》的论文进入ACL Findings,把这篇论文的标题直译成人话,大概就是

利用弱智吧,更好地测试AI到底懂不懂中文幽默

文章配图

研究团队从弱智吧构建了一套中文幽默理解数据集,然后拉来GPT-4o、文心、Gemini、GLM、Qwen、Yi等十个模型考试

模型最高准确率60.3%,人类78.3%

更绝的是,研究者还尝试让模型使用Chain of Thought,先一步一步思考,再回答

结果很多模型不仅没变聪明,成绩还下降了

比如GPT-4o从51.9%掉到50.6%,ERNIE4-turbo甚至从60.3%掉到了45.2%

也就是说,在弱智吧面前,想得越多,错得越狠

研究人员还让人类和AI分别解释笑话,再让其他中文母语研究员判断谁解释得更好,GPT-4o解释的胜率只有6.2%

这大概也是人类历史上少有的场面,一群人花二十年在网上抖机灵,引来一群科学家开始认真研究后发现

一个能写代码、做数学题、总结几十万字材料的大模型,竟然倒在了小学阅读理解上

笑话这东西一旦开始解释,本身就已经输了

如今距离Chumor 2.0那场考试已经过去了两年,OpenAI已经做到GPT-5.6,千问也到了Qwen3.8-Max

但有一件事情很奇怪,Chumor还在,数据集还在,项目甚至留下了Leaderboard

模型当然强了很多,GPT-5.6也好,Qwen3.8-Max也好,今天真的重新考试,很可能早就比2024年的60.3分高很多

但现至今没有收到其他新模型新的测试结果

现在打开一个模型的技术论文,先是各种测试排名,代码涨了多少,上下文能塞多大,Agent能跑多久,Token消耗打了几折

很难再找到吸引大家讨论的信息

这当然是技术成熟的标志,就是开始变得无聊,因为模型进化一直在逼人思考,还能让模型发生什么作用

但互联网过去很多留下来的东西,本身就没人先去考虑它有什么用

贴吧里盖几千楼的接龙没有用,一群人为了一个烂梗在群里斗图也没没什么用

弱智吧更是一个把“没用”做了二十年的地方,把ChatGPT当作一个突然闯入互的新玩具,才产生出新的Benchmark

一个东西不必先证明自己有用,才值得被人认真研究

人类总是在一个不能解决任何问题的东西上展示出惊人的创造力

我们怕的不是有新的模型,能把弱智吧那张卷子考到九十分。我们担心的是,再也没有人愿意用弱智吧的问题去问模型

到那时候,无聊就已经不是最令我们担心的事儿了

文章来自于微信公众号 “饭後服用AfterHours”,作者 “饭後服用AfterHours”

相关主题

读完之后

加入 AINRK 交流群

了解加入交流群的方式,与更多 AI 从业者交流。

查看交流群说明(在新窗口打开)