AI资讯

AI 写小说实验②丨如何下载榜单数据和小说内容

作者:勇鹏在用 AI0 次浏览 来源:勇鹏在用 AI
AI 写小说实验②丨如何下载榜单数据和小说内容

拆文之前,先过下载这一关。跑通了,就别让它烂在聊天记录里。

"拆文之前,先过下载这一关。跑通了,就别让它烂在聊天记录里。

上一篇说了,实验正式重启。AI 写小说能赚钱吗?我打算用一个月给出一个真实答案(在新窗口打开)

题材定了:历史脑洞。

下一步是拆文。

找几本现在在历史脑洞新书榜跑得不错的书,把前几章喂给 AI,让它帮我提炼写法,做成一份参考手册。后面自己写的时候,有个东西可以对着看。

但在拆文之前,有一步我没提。

怎么把这些书的内容拿下来。

这一步,差点把我卡了半天。

文章配图

— 拆文前卡在数据门

但这半天里发生的事,我觉得值得单独聊一下。

📌 本文看点

01 抓榜与油猴

02 开源 + Handoff

03 工具边界

01数据从哪来

上一篇提到过novelcatch.com。番茄小说的榜单、赛道比对、一些统计,比直接翻番茄官网直观。

这次我要的是它的总榜,地址在 novelcatch.com/rank。按热度排,每本书有书名、类目、字数、更新频率。

数据就在这儿。

02用 ego-lite 抓榜,再做成油猴

第一次获取数据,我用了ego-lite

它是给 AI Agent 用的浏览器环境。agent 能帮你打开网页、点按钮、抓页面数据。更省事的是,它能复用你自己浏览器的登录状态,不用单独处理登录。

我让 agent 把 novelcatch 总榜抓成 JSON。

文章配图

— ego-lite 复用登录态抓榜

跑通了一次之后,问题来了:下次要别的榜单,还得再走一遍?费 Token,也烦。

于是我根据这次流程,让 agent 写了个油猴脚本。

打开 novelcatch 榜单页,页面上多一个按钮,点一下就导出 JSON。不费 Token,也不用再跟 agent 扯皮。

文章配图

下次再要数据,打开页面点一下就行。

文章配图

— 油猴一键导出 JSON

03找开源,别什么都自己造

榜单有了,下一步是章节内容。

我没打算从零写抓取逻辑。先搜了一圈有没有现成项目。

找到了SoNovel,支持番茄小说,可以传书单、按章节输出。

💡 它是个人学习研究用途的工具。我拿来做 AI 拆文分析,不碰商业传播。自己研究没问题。

我把榜单 JSON 和 SoNovel 一起丢给 agent,告诉它要什么,让它跑。

文章配图

— 找开源不造轮子

04grok 拒绝,Codex 跑通,再做成提示词

一开始用的 grok。

直接拒绝了,说涉及版权相关内容,不帮执行。

我换了Codex(OpenAI,5.6 SOL,思考等级调到「高」)。

它没拒,开始跑。但也不是一次成。

章节抓取失败、逻辑要改,来回几轮,最后才落地。

文章配图

— 工具边界:拒绝与跑通

跑通之后,我做了件事:把这次成功的对话,让 agent 总结成一份提示词。

这思路参考了 Matt Pocock 说的Handoff。复杂任务跑通后,别让它烂在聊天记录里。把成功路径提炼成可交接文档,换个环境也能跑。

我让 agent 自己总结了一份元提示词,只留四个变量:

1INPUT_JSON:榜单数据

2OUTPUT_DIR:输出目录

3CHAPTER_LIMIT:每本书拉几章

4BOOK_LIMIT:总共处理几本

其他交给 agent。

文章配图

总结完,我开了个全新环境,把提示词重新测了一遍。确认不是靠着旧上下文糊过去的,真能独立复现。

文章配图

05工具边界是真的

这次多出来一个观察。

grok 拒绝了,Codex 跑通了。

我不站队。不同 agent 对同一件事判断不同,很正常。

「下次再被拒,我不会先否定任务本身,会先换个工具试试。」

边界不完全由任务决定,也跟工具怎么判断、你怎么描述有关。

下一篇

数据到手了,接下来研究怎么拆文。

手里已经有了历史脑洞新书榜里若干本书的章节。接下来会选几本认真读,结合 AI 分析,提炼这个题材的写法规律,给后面自己写做准备。

拆文那篇见。

最后,有两样东西我打算在下一篇一并分享:这次的油猴脚本,以及 SoNovel 批量下载的元提示词。

文章来自于"勇鹏在用 AI",作者 "勇鹏在用 AI"。

相关主题

读完之后

加入 AINRK 交流群

了解加入交流群的方式,与更多 AI 从业者交流。

查看交流群说明(在新窗口打开)