新模型发布 48 小时内自动出评测文:一条流水线的完整拆解
上一篇讲了我怎么用 Trello + Claude Code 给自己搭了个「AI 营销部门」。 留言里问得最多的一句是:「AI 到底怎么知道该写什么?」
这篇拆其中跑得最好的一条线:新模型发布后 48 小时内,自动起草一篇英文评测稿。
为什么是 48 小时
新模型发布后的两天,是搜索流量最集中、竞争最小的窗口。
GPT-6 Astra review、Kimi K3 vs Claude 这类词,发布当天几乎没有存量内容在排队——
一周以后你再写,前面已经站满了大站。
而我的优势很具体:自家平台(aiwith.chat)接上新模型通常只要几个小时。 别人还在排 API 等待名单,我已经能放实测截图了。
问题只剩一个:我不可能每天盯着六家实验室的发布页。
流水线长什么样
一个 Python 脚本,cron 每天跑两次(早 8 点、晚 8 点),总共四步:
抓 RSS → 48 小时窗口过滤 → 关键词命中 → 生成带 TODO 的草稿 → 进「待人工」等我实测
注意最后一步:脚本不发文,只起草。 它产出的是一个填空模板:
# {模型名}: Is It Worth Switching?
## What's new
TODO: 一句话说清这次发布的核心变化(速度/价格/能力/上下文)
## Try it now on aiwith.chat
## Is it worth switching?
TODO: 结合实测结论给一个明确判断,不要模棱两可
我要做的只有:打开平台跑一轮这个模型、截图、把两个 TODO 填掉。 从「我得想个选题、查资料、搭结构」变成「我只需要提供实测结论」—— 这是整条线真正省下来的东西。
坑一:一半的实验室根本没有 RSS
这是最先撞墙的地方。理想情况是六家官方 RSS 全都订上,现实是:
| 厂商 | 结果 |
|---|---|
| OpenAI | ✅ 官方 RSS 可用 |
| Google AI | ✅ 博客分类页有 RSS |
| Anthropic | ❌ RSS 404;sitemap 里没有发布时间字段 |
| DeepSeek | ❌ rss.xml 是 JS 渲染的壳,不是真 RSS |
| 智谱 GLM / 月之暗面 Kimi | ❌ 官网无源;试过 GitHub Releases API,死路 |
最后的方案是按源的质量分层,而不是死等一手源:
- 一手源:OpenAI、Google AI 官方 RSS
- 二手源:TechCrunch 的公司标签页(
/tag/anthropic/feed/)——慢几小时,但总比没有强 - 三手源:中文厂商用 Google News 搜索 RSS(
news.google.com/rss/search?q=...,公开、不要 key), 按「品牌词 + 发布/上线/开源」查询,实测能抓到「智谱发布 GLM-5.3」这类报道 - 兜底:The Decoder 这类综合 AI 新闻站,捞上面全漏掉的厂商
给想抄作业的人:别在「找到完美数据源」上耗时间。分层 + 兜底跑起来, 比你花一周找官方 API 有用得多。
坑二:关键词命中把一切都当成新模型发布
第一版规则很朴素:标题里有品牌词或动作词就算命中。然后就翻车了。
噪音 A:Model Context Protocol。 标题里有 "Model",命中,起草。
和模型发布毫无关系。
→ 修法:一手源和三手源用不同的严格度。官方博客标题本来就窄,任一词命中即可;
TechCrunch / The Decoder / Google News 这类宽口径源,必须「品牌词 和 动作词同时命中」。
噪音 B:「智谱入驻天猫,GLM Coding Plan 上线官方旗舰店」。 "GLM" + "上线" 双命中,完美符合严格规则——但说的是开店铺。 噪音 C:「Kimi K3 发布后,月之暗面估值飙至 500 亿美元」。 "Kimi" + "发布" 双命中——但文章讲融资,起草出来是个空壳。 → 修法:加一条一票否决的噪音词表,电商类(天猫/旗舰店/入驻/带货)和 财经类(估值/融资/上市/IPO/亿美元)命中就直接排除,不管其它条件。
噪音 D:同一次发布被写了四遍。 GPT-6 Astra 发布那天,OpenAI 官方 RSS 里跟着 好几条衍生内容:Legora 的客户案例、Playco 的客户案例、"Safety overview: GPT-6 Astra"。 标题全都带品牌词 + 动作词,一手源规则照单全收,结果同一个模型起草了 4 篇空壳稿。 → 修法:从标题里正则抽出模型名,同一模型两周内只起草一篇,后续衍生报道直接跳过。
现在 drafts/ 里躺着 18 篇自动起草的稿子,其中真正值得我花时间实测填空的大概 6 篇。
命中率三分之一,我认为这就够了——因为漏掉一次真发布的代价(错过 48 小时窗口),
远大于多起草两篇我一眼就能划掉的草稿。调参的方向永远是「宁可多抓,不可漏抓」。
坑三:状态文件会悄悄变成垃圾场
脚本要记「哪些链接看过了」,否则每天重复起草。第一版直接存一个 set,截断时
list(seen)[-1000:]——set 没有顺序,截断保留的是随机子集,于是老链接被反复当成新的。
→ 修法:用「插入顺序的 list」记,截断时才真的是「保留最近 1000 条」。
模型去重记录也加了过期清理,否则 state 文件无限膨胀。
这种 bug 最阴险的地方在于:它不报错、不告警,只是每隔一段时间悄悄多出一篇重复稿。 自动化系统里,真正让你流血的从来不是崩溃,是这种静默的慢性错误。
这条线值不值
先说不值的部分:它不会替你写出好文章。 模板里两个 TODO 才是文章的价值所在, 那部分必须是真人拿真实测结果填。指望 AI 从 RSS 标题直接生成一篇能排名的评测, 产出的是一堆没人看的空壳。
值的部分是:它把「选题 + 时效监控」这个需要我每天分神的活,压成了零。 新模型发布,我在企微群里收到通知,打开草稿,跑一轮实测,填两段,发布。 从想法到上线一小时以内——这个速度在 48 小时窗口里是决定性的。
给想自己搭一条的人
- 先定清楚「机器做到哪一步为止」。 我的边界是「起草到 TODO 为止」。 边界模糊的自动化,最后要么你不敢用,要么发出去一堆垃圾
- 宽口径源和窄口径源,规则必须分开。 用同一套关键词吃所有源,一定翻车
- 噪音词表要一票否决。 别指望靠正向规则把噪音排干净,反向黑名单便宜有效得多
- 每次踩坑就把案例写进代码注释。 我那个脚本里每条噪音规则旁边都写着触发它的 真实标题和日期——半年后你自己都想不起来为什么要排除「天猫」
- 宁可多抓不可漏抓。 假阳性你花 10 秒划掉,假阴性你损失一整个流量窗口
想给自己的团队搭一套?
这套系统是我给自己 12 个产品用的。现在我把同一套东西搭进别人的公司:一块属于你自己的看板, AI 在里面领任务、写稿、配图、汇报,你每周花 30 分钟审核 + 点发布,按月交付内容和数据。
具体的联系方式和报价,我会在这个系列更新完后补在文末。 在那之前,如果你想先自己动手,这套流水线调用的模型能力全部来自 不墨 AI——一个订阅同时用 GPT / Claude / Gemini / DeepSeek / Kimi, 写稿、起标题、做摘要这些活它都能接。