零爬虫轻量化落地:用 Codex Skill 搭建 AI 热点智能分析系统

在 AI 内容创作与运营赛道,很多团队和独立开发者都面临同一个痛点:全网热点分散在抖音、小红书、公众号等多个平台,人工逐一筛选效率极低,判断选题价值又高度依赖个人经验,很难稳定输出高潜力内容。有没有办法用一套自动化流程,把跨平台热点数据统一抓取、交给大模型做结构化分析,最终输出可直接复用的选题方向?

答案是肯定的。基于 Codex 的 Skill 编排能力,搭配成熟的新媒体数据接口,有开发者仅用两个小时就完成了从开发到上线的全流程,搭出了一套 “AI 热点雷达”—— 每天凌晨自动运行,抓取三大平台的 AI 相关内容,经 LLM 分析后生成带机会评分的热点报告,打开页面 5 分钟就能判断当天值得跟进的话题方向。

一、数据能力底座:红狐数据的 API 与 Skill 体系

做跨平台热点分析,首先要解决数据来源问题。自研爬虫不仅维护成本高,还容易遭遇反爬限制,而红狐数据作为面向开发者的新媒体数据平台,刚好提供了标准化的接口能力,让开发者不用关心底层采集逻辑,专注业务本身。

它覆盖抖音、小红书、公众号、视频号、快手、微博、今日头条等主流平台,接口维度涵盖账号信息查询、作品详情获取、关键词搜索、作品列表拉取等常见需求,所有接口统一采用 POST+JSON 格式,通过请求头传递 API 密钥鉴权,Python、Node.js、curl 均可快速调用。

除了原始 API,平台还提供了 40 多个开箱即用的数据分析 Skill,也就是封装好的分析技能模块,其中公众号 10w + 文章推荐、抖音热门账号推荐、全网热点追踪等热门功能累计调用量均突破数万次。这些 Skill 可以直接下载到本地 Agent 环境运行,兼容 Codex、Claude Code 等主流 Agent 工具,相当于把 “数据采集 + 分析逻辑” 打包成了可复用的标准化组件。

目前开放的核心 API 可分为四类:

  • 公众号类:共 6 个接口,支持账号搜索、文章搜索、账号信息查询、文章详情查询、作品列表查询、URL 直查
  • 小红书类:2 个接口,覆盖账号详情与作品详情查询
  • 抖音类:2 个接口,提供账号和作品的基础信息查询
  • 工具类:包含 AI 图片生成、视频生成等创作辅助能力

这套体系的核心价值在于灵活性 —— 拿到 API 之后,开发者可以按需搭建数据看板、编写自动化脚本、接入智能体工作流,或是做内容自动化生产,AI 热点雷达就是基于这套能力组合出来的典型落地应用。

二、AI 热点雷达的产品形态与核心能力

AI 热点雷达的页面设计完全围绕 “快速判断热点价值” 的目标展开,整体分为四大核心区域。

首先是每日摘要区,位于页面顶部,由 Agent 自动生成当日数据概览,明确标注当天采集的抖音样本数、小红书笔记数、公众号爆文数,以及 Agent 筛选后的推荐选题数量,一眼就能掌握当日数据规模与整体热度。

其次是Agent 精选推荐区,这是整个产品的核心价值所在。大模型会从三个平台的原始数据中筛选出最具传播潜力的内容,按照机会评分从高到低排序。评分并非主观给出:先由脚本根据关键词匹配度、点赞、评论、分享、收藏等互动数据计算出 40-96 分的基础分,再由 LLM 结合话题时效性、受众广度、争议性等维度微调,保证每一个评分都有数据支撑。

每条推荐内容都会附带明确的内容切入角度建议,比如 “拆解事件背景与用户争议点”“结合 AI 工具给出可复现实操”,同时标注风险提示,提醒创作者核验原始数据口径,避免把单平台热度直接等同于全网趋势。

第三部分是三平台原始数据面板,分别展示抖音热门视频、小红书爆款笔记、公众号 10w + 文章的原始数据。抖音样本附带完整的互动数据与评论热词;小红书笔记呈现内容核心观点与传播表现;公众号文章则展示阅读、点赞、在看、评论、分享的全维度互动数据,方便创作者和运营人员自行二次分析。

最后是在线查询功能区,页面嵌入了 9 个独立的查询卡片,用户无需自己写代码调用接口,直接输入关键词、账号名或内容链接,就能实时查询对应平台的数据。比如输入公众号名称即可拉取近期文章列表,粘贴抖音链接就能获取作品详情与评论热词,大幅降低了普通用户的数据使用门槛。

三、全链路落地:从定时采集到站点生成的完整流程

整个 AI 热点雷达的运行链路完全自动化,由 GitHub Actions 每日凌晨定时触发,全程无需人工干预,完整执行流程分为五步,每一步都有明确的容错机制。

第一步:加载 Skill 配置

脚本启动后,首先读取 skills 目录下的 SKILL.md 文件,获取每个平台的采集策略、API 请求参数、关键词配置与筛选规则。每个 Skill 都采用 “决策手册 + 执行脚本 + 参考资料” 的标准化结构,调整采集规则不需要修改核心代码,只需要更新文档中的参数即可,维护成本极低。

第二步:并行采集多平台数据

系统并行启动三个平台的采集任务,各自按照预设逻辑获取数据:

  • 抖音:以 “AI” 为核心关键词做内容搜索,初步获取候选作品列表
  • 小红书:基于 “AI 工具、AI 编程、AI 智能体、Agent、大模型” 等关键词,筛选爆款笔记
  • 公众号:以相同关键词组查询热门文章,优先抓取高阅读量内容

每个平台默认采集 5 条核心数据,在保证样本多样性的同时,控制 API 调用成本。

第三步:补全抖音作品详情

搜索接口返回的数据通常维度较少,因此脚本会对排名靠前的 5 条抖音作品再调用一次作品详情接口,补全点赞数、评论热词、封面图、作者信息等完整字段,保证三平台数据维度统一,方便后续 LLM 统一分析。

第四步:LLM 结构化分析

所有原始数据采集完成后,脚本会将数据打包发送给大模型(默认使用 DeepSeek v4-pro),请求结构化分析输出。Prompt 中会附带 Skill 的元数据与评分规则,要求大模型返回固定格式的 JSON,包含每日概述、跨平台精选推荐、各平台策略洞察、内容切入角度、整体风险提示五个部分。

如果大模型调用失败(如超时、额度不足),脚本会自动降级,使用预设模板生成基础分析结果,保证页面每日都有内容输出,不影响基础可用性。

第五步:生成静态站点文件

分析完成后,脚本将原始数据与 LLM 分析结果嵌入 HTML 模板,输出静态页面文件到 dist 目录,同时生成最新数据的 JSON 文件与按日期归档的历史文件。整个过程不需要数据库,所有数据都以文件形式存储,架构极度轻量化。

以公众号文章搜索为例,API 调用的标准格式如下:

bash

运行

curl -X POST "https://redfox.hk/story/api/gzhData/searchArticle" \
  -H "Content-Type: application/json" \
  -H "X-API-KEY: ak_your_api_key" \
  -d '{"keyword": "AI智能体", "offset": 0, "sortType": "_4"}'

其中sortType参数_4代表按阅读数倒序,_2代表按发布时间倒序,返回结果为标准 JSON 结构,包含文章标题、作者、阅读量、互动数据、发布时间与原文链接,开发者可直接解析使用。

为保证稳定性,采集流程做了多层容错设计:单个平台采集失败不会中断整体任务;每个平台都配置了备用采集策略,主策略超时后自动降级;API 请求之间加入 0.15-0.25 秒的间隔,避免触发频率限制;所有异常信息都会记录在输出结果的 errors 数组中,方便后续排查。

四、工程化扩展:Skill 在 Codex 中的复用与部署

这套能力不止可以做成独立站点,还可以直接集成到本地 Agent 工具中,成为开发者日常工作流的一部分。

红狐数据提供的 Skill 都采用标准化目录结构,包含抖音作品搜索、公众号 10w + 文章推荐、小红书周榜分析、全网热点追踪四个核心 Skill,每个都由 SKILL.md 决策手册、Python 执行脚本与参考资料组成,适配 Codex、Claude Code、PaiCLI 等多种 Agent 环境。

接入方式非常简单:将 Skill 文件放入对应 Agent 的技能目录,再在系统环境变量中配置好红狐数据的 API Key 即可。配置完成后,只需要用自然语言下达指令,比如 “帮我看看最新的公众号 10w + 文章”,Agent 就会自动加载对应 Skill,调用接口拉取数据并返回结构化结果。

不同 Skill 各有侧重:小红书周榜 Skill 可以查询过去 7 天 25 个垂直领域的爆款笔记 TOP50;抖音搜索 Skill 支持关键词泛化,自动将泛化词扩展为 10 个细分关键词;全网热点追踪 Skill 则聚合了 7 个平台的热搜数据,按小时更新,适合做全网趋势研判。

这种 “API+Skill” 的模式,本质是把数据能力封装成了 Agent 可理解、可调用的工具模块,开发者不用重复造轮子,只需要聚焦自己的业务逻辑。这种 “API 底座 + Skill 编排 + 静态输出” 的轻量化架构,也是很多独立开发者偏好的落地路径,在龙虾 PRO 的技术博客里也有过类似的本地 Agent 工程化拆解思路,可供开发者对照参考。

五、部署架构与成本控制

整个项目的技术栈非常轻量化,没有复杂的中间件,非常适合个人开发者和小团队快速落地。

表格

组件技术选型说明
数据采集Python 3.11+仅使用标准库 urllib,无重度依赖
LLM 分析OpenAI 兼容接口默认 DeepSeek v4-pro,可自由切换模型
前端纯 HTML/CSS/JS无前端框架,单页面应用
站点生成Python 静态渲染数据嵌入 HTML,输出到 dist 目录
自动化GitHub Actions每日 00:30 定时执行,支持手动触发
部署Nginx + systemd静态文件服务 + API 代理

整个方案没有使用数据库,每日生成的最新数据写入dist/data/latest.json,同时按日期归档到历史目录,前端直接读取 JSON 渲染页面,运维成本极低。

自动化部署通过 GitHub Actions 实现,工作流定义在.github/workflows/daily-aihot.yml中:每日定时触发后,安装 Python 环境、执行采集分析脚本、验证输出结果,最后通过 SSH 将生成的静态文件同步到服务器。所有 API 密钥都通过 GitHub Secrets 注入,不会出现在代码仓库中,保证密钥安全。

生产环境使用 Nginx 作为反向代理,一方面提供静态文件服务,另一方面将前端的 API 请求转发到本地的 Python 代理服务,避免 API 密钥直接暴露在前端。针对微信公众号图片的防盗链问题,还可以在 Nginx 中配置图片代理,补充正确的 Referer 请求头,保证图片正常显示。

从成本角度看,这套方案的运行开销非常低:红狐数据 API 每日调用约 15-20 次,大模型单次分析消耗 2000-3000token,服务器可以和其他项目共用,几乎没有额外成本,非常适合作为个人开发者的副业项目或团队内部效率工具。

六、落地经验总结

回顾整个项目,从需求梳理到上线部署仅用了半天时间,核心原因在于选对了能力底座,没有重复造轮子。对于想要落地同类 AI 工具的开发者,有几点可复用的经验:

第一,优先选择成熟的数据 API 替代自研爬虫。数据层的稳定性往往是这类项目的最大坑,借助第三方成熟接口,可以把精力集中在业务逻辑和产品体验上,大幅缩短开发周期。

第二,用 Skill 化的思路封装能力。将采集规则、分析逻辑封装成标准化 Skill,不仅可以在不同 Agent 环境间复用,后续调整策略也只需要修改配置,不用动核心代码,维护成本更低。

第三,优先采用轻量化架构。对于工具类产品,静态页面 + JSON 数据的方案足够支撑大多数场景,省去了数据库开发、后端接口开发的工作量,部署和运维都更简单。

第四,做好降级容错设计。大模型调用、第三方 API 都有可能出现不稳定的情况,提前设计好降级方案,保证基础功能可用,产品体验才会更稳定。

对于开发者而言,AI 时代的核心竞争力从来不是重复造底层工具,而是学会组合现有能力,快速把想法变成可落地的产品。别人在用工具追热点的时候,你已经在用 AI 造工具 —— 这正是技术人最大的优势。