Skip to content

给 RAG 系统与 AI Agent 接入微信公众号数据:从文章链接到可编程数据源

做中文知识库或 Agent 应用的开发者,迟早会遇到同一个数据源问题:很多高质量的一手内容——行业深度分析、公司官方动态、垂直领域的专业输出——只发布在微信公众号上,不进搜索引擎索引,也没有开放的订阅或抓取接口。

想把这些内容接入 RAG 的向量库,或者让 Agent 在回答问题时能引用最新一篇公众号文章,通常只有两条路:自己写爬虫应对公众号的反爬与页面结构变化,或者干脆放弃这部分数据源,接受知识库里缺一块中文一手资料。前者的维护成本会持续吃掉团队时间——页面结构一变、登录态一过期,抓取脚本就得重新调;后者则意味着检索结果始终缺一角。

问题的核心不是「技术上能不能抓」,而是抓取、解析、去重、增量更新这一整套流程,本不该是每个做 RAG 的团队都要重复造一遍的轮子。

把公众号变成标准化的数据接口

Mp2RSS 把公众号文章处理成一个可编程的数据源:贴入任意一篇文章的链接(形如 https://mp.weixin.qq.com/s?...),即可订阅该文章所属的整个公众号;此后该号新发布的文章会被持续收录,正文以 Markdown 形式交付,从发文到数据可见平均 2–3 小时。登录使用 GitHub / Google 账号,不需要绑定微信。

对接入 RAG 或 Agent 管道来说,关键的是交付形态足够标准:RSS 2.0 / Atom 1.0 / JSON Feed 1.1 / OPML 2.0 之外,还提供 Open API(JSON 格式,Bearer 鉴权)、CLI 工具mp2rss)以及 AI Agent Skill,可以按团队现有技术栈选最省事的一种接入方式,不必为了这一个数据源单独搭一套抓取基础设施。

三种接入方式,按场景选

方式一:Open API,直接进管道

如果知识库已经有自己的增量抓取 / embedding 流水线,Open API 是最直接的接法。订阅一个公众号:

bash
curl -X POST "https://mp2rss.bugcode.dev/open-api/subscriptions" \
  -H "Authorization: Bearer {feed_key}" \
  -H "Content-Type: application/json" \
  -d '{"url": "https://mp.weixin.qq.com/s?__biz=..."}'

定时拉取该号的文章列表,正文以 Markdown 字段返回,可以直接送入分块(chunking)与向量化环节:

bash
curl "https://mp2rss.bugcode.dev/open-api/subscriptions/{mpId}/articles" \
  -H "Authorization: Bearer {feed_key}"

完整的接口字段与鉴权方式见 Open API 文档。因为正文已经是干净的 Markdown(不含公众号页面的样式、广告位、图片懒加载占位符等噪声),可以省掉一轮 HTML 清洗,直接进 chunking 逻辑。

方式二:CLI,脚本化接入更快

不想直接调 REST 接口,或者想在本地脚本 / CI 任务里快速拉取,可以用命令行工具 mp2rss。安装与登录方式见 CLI 文档,拉取到的文章同样是结构化数据,适合接到定时任务里做增量同步,再喂给本地的 embedding 流程。

方式三:AI Agent Skill,让 Agent 直接查

如果场景是让一个 Agent 在对话中按需检索「某公众号最近发了什么」「某篇文章讲了什么」,不需要预先把全部内容灌入向量库,可以直接用 Mp2RSS 提供的 AI Agent Skill,让 Agent 在需要时实时查询公众号数据,而不是维护一份可能过期的本地副本。这对时效敏感的问题(例如「这个号今天发文了吗」)比预先索引更合适。

一个典型的知识库接入流程

以行业研报号为例,接入流程大致如下:

  1. 建立订阅清单:找到目标公众号任意一篇文章的链接,在控制台或用 Open API 完成订阅,操作细节见订阅管理指引
  2. 首次全量导入:注意首次订阅不会回溯历史文章,只从订阅时刻起收录新文章——如果需要历史资料打底,建议提前规划订阅时间,或先用其他渠道补齐历史数据;
  3. 增量同步:用定时任务(cron、n8n、Zapier 等)定期调用文章列表接口,按发布时间做增量拉取,避免重复入库;
  4. 分块与向量化:正文已是 Markdown,可按标题层级或段落做语义分块,再送入 embedding 模型;
  5. 入库与检索:向量写入检索引擎后,Agent 在回答涉及该领域的问题时即可召回对应文章片段,并可附上原文链接供用户溯源。

对于需要跨语言处理的团队——比如把国内行业动态转成英文简报给海外团队看——同样可以把这条管道的输出送入翻译环节,因为下游拿到的始终是结构化文本,而不是需要先解析的网页。

常见问题

支持哪些数据交付格式? RSS 2.0、Atom 1.0、JSON Feed 1.1、OPML 2.0,以及 Open API(JSON,Bearer 鉴权)、CLI 工具与 AI Agent Skill,文章正文均以 Markdown 提供,方便直接进入文本处理流程。

首次订阅能拿到历史文章吗? 不能。首次订阅不回溯历史文章,从订阅时刻起持续收录该号后续发布的新文章,规划知识库导入时间时需要考虑这一点。

从公众号发文到能在接口里查到,大概要多久? 平均 2–3 小时。这个时延对大多数知识库更新场景是足够的,如果场景需要更强的实时查询能力,可以用 AI Agent Skill 让 Agent 按需查询而非依赖预建索引。

除了微信公众号,还能作为其他信息源接入吗? 支持订阅 X(Twitter)账号,交付形态与公众号一致,可以并入同一套抓取与入库管道,不需要为不同信源分别维护逻辑。

订阅数量有限制吗? 按套餐档位区分:49 元/月 50 个订阅、99 元/月 100 个、399 元/月 400 个,功能一致仅订阅上限不同,具体见会员与计费


想快速上手,可以从快速开始开始,几分钟内完成第一次订阅;也可以直接访问 Mp2RSS 产品主站,贴一篇公众号文章链接试试效果。