# mpScraper **Repository Path**: leicc/mp-scraper ## Basic Information - **Project Name**: mpScraper - **Description**: No description available - **Primary Language**: Unknown - **License**: Not specified - **Default Branch**: main - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 1 - **Forks**: 0 - **Created**: 2026-09-29 - **Last Updated**: 2026-09-29 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # mpScraper ## 微信公众号文章采集,此工具仅用做微信公众号的采集技术学习研究... ## 本软件数据存储都在用户本地data/目录,你放心使用. 站点说明: https://git.x-scraper.cc 点击查看详细教程:https://git.x-scraper.cc/readme.html ## 版本更新 1.1 由于旧版本的API通道wx已经停用,当前新增了一个微信读书的通道,只要微信登录授权之后就可以公众号文章了~ 2026/09/12 微信读书采集设置比较繁琐,具体流程如下: 点击 微信鉴权 之后会打开Chrome浏览器->点击登录->微信扫码登录->完成微信读书鉴权绑定;如果采集异常可以下载微信读书APP->微信登录->搜索关键词->左右滑动到公众号TAB->随便点击一个公共号进入->随便点击一篇文章->完成操作之后重新采集试试 如果任务出现 :累计采集抓取:0 篇文章, 新增: 0 篇文章/请求频率过高[-2014]或者[-2041]说明账号被限流,只要在微信读书->搜索关键词->左右滑动到公众号TAB->随便点击一个公共号进入->随便点击一篇文章 验证一下验证码就可以继续使用啦~; 1.2 新增批量设置公众号的关键词,例如导入了一批公众号,但是想采集这批公众号当中指定的关键词,可以在公众号管理->关键词设置 批量添加关键词;然后在关键词监控那边就可以勾选公众号关键词->点击模拟采集 输入关键词数量即可. ## 1.下载app.zip 解压,或者git 直接clone 双击app.exe 即可启动本地的公众号采集应用 1.1如果应用启动失败可以手动点击 ca-cert.p12 安装代理https证书 1.2如果看到界面http server{ http://127.0.0.1:8081 } 说明服务正常启动,可以直接浏览器打开访问地址 1.3访问地址之后输入账号密码即可,启动界面会展示,例如: -------------------后台服务地址--------------------- 访问地址: http://127.0.0.1:8081 登录账号: admin 登录密码: mp@173 MPC地址: http://127.0.0.1:8082/mcp 提供了获取文章列表以及文章详情的mcp接口,可以直接对接智能体调用文章做初步的资料分析 获取文章列表提示词: 调用文章列表工具函数帮我查询 本地生活 xxx xxx 3个公众号最近一周数据,其中包含关键词 yyy1 yyyy2 yyy3 按照发布时间排序/阅读数/点赞/评论数排序(核心意图是查询 xxx 公众号 当中包含 yyy 关键词 + 发布时间限制) 获取文章详情: 帮我查找id=1的文章内容(这里的id是查找列表的时候已经返回了的) ## 2.提取要采集的公众号文章 2.1打开PC微信,然后访问你想要采集的公众号,随便选中一篇文章,打开之后手动刷新一下微信内置的浏览器 2.2查看http://127.0.0.1:8081/#/mp-user 这个界面正常就会出现公众号信息 2.3公众号管理TAB即可继续操作增量/全量/自定义时间段采集工作 2.4文章采集完之后就可以查看公众号文章TAB,那边可以设置后续的详情/转赞评等采集任务 ## 3.如果知道公众号名称可以在登录订阅号的前提下,手动批量导入要采集的公众号 3.1导入之后复制公众号链接,微信内打开链接随便选择一篇文章,微信内置浏览器会打开文章然后手动刷新 3.2看到公众号管理TAb心跳状态是可用代表当前这个公众号可以发起采集了 3.3如果过期可以点击续期按钮,这个公众号将会自动执行一些自动化RPA流程自动续期,状态会变成可用 ## 4.任务管理tab可以查看历史采集操作记录 ## 5.中台分析查看当前系统配置和统计 5.1上部分查看当前系统的运行情况,下部分数系统的配置 5.2如果不采集了可以点击关闭代理,这样就与微信PC彻底断联,要使用请务必开启代理服务 5.3签名默认有效期1个小时,如果需要继续使用请联系QQ ## 6.开启签名自动续期 采集依赖微信登录令牌,默认有效期30分钟,开启检测到到期之后自动执行续期 要启用这个功能请先本地安装python,例如python12版本,安装的时候勾选把python加入PATH环境变量 命令行安装,使用pip安装脚本依赖包,清华大学的python源安装一下依赖 pip install uiautomation pyperclip pyautogui -i https://pypi.tuna.tsinghua.edu.cn/simple 具体怎么安排上面的python和依赖包请直接问大模型 安装完上面的python依赖记得重启一下应用(关闭命令行窗口,然后双击重新打开即可) ## 7.新增关键词监控/MCP服务 可以设置管理关键词词库,然后批量采集或者增量采集该关键词的公众号推文 新增MPC接口服务,让本地的智能体可以便捷的调用文章数据 7.10 MPC-查询公众号文章数据列表(取到列表之后可以让TA根据返回的id记录查详情,如果需要的话);支持的参数如下 7.10-1 要查询的公众号名称数组,例如:['本地生活','中药指南'] 7.10-2 要查询的公众号名称数组,例如:['GLP-1','肥胖'] 7.10-3 查询指定日期之前的文章,例如:2006-01-01 7.10-4 排序,默认按照发布时间 created_at 降序, read_num:阅读数, old_like_num:点赞数, comment_count:评论数 7.10-5 要抓取返回文章列表数量 7.10-6 当前获取记录的偏移量,默认从0开始 7.11 MPC-查询公众号文章详情数据,告诉TA要查询的文章数值编号即可返回markdown格式的文章详情 ## ⚠️ 重要声明(Disclaimer) 本软件(以下简称“本工具”)仅供学习、研究及合法合规的数据采集用途开发。