Skip to content

[功能建议] 新增微信公众号文章批量采集 与 通用图文(图片+正文)采集能力 #941

Description

@singsing1

背景 / 动机

目前 MediaCrawler 支持 xhs/dy/ks/bili/wb/tieba/zhihu,
但缺少对「微信公众号文章」的采集,也缺少一个「通用的图文
(封面 + 多张配图 + 正文)落库」能力(当前图片仅在
weibo 有 store_image,douyin 图文只能下载图片、无独立图文记录)。

功能描述

1. 微信公众号文章批量采集

  • 入口A:指定公众号(biz/微信号/主页) → 翻页拉历史文章
    (标题、时间、阅读/点赞/在看、正文、封面、配图)
  • 入口B:指定文章链接/ID → 抓取单篇详情
  • 登录:微信扫码(Cookie 复用)

2. 通用图文采集

  • 对支持图文的平台,统一抽取「封面+配图+正文」,
    落库为独立图文记录,而非仅作为视频附属

技术可行性(草稿,待讨论)

  • 公众号数据来源:mp 文章页(需登录态/强反爬) 或
    搜狗微信(免登录但限流严重)
  • 反爬风险高,建议先以「单篇 + 指定号有限页」为范围,
    遵守 LICENSE 非商用/限速原则
  • 图文落库可复用 AbstractStoreImage / store_image 思路

Metadata

Metadata

Assignees

No one assigned

    Labels

    enhancementNew feature or requestquestionFurther information is requested

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions