开源公司内部的微信爬虫,寻求志同道合的人一起来改进

2016-09-20 18:35:51 +08:00
 crayonyi

一个爬取微信公众号文章的爬虫

github: https://github.com/bowenpay/wechat-spider

微信爬虫的由来

我们是一家帮助中国 5000 万贫困人口与社会公益组织的对接的公司。

我们通过国家和地方政府的“建档立卡”系统,获取到了一手的贫困户数据,目前有 100 万左右,总数为 5000 万,目前每个月都在增长。

为了帮助这部分贫困户对接公益机构,我写了这个微信爬虫,从微信公众号发布的文章中上找出最新的公益项目。

这种找项目的方式的可行性,我们还在试验中。

起初,为了快速上线,本爬虫的代码是基于我的另一个 通用爬虫项目 开发的,还不是很完善,所以希望任何对本项目感兴趣的人联系我,与我一同改进这个项目。

联系方式:在该 issue 下留言告诉我 点击去留言

界面预览

1 ) 要爬取的微信公众号列表

2 ) 要爬取的文章关键字列表

3 ) 已经爬取的微信文章

4 ) 查看文章,并标记是否可用

5 ) 控制爬取进程数

使用到的技术和框架

django mysql redis lxml selenium

11887 次点击
所在节点    Python
65 条回复
PP
2016-09-21 00:43:18 +08:00
@lxyyzm 尽管人无完人,可是如果您在 V 站活动时间足够长,那么一定会有机会读到他的许多言论,您将会发现他的才智还是很不错的。用“智商捉急”来评论他人很不礼貌,还请尊重他人!
gladuo
2016-09-21 01:44:42 +08:00
@PP hhh
lichun
2016-09-21 01:47:26 +08:00
@lxyyzm 这不是写最小天气预报那 XX 嘛?还会喷别人?
Lonely
2016-09-21 05:08:52 +08:00
@lichun 这人就是个 sb ,不必理他
lxyyzm
2016-09-21 08:35:11 +08:00
@PP 至少在这个问题上智商显得有点捉急 o(∩_∩)o ,不过还是多谢您的善意提醒!@em70 ,如果有冒犯到 ,向您道歉!
xi_lin
2016-09-21 09:18:49 +08:00
手动点赞
PP
2016-09-21 09:41:48 +08:00
@lichun @Lonely Be nice, be kind.
est
2016-09-21 09:53:43 +08:00
其实爬 sogou 的都是爬的「订阅号」,真正的「公众号」 比如 招商银行 好像都爬不到。
crayonyi
2016-09-21 10:20:05 +08:00
@est 你说的是服务号吧 好像确实没有。 不过服务号定位不一样,侧重于服务,而非宣传。一个月只能发 4 篇文章,量本身也不大。暂时还没有去考虑。
crayonyi
2016-09-21 10:20:50 +08:00
@lixuda 会的。所以用了代理池,而且代理服务器的 ip 是 3 分钟切换一次。
crayonyi
2016-09-21 10:33:10 +08:00
@em70 公益行业是个互联网化程度很低的行业,也是效率较低的行业。 但这也正是我们的机会。 公益和商业是可以共赢的。公司如果考虑长远发展,不只顾眼前的利益,是能获取更大利益的。
rebelboy2
2016-09-21 10:55:06 +08:00
我给你说,爬这种数据都没法直接赚钱。
要爬爬那种数据本身就能兑换价值的,比如 国际机票,国内机票
这种投放到携程去哪平台,可以直接产生价值
Kuo
2016-09-21 11:06:43 +08:00
看起来不错,感谢分享
crayonyi
2016-09-21 11:21:51 +08:00
@rebelboy2 也有一些人找过我,要爬这种类型的数据、以及做数据分析和广告投放的。 但是公司的主业是做“中国 5000 万贫困人口与社会公益组织的对接”,所以就没有去做你说的“据本身就能兑换价值”的事情。
我一个人也有些忙不经过来。
不过这个爬虫是可以爬任意数据的,如果你感兴趣,可以做一些尝试。 我可以帮你搭建下基础环境。
xinali
2016-09-21 11:26:53 +08:00
@crayonyi 怎么加入?
crayonyi
2016-09-21 11:36:56 +08:00
@xinali 在 github issue 下留言告诉我 https://github.com/bowenpay/wechat-spider/issues/1 ,这两天我把要做的事情,都列出来。 合作方式也写在上面。
figofuture
2016-09-21 11:40:00 +08:00
mark
ljcarsenal
2016-09-21 11:55:50 +08:00
@rebelboy2 去哪携程的什么平台啊。。会抓取却不知道如何利用价值
goodluck
2016-09-21 12:00:17 +08:00
要不是最近比较忙,我就来参加了。。。上班狗闲暇时间很少。。,经常加班。
bramblex
2016-09-21 12:05:49 +08:00
@likai

国外的 ngo 还真是这么做的, ngo 可以在捐款中抽取 ngo 运营费用,其中包括运营人员的基本工资。但是所有的开销啥的都必须是透明的,被监督的。

虽然做公益是靠理想,但是光靠理想会饿死的。然而广大圣母婊往往都喜欢脱离现实,不管不顾他人死活,只为了抒发原始情绪,感动自己。

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/307617

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX