您当前的位置: 首页 >  Python

嗨学编程

暂无认证

  • 1浏览

    0关注

    1405博文

    0收益

  • 0浏览

    0点赞

    0打赏

    0留言

私信
关注
热门博文

利用python的爬虫技术爬取百度贴吧的帖子

嗨学编程 发布时间:2019-06-19 15:58:10 ,浏览量:1

实现目标:

1,爬取楼主所发的帖子

2,显示所爬去的楼层以及帖子题目

3,将爬取的内容写入到文件里,并实现动态显示爬取进度

实现工具:python的requests库和正则表达式以及bs4库

首先我们爬取的帖子网址为:https://tieba.baidu.com/p/3138733512?see_lz=1&pn=1,该网址是只看楼主的帖子的网址,因此该网站的源代码内容均为楼主所发贴的内容,爬取起来也比较方便。我们发现需要爬取的帖子一共有5页,我们可以通过for循环来进行对每一页信息的爬取。

接下来我们来整体构建爬取的思路:

  1,爬取该网页的源代码

  2,用正则表达式提取所需内容

  3,用正则匹配对所取内容进行精准修改以达到我们想要的内容

  4,把内容写入到文件并显示写入进度

以下是全部代码

关注
打赏
1663681728
查看更多评论
立即登录/注册

微信扫码登录

0.0786s