爬虫教程-静态网页篇
最近课比较多,写教程的话还是从最熟悉的开始吧,照理来说学校课程上教的是最熟悉的,不过说实话对新手不太友好而且实用性属实8行。爬虫对新手还是很友好的辣,只要你有一点点的python基础就行哦。
说到爬虫,还是不得不提一哈,python做爬虫(尤其是咱这种业余菜鸟玩玩的)真是太方便了,一个requests.get加上目标网址就可以动手嘿嘿嘿辣(当然要注意,在网站后加个/robots.txt看看啥子能爬啥子不能爬哦)
1 | r=requests.get('https://mbd.baidu.com/newspage/data/landingsuper?context=%7B%22nid%22%3A%22news_10600332758289859960%22%7D&n_type=0&p_from=1') #最好按F12复制一哈你的user-agent,要不然别人一眼就看出来你是爬虫辣,咱好歹欲拒还迎一哈 |
这里我们先随手点一个网页,把作者最新文章标题爬下来(当然我也不知道爬这个有什么用😓,单纯是个例子,意思到了就行,你们懂的)
1 | url ='https://mbd.baidu.com/newspage/data/landingsuper?context=%7B%22nid%22%3A%22news_10600332758289859960%22%7D&n_type=0&p_from=1' |
这个时候就要隆重介绍一下极其知名的工具人——status_code!!!
我们只需小小地print一下,就像这样
1 | print(r.status_code) |
可以看到
1 | from bs4 import BeautifulSoup |
看看结果:
1 | txts=soup.select('h3',class_="item-title") |
1 | pattern=r'<h3.*?target="_blank">(.*?)</a></h3>' |
最终代码如下:
1 | import requests |
最终结果就出来辣,我们又是冠军!我们总是冠军!!!
本文作者: ljq
本文链接: https://4mmmm.github.io/2019/11/11/Web-Crawler-tutorial-1/
版权声明: 本作品采用 知识共享署名-非商业性使用-相同方式共享 4.0 国际许可协议 进行许可。转载请注明出处!
![]()
