爬虫抓取网页数据( 关于python爬虫实现爬取同一个网站的多页数据的实例内容)
优采云 发布时间: 2021-12-29 07:14爬虫抓取网页数据(
关于python爬虫实现爬取同一个网站的多页数据的实例内容)
python爬虫从同一个网站爬取多页数据的示例说明
更新时间:2021年1月18日14:15:47 作者:宋松
本文小编为大家整理了一个python爬虫从同一个网站爬取多页数据的例子。有兴趣的朋友可以学习参考。
对于一个网站的图片、文字、音频、视频等,如果我们一一下载,不仅浪费时间,还容易出错。Python爬虫帮助我们获取我们需要的数据,这些数据可以批量快速获取。本文小编带领大家通过python爬虫获取获取总页数和更改url的方法,实现对同一网站多页数据的爬取。
一、爬虫的目的
从 Internet 获取您需要的数据
二、爬取过程
1、获取url(网址)。
2、 发出请求并得到响应。
3、 提取数据。
4、保存数据。
三、 爬虫函数
批量快速获取你想要的数据,无需手动一一下载(图片、文字、音频、视频等)
四、 使用python爬虫爬取同一个网站的多页数据
1、需要定位标签,获取总页数
def get_page_size(soup):
pcxt=soup.find('div',{'class':'babynames-term-articles'}).find('nav')
pcxt1=pcxt.find('div',{'class':'nav-links'}).findAll('a')
for i in pcxt1[:-1]:
link=i.get('href')
s=str(i)
page=re.sub('','',page1)
page3=re.sub('','',page2)
pagesize=int(page3)
print(pagesize)
return pagesize
Pass
2、更改url访问网站,也就是写main函数
if __name__ == '__main__':
url="http://www.sheknows.com/baby-names/browse/a/"
soup=get_requests(url)
page=get_page_size(soup)
for i in range(1,page+1):
url1=url+"page/"+str(i)+"/"
soup1=get_requests(url1)
draw_base_list(soup1)
示例扩展:
import requests
from lxml import etree
import re
url="https://movie.douban.com/top250"
header = {"User-Agent":"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/79.0.3945.130 Safari/537.36"}
allMovieList=[]
flag = True
while flag:
html = requests.get(url, headers=header).text
list = etree.HTML(html)
lis = list.xpath('//ol[@class="grid_view"]/li')
for oneSelector in lis:
name = oneSelector.xpath("div/div[2]/div[1]/a/span[1]/text()")[0]
score = oneSelector.xpath("div/div[2]/div[2]/div/span[2]/text()")[0]
people = oneSelector.xpath("div/div[2]/div[2]/div/span[4]/text()")[0]
people = re.findall("(.*?)人评价",people)[0]
oneMovieList = [name,score,people]
allMovieList.append(oneMovieList)
#获取下一页地址
try:
next_url = list.xpath('//span[@class="next"]/a/@href')[0]
if next_url:
url = "https://movie.douban.com/top250"+ next_url
except:
flag = False
print(allMovieList)
至此,这篇关于python爬虫爬取同一个网站的多页数据的示例讲解的文章就介绍到这里了。更多相关python爬虫如何从同一个网站爬取多个页面的数据,请搜索脚本之家之前的文章或继续浏览下面的相关文章。希望大家以后多多支持Scripthome!