爬虫抓取网页数据( 关于python爬虫实现爬取同一个网站的多页数据的实例内容)

优采云发布时间: 2021-12-29 07:14

　　爬虫抓取网页数据(

关于python爬虫实现爬取同一个网站的多页数据的实例内容)

　　python爬虫从同一个网站爬取多页数据的示例说明

　　更新时间：2021年1月18日14:15:47 作者：宋松

　　本文小编为大家整理了一个python爬虫从同一个网站爬取多页数据的例子。有兴趣的朋友可以学习参考。

　　对于一个网站的图片、文字、音频、视频等，如果我们一一下载，不仅浪费时间，还容易出错。Python爬虫帮助我们获取我们需要的数据，这些数据可以批量快速获取。本文小编带领大家通过python爬虫获取获取总页数和更改url的方法，实现对同一网站多页数据的爬取。

　　一、爬虫的目的

　　从 Internet 获取您需要的数据

　　二、爬取过程

　　1、获取url（网址）。

　　2、发出请求并得到响应。

　　3、提取数据。

　　4、保存数据。

　　三、爬虫函数

　　批量快速获取你想要的数据，无需手动一一下载（图片、文字、音频、视频等）

　　四、使用python爬虫爬取同一个网站的多页数据

　　1、需要定位标签，获取总页数

def get_page_size(soup):

pcxt=soup.find('div',{'class':'babynames-term-articles'}).find('nav')

pcxt1=pcxt.find('div',{'class':'nav-links'}).findAll('a')

for i in pcxt1[:-1]:

link=i.get('href')

s=str(i)

page=re.sub('','',page1)

page3=re.sub('','',page2)

pagesize=int(page3)

print(pagesize)

return pagesize

Pass

　　2、更改url访问网站，也就是写main函数

if __name__ == '__main__':

url="http://www.sheknows.com/baby-names/browse/a/"

soup=get_requests(url)

page=get_page_size(soup)

for i in range(1,page+1):

url1=url+"page/"+str(i)+"/"

soup1=get_requests(url1)

draw_base_list(soup1)

　　示例扩展：

import requests

from lxml import etree

import re

url="https://movie.douban.com/top250"

header = {"User-Agent":"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/79.0.3945.130 Safari/537.36"}

allMovieList=[]

flag = True

while flag:

html = requests.get(url, headers=header).text

list = etree.HTML(html)

lis = list.xpath('//ol[@class="grid_view"]/li')

for oneSelector in lis:

name = oneSelector.xpath("div/div[2]/div[1]/a/span[1]/text()")[0]

score = oneSelector.xpath("div/div[2]/div[2]/div/span[2]/text()")[0]

people = oneSelector.xpath("div/div[2]/div[2]/div/span[4]/text()")[0]

people = re.findall("(.*?)人评价",people)[0]

oneMovieList = [name,score,people]

allMovieList.append(oneMovieList)

#获取下一页地址

try:

next_url = list.xpath('//span[@class="next"]/a/@href')[0]

if next_url:

url = "https://movie.douban.com/top250"+ next_url

except:

flag = False

print(allMovieList)

　　至此，这篇关于python爬虫爬取同一个网站的多页数据的示例讲解的文章就介绍到这里了。更多相关python爬虫如何从同一个网站爬取多个页面的数据，请搜索脚本之家之前的文章或继续浏览下面的相关文章。希望大家以后多多支持Scripthome！

0

2021-12-29

爬虫抓取网页数据

0 个评论

要回复文章请先登录或注册

AI时代内容工厂

爬虫抓取网页数据( 关于python爬虫实现爬取同一个网站的多页数据的实例内容)

0 个评论

发起人

AI时代内容工厂

爬虫抓取网页数据( 关于python爬虫实现爬取同一个网站的多页数据的实例内容)

0 个评论

发起人

相关问题