php登录抓取网页指定内容(使用Python对一些网站的数据进行采集时需要登录的情况 )

优采云 发布时间: 2022-01-04 16:16

  php登录抓取网页指定内容(使用Python对一些网站的数据进行采集时需要登录的情况

)

  在使用Python对一些网站数据执行采集时,我们经常会遇到需要登录的情况。在这些情况下,使用FireFox等浏览器登录时,内置的在调试器中(快捷键F12)可以看到登录时网页向服务器提交的信息,将这部分信息提取出来使用Python urllib2库结合cookies模拟登录然后采集 数据,如以下代码:

  #coding=utf-8

import urllib

import urllib2

import httplib

import cookielib

url = 'http://www.xxx.net/'

cookie = cookielib.CookieJar()

cj=urllib2.HTTPCookieProcessor(cookie)

#设置登录参数,使用浏览器的调试器等抓包工具得到

postdata=urllib.urlencode({'JSESSIONID':'1F616774D9548C1E8AF12A65B470B663', 'username':'admin','password':'admin'})

#生成请求

request=urllib2.Request(url, postdata)

#设置代理

request.set_proxy('xx.xx.xx.xx:xx','http')

#登录

opener=urllib2.build_opener(cj)

urllib2.install_opener(opener) 

html=opener.open(request)

print html.read()

#打开数据页面开始采集数据

s = urllib2.urlopen('http://www.xx.net').read()

  可以注意到提交的数据收录一个JSESSIONID参数。百度知道,这个ID通常是Tomcat服务器生成新会话时生成的,收录在登录页面的HEAD中,如下图:

  

  有些服务器可以通过使用固定的 JSESSIONID 重复登录,但有些则不能。它应该由服务器设置。对于有固定JSESSIONID可以登录的,上面的代码可以处理,但是如果是动态变化的,需要先获取这个session的JSESSIONID,然后提交登录:

  #获取Tomcat服务器产生的JSESSIONID

request = urllib2.Request(url)

set_cookie = urllib2.urlopen(request).info()['Set-Cookie']

json_id = set_cookie.split(';')[0]#JSESSIONID=3037DCDF69A6454FC525E38C41E6B611

json_id = json_id.split('=')[-1]

print json_id

0 个评论

要回复文章请先登录注册


官方客服QQ群

微信人工客服

QQ人工客服


线