网页抓取数据百度百科( python爬虫基本知识爬虫爬虫爬虫)
优采云 发布时间: 2022-04-20 14:36网页抓取数据百度百科(
python爬虫基本知识爬虫爬虫爬虫)
python爬虫基础知识,python爬虫知识
爬虫简介
根据百度百科的定义:网络爬虫(又称网络蜘蛛、网络机器人,在FOAF社区,更常称为网页追逐者),是一种按照一定的规则对万维网信息进行自动爬取的行为。规则程序或脚本。其他不太常用的名称是 ant、autoindex、emulator 或 worm。
随着大数据的不断发展,爬虫技术逐渐进入了人们的视野。可以说爬虫是大数据的产物。至少我在发布大数据后了解了爬虫的技术
随着数据的海量增长,我们需要在互联网上选择需要的数据进行自己的研究和实验。这使用了爬虫技术。跟着小编第一次见见python爬虫吧!
一、请求-响应
在使用python语言实现爬虫时,主要用到了urllib和urllib2这两个库。首先用一段代码解释如下:
import urllib
import urllib2
url="http://www.baidu.com"
request=urllib2.Request(url)
response=urllib2.urlopen(request)
print response.read()
我们知道一个网页是由html作为骨架,js作为肌肉,css作为衣服组成的。以上代码实现的功能是将百度网页的源代码爬取到本地。
其中,url为要爬取的网页的URL; request 发出请求,response 是接受请求后给出的响应。最后read()函数的输出就是百度网页的源码。
二、GET-POST
两者都将数据传输到网页。最重要的区别是GET方法是以链接的形式直接访问的。该链接收录所有参数。当然,如果收录密码,这是一个不安全的选择,但是您可以直观地看到您提交的内容。
POST不会显示URL上的所有参数,但是如果要直接查看提交的内容,不是很方便,可以酌情选择。
POST方法:
GET方法:
import urllib
import urllib2
values={'username':'2680559065@qq.com','Password':'XXXX'}
data=urllib.urlencode(values)
url = "http://passport.csdn.net/account/login"
geturl = url + "?"+data
request=urllib2.Request(geturl)
response=urllib2.urlopen(request)
print response.read()
三、异常处理
处理异常时使用try-except语句。
import urllib2
try:
response=urllib2.urlopen("http://www.xxx.com")
except urllib2.URLError,e:
print e.reason
总结
以上就是小编为大家介绍的python爬虫基础知识。我希望它对你有帮助。如有任何问题,请给我留言,小编会及时回复您。我还要感谢大家对助手之家的支持网站!