浏览器抓取网页(求高手,模拟浏览器抓取网页(宁贵银十))
优采云 发布时间: 2022-03-17 03:28浏览器抓取网页(求高手,模拟浏览器抓取网页(宁贵银十))
求高手,模拟浏览器抓取网页
比如爬取这个网页,如果我写的程序不收录URL末尾的“/”,是不会被爬取的,但是没有最后一个“/”(即:)可以爬取,什么是他的原则?在下面发布我的代码,请改进
<br /><br />function file_get($url){<br /> ob_start();<br /> $ch = curl_init();<br /> <br /> curl_setopt($ch, CURLOPT_COOKIEJAR, "./cookie.txt");<br /> curl_setopt($ch, CURLOPT_USERAGENT, "Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 5.1; .NET CLR 2.0.50727; InfoPath.1; CIBA)");<br /> curl_setopt($ch, CURLOPT_URL, $url);<br /> curl_setopt($ch, CURLOPT_HEADER, FALSE);<br /> curl_setopt($ch, CURLOPT_COOKIESESSION, TRUE);<br /> curl_setopt($ch, CURLOPT_NOBODY, FALSE);<br /><br /> curl_exec($ch);<br /> curl_close($ch);<br /> $content = ob_get_clean();<br /> <br /> <br /><br /> return $content;<br /><br />}<br />
- - - 解决方案 - - - - - - - - - -
CURLOPT_FOLLOWLOCATION