浏览器抓取网页(求高手,模拟浏览器抓取网页(宁贵银十) )
优采云 发布时间: 2022-02-16 13:05浏览器抓取网页(求高手,模拟浏览器抓取网页(宁贵银十)
)
求高手,模拟浏览器抓取网页
比如我爬这个网页,我写的程序没有URL末尾的“/”就无法爬取,但是没有最后一个“/”(即:)可以爬取,什么是他的原则?在下面发布我的代码,请改进
<br /><br />function file_get($url){<br /> ob_start();<br /> $ch = curl_init();<br /> <br /> curl_setopt($ch, CURLOPT_COOKIEJAR, "./cookie.txt");<br /> curl_setopt($ch, CURLOPT_USERAGENT, "Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 5.1; .NET CLR 2.0.50727; InfoPath.1; CIBA)");<br /> curl_setopt($ch, CURLOPT_URL, $url);<br /> curl_setopt($ch, CURLOPT_HEADER, FALSE);<br /> curl_setopt($ch, CURLOPT_COOKIESESSION, TRUE);<br /> curl_setopt($ch, CURLOPT_NOBODY, FALSE);<br /><br /> curl_exec($ch);<br /> curl_close($ch);<br /> $content = ob_get_clean();<br /> <br /> <br /><br /> return $content;<br /><br />}<br />
- - - 解决方案 - - - - - - - - - -
CURLOPT_FOLLOWLOCATION