浏览器抓取网页(求高手,模拟浏览器抓取网页(宁贵银十) )

优采云 发布时间: 2022-02-16 13:05

  浏览器抓取网页(求高手,模拟浏览器抓取网页(宁贵银十)

)

  求高手,模拟浏览器抓取网页

  比如我爬这个网页,我写的程序没有URL末尾的“/”就无法爬取,但是没有最后一个“/”(即:)可以爬取,什么是他的原则?在下面发布我的代码,请改进

  <br /><br />function file_get($url){<br /> ob_start();<br /> $ch = curl_init();<br /> <br /> curl_setopt($ch, CURLOPT_COOKIEJAR, "./cookie.txt");<br /> curl_setopt($ch, CURLOPT_USERAGENT, "Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 5.1; .NET CLR 2.0.50727; InfoPath.1; CIBA)");<br /> curl_setopt($ch, CURLOPT_URL, $url);<br /> curl_setopt($ch, CURLOPT_HEADER, FALSE);<br /> curl_setopt($ch, CURLOPT_COOKIESESSION, TRUE);<br /> curl_setopt($ch, CURLOPT_NOBODY, FALSE);<br /><br /> curl_exec($ch);<br /> curl_close($ch);<br /> $content = ob_get_clean();<br /> <br /> <br /><br /> return $content;<br /><br />}<br />

  - - - 解决方案 - - - - - - - - - -

  CURLOPT_FOLLOWLOCATION

  

0 个评论

要回复文章请先登录注册


官方客服QQ群

微信人工客服

QQ人工客服


线