python 爬网页遇到重定向怎么处理

如题所述

第1个回答 2017-06-13

1.服务器端重定向，在服务器端完成，一般来说爬虫可以自适应，是不需要特别处理的，如响应代码301（永久重定向）、302（暂时重定向）等。具体来说，可以通过requests请求得到的response对象中的url、status_code两个属性来判断。当status_code为301、302或其他代表重定向的代码时，表示原请求被重定向；当response对象的url属性与发送请求时的链接不一致时，也说明了原请求被重定向且已经自动处理。

2.meta refresh，即网页中的<meta>标签声明了网页重定向的链接，这种重定向由浏览器完成，需要编写代码进行处理。例如，某一重定向如下面的html代码第三行中的注释所示，浏览器能够自动跳转，但爬虫只能得到跳转前的页面，不能自动跳转。

解决办法是通过得到跳转前的页面源码，从中提取出重定向url信息（上述代码第三行中的url属性值）。一个具体的操作：①使用xpath('//meta[@http-equiv="refresh" and @content]/@content')提取出content的值 ②使用正则表达式提取出重定向的url值。

3.js 重定向，通过JavaScript代码形式进行重定向。如下面javascript代码

对于这种方式的跳转，由于可以实现该功能的JavaScript语句有多种形式，不能再使用正则表达式提取url，只能考虑加载JavaScript代码来进行解决。

你可能感兴趣的内容

大家正在搜

python如何处理307重定向爬虫遇到网页重定向 python爬虫重定向 python爬虫爬取网页所有数据 python重定向输出 python标准输出重定向 python输入输出重定向 python如何爬网页 python爬虫网页

非常风气网www.verywind.cn

python 爬网页遇到重定向怎么处理

相关了解……

你可能感兴趣的内容

非常风气网www.verywind.cn

python 爬网页 遇到重定向怎么处理

相关了解……

你可能感兴趣的内容

python 爬网页遇到重定向怎么处理