导航
  • 报考
  • 备考
  • 政策

报考

备考

复习资料

政策

行业动态

python解析URL的方法是什么?以下的三个程序才是正确的

环球青藤·2020-05-27 13:41:07浏览39 收藏19

请输入下面的图形验证码

提交验证

预约成功

我知道了
摘要 网络爬虫是爬虫的应用之一,那么python解析URL的方法是什么?以下的三个程序才是正确的,环球网校小编建议大家可以试着理解这些内容,也许对您的python学习有帮助,毕竟实践出真知,所以你要知道python解析URL的方法是什么?以下的三个程序才是正确的。

在Python中的urlparse模块主要是用于解析url中的参数 对url按照一定格式进行 拆分或拼接

1、python解析URL的方法是什么——urlparse.urlparse

将url分为6个部分,返回一个包含6个字符串项目的元组:协议、位置、路径、参数、查询、片段。

import urlparse

url_change = urlparse.urlparse('https://i.cnblogs.com/EditPosts.aspx?opt=1')

print url_change

输出结果为:

1ParseResult(scheme='https', netloc='i.cnblogs.com', path='/EditPosts.aspx', params='', query='opt=1', fragment='')

其中 scheme 是协议 netloc 是域名服务器 path 相对路径 params是参数,query是查询的条件

1urlparse.parse_qs(urlparse.urlparse(url).query)

这个是获取urlparse分割后元祖中的某一项 urlparse.urlparse(url).query 获取查询条件

parse_qs 有几种实现

urlparse.parse_qs 返回字典

urlparse.parse_qsl 返回列表

2、python解析URL的方法是什么——urlparse.urlsplit

和urlparse差不多,将url分为5部分,返回一个包含5个字符串项目的元组:协议、位置、路径、查询、片段。

import urlparse

url_change = urlparse.urlsplit('https://i.cnblogs.com/EditPosts.aspx?opt=1')

print url_change

SplitResult(scheme='https', netloc='i.cnblogs.com', path='/EditPosts.aspx', query='opt=1', fragment='')

其中 scheme 是协议 netloc 是域名服务器 path 相对路径 query是查询的条件

3、python解析URL的方法是什么——urlparse.urljoin

将相对的地址组合成一个url,对于输入没有限制,开头必须是http://,否则将不组合前面。

import urlparse

new_url = urlparse.urljoin('https://baidu.com/ssss/','88888')

print new_url

输出 https://baidu.com/ssss/88888

如果输入错误信息 如 new_url = urlparse.urljoin('122','88888') 并不会将两者合并 输出‘88888’

以上就是《python解析URL的方法是什么?以下的三个程序才是正确的》的全部内容,这些解析网站URL的方法学会了,你的python一定会突飞猛进,环球网校的小编也祝大家python学习之路顺利。如果你想知道更多的python编程知识,可以点击下方资料下载链接。

展开剩余
资料下载
历年真题
精选课程
老师直播

注册电脑版

版权所有©环球青藤All Rights Reserved