当前位置: 首页 > news >正文

政府机关网站制作网站快速优化排名推荐

政府机关网站制作,网站快速优化排名推荐,如何做自己网站平台,素材网站定制爬虫为网络爬虫(又称为网页蜘蛛,网络机器人,在FOAF社区中间,更经常的称为网页追逐者),是一种按照一定的规则,自动地抓取万维网信息的程序或者脚本。另外一些不常使用的名字还有蚂蚁、自动索引、…

爬虫为网络爬虫(又称为网页蜘蛛,网络机器人,在FOAF社区中间,更经常的称为网页追逐者),是一种按照一定的规则,自动地抓取万维网信息的程序或者脚本。另外一些不常使用的名字还有蚂蚁、自动索引、模拟程序或者蠕虫。

通过模拟浏览器发送网络请求,接收响应,按照一定规则提取数据。Python作为一种功能强大且易于学习的编程语言,非常适合用来编写网络爬虫。

爬虫的基本原理

爬虫的工作流程通常包括以下几个步骤:

  1. 发送HTTP请求到目标网站。

  2. 接收网站返回的响应数据,通常是HTML格式。

  3. 解析HTML数据,提取有用信息。

  4. 保存提取的数据,进行后续处理或分析

Python 爬虫架构主要由五个部分组成,分别是调度器、URL管理器、网页下载器、网页解析器、应用程序(爬取的有价值数据)。

  • 调度器:相当于一台电脑的CPU,主要负责调度URL管理器、下载器、解析器之间的协调工作。
  • URL管理器:包括待爬取的URL地址和已爬取的URL地址,防止重复抓取URL和循环抓取URL,实现URL管理器主要用三种方式,通过内存、数据库、缓存数据库来实现。
  • 网页下载器:通过传入一个URL地址来下载网页,将网页转换成一个字符串,网页下载器有urllib2(Python官方基础模块)包括需要登录、代理、和cookie,requests(第三方包)
  • 网页解析器:将一个网页字符串进行解析,可以按照我们的要求来提取出我们有用的信息,也可以根据DOM树的解析方式来解析。网页解析器有正则表达式(直观,将网页转成字符串通过模糊匹配的方式来提取有价值的信息,当文档比较复杂的时候,该方法提取数据的时候就会非常的困难)、html.parser(Python自带的)、beautifulsoup(第三方插件,可以使用Python自带的html.parser进行解析,也可以使用lxml进行解析,相对于其他几种来说要强大一些)、lxml(第三方插件,可以解析 xml 和 HTML),html.parser 和 beautifulsoup 以及 lxml 都是以 DOM 树的方式进行解析的。

下面用一个图来解释一下调度器是如何协调工作的:

Python爬虫的实现

在Python中,实现爬虫通常需要用到以下几个库:

  • requests:用于发送网络请求。

  • BeautifulSoup 或 lxml:用于解析HTML数据。

  • re(正则表达式):用于进行复杂的文本匹配。

  • pandas 或 csv:用于数据存储和处理。

本次实验只涉及requests库

# 一、简单爬虫框架示例代码"""通用代码框架:可使网页爬取变得更稳定更有效下面是一个爬取百度网页的例子,正常情况下是返回"""
import requestsdef get_HTML_Text():try:r = requests.get(url, timeout=30)r.raise_for_status()# 若状态不是200,引发HTTPError异常r.encoding = r.apparent_encodingreturn r.textexcept:return '产生异常!'if __name__ == '__main__':url = "http://www.baiu.com"print(get_HTML_Text())
# 二、结果分析# 正常情况:其实去掉三个www中的一个也会正常# 异常情况1:将url中http去掉# 异常情况2:将wwww.去掉# 三、总结# 异常情况的原因多样,通用代码框架并不能包含全部异常,代码写正确才是王道

requests.get(url, timeout=30)  #这个代码的意思是访问这个网站30秒之后停止等待响应

url是百度的网站,本次实验的网址是百度的网址

 timeout 参数是设定的秒数时间之后停止等待响应。基本上所有的生产代码都应该使用这一参数。如果不使用,你的程序可能会永远失去响应:

注意:timeout 仅对连接过程有效,与响应体的下载无关。 timeout 并不是整个下载响应的时间限制,而是如果服务器在 timeout 秒内没有应答,将会引发一个异常(更精确地说,是在 timeout 秒内没有从基础套接字上接收到任何字节的数据时)If no timeout is specified explicitly, requests do not time out.

如果 HTTP 请求返回了不成功的状态码, r.raise_for_status() 会抛出一个 HTTPError 异常。

r.encoding = r.apparent_encoding是响应的编码
return r.text是对响应进行解码

所有Requests显式抛出的异常都继承自 requests.exceptions.RequestException 

注意事项

在编写爬虫时,需要遵守目标网站的robots.txt协议,尊重网站的爬虫规则,避免对网站造成不必要的负担。同时,为了防止被网站封禁,应适当控制爬取速度,可以在请求间添加延时,并使用代理IP。

通过学习Python爬虫,你可以轻松获取网络上的各种数据,为数据分析、机器学习等领域提供丰富的数据源。无论是个人学习还是职业发展,掌握Python爬虫技能都将是一项宝贵的资产。

http://www.dinnco.com/news/62182.html

相关文章:

  • 做游戏网站的目地下载应用商店
  • 海宁网站制作怎么建网页
  • 湖南做网站 x磐石网络最新热搜新闻
  • 陕西的网站建设公司排名广州竞价外包
  • 网站开发 jsp加密关键词排名代做
  • 公司网站开发报价网络推广一个月的收入
  • 长春集团网站建设b站推广渠道
  • 上海娱乐会所长沙网站优化公司
  • pk10网站开发佛山网站建设制作公司
  • 河南免费网站建设公司推荐seo排名策略
  • 刘涛做的网站网站设计方案模板
  • 专门做字体设计的网站如何制作一个公司网站
  • 宜兴建设局 审图中心 网站百度上海分公司地址
  • 宁波网站推广渠道关键词推广工具
  • 交友网站该如何做东莞整站优化排名
  • 网站备案了还放在香港空间可以么网络推广员好做吗
  • 有批量做基因结构的网站吗优化系统
  • 诸城哪里做网站seo综合查询站长工具怎么用
  • 哪里有做商城的网站宁波网站制作优化服务
  • pyhton做网站宁波seo排名优化培训
  • 网站开发需要哪些岗位百度业务员联系电话
  • 网乐科技网站建设十大免费无代码开发软件
  • 耒阳在那做网站最新注册域名查询
  • 客户端 网站开发 手机软件开发网络优化器下载
  • 开通网站软件的会计科目怎么做西安seo托管
  • 网站建设关键要做好哪些工作活动宣传推广方案怎么写
  • 淘客网站怎么做百度总部公司地址在哪里
  • 找人做网站流程中国新闻网
  • 网站编排成人短期电脑培训班学费
  • 优秀网站推广方案国内seo工具