- 世界75亿人,这么小的概率,能认识你,是我一生的幸运,不妨加个QQ接触一下:52249909
HDFS概述—–基本特征
基于商用硬件环境
HDFS具有高容错性,并且被部署在廉价的硬件之上
HDFS向应用程序提供高的数据吞吐访问,适合于需要处理大规模海量数据集的应用
HDFS遵循部分POSIX协议要求,可以确保应用程序以流的方式访问文件系统数据
HDFS的对现实应用环境的假设及其目标
硬件失效
流式数据访问
海量数据集
追加写入……继续阅读 »
lixian
22112浏览
Map/Reduce简介
1、一种用于在大型商用硬件集群中(成千上万的节点)对海量数据(多个兆兆字节数据集)实施可靠的、高容错的并行计算的软件系统
2、一个最先由Google提出的分布式计算软件构架
3、基本原理:将一个复杂的问题,分成若干个简单的子问题进行解决。然后,对子问题的结果进行合并,得到原有问题的解
Map/Reduce概念
1、”Ma……继续阅读 »
lixian
21928浏览
Hadoop概述
基于Apache基金会下的一个开源项目,致力于开发一个可靠的、大规模的分布式计算框架
用户可采用简单的计算模型在计算机集群下对大规模的数据进行分布式处理
设计理念之一是扩展单一的服务器为成千上万机器的集群,且集群中每一个机器同时提供本地计算力和存储力
Hadoop框架是在应用层检测和处理硬件失效问题,而不是依赖于硬件自身来维持高可用性。
……继续阅读 »
lixian
22157浏览
第六届世界互联网大会乌镇峰会期间,三份业界权威报告《世界互联网发展报告2019》《中国互联网发展报告2019》和《乌镇展望2019》发布。这三份报告不仅把脉互联网创新普及、数字经济、网络文化、网络安全和网络空间国际治理等方面的最新发展态势,还分析了当前互联网发展的机遇与挑战。其中一些数据精准勾勒出中国互联网的现状。
一图速览↓↓↓
……继续阅读 »
lixian
1888浏览
一、解释GFS和HDFS的区别
1.GFS和HDFS都采用单一主控机+多台工作机的模式,由一台主控机(Master)存储系统全部元数据,并实现数据的分布、复制、备份决策,主控机还实现了元数据的checkpoint和操作日志记录及回放功能。
2.GFS最为复杂的部分是对多客户端并发追加同一个文件,即多客户端并发Append模型 。GFS允许文件被多次或者多个客……继续阅读 »
lixian
2646浏览
5月16日,美国商务部工业与安全局(BIS)将华为列入所谓“实体清单”,禁止华为在未经美国政府批准的情况下从美国企业获得元器件和相关技术。20日,谷歌公司表示,将暂停与华为的部分业务和合作,等待美国政府进一步的决定。5月21日,美国商务部称,将给华为及其合作伙伴90天的临时许可。同日,华为创始人、CEO任正非接受记者采访,针对这一消息,任正非表示,“这不是很……继续阅读 »
lixian
1947浏览
一、scrapy框架简介
Scrapy是用纯Python实现一个为了爬取网站数据、提取结构性数据而编写的应用框架,用途非常广泛
框架的力量,用户只需要定制开发几个模块就可以轻松的实现一个爬虫,用来抓取网页内容以及各种图片,非常之方便
二、scrapy架构图
crapy Engine(引擎):
负责Spider、ItemPipeline、Downloade……继续阅读 »
lixian
3843浏览
前言
本课程通过调用MyQR接口来实现生成个人所需二维码,并可以设置二维码的大小、是否在现有图片的基础上生成、是否生成动态二维码。
一、准备环境
创建环境
打开终端,进入 Code 目录,并将其作为我们的工作目录。
$ cd Code
下载MyQR
$ sudo pip3 install MyQR
下载所需资源文件并解压
Code/ $ ……继续阅读 »
lixian
3886浏览
要计算1+2+3,我们可以直接写表达式:
>>> 1 + 2 + 3
6
要计算1+2+3+…+10,勉强也能写出来。
但是,要计算1+2+3+…+10000,直接写表达式就不可能了。
为了让计算机能计算成千上万次的重复运算,我们就需要循环语句。
Python的循环有两种,一种是for…in循环,依次把……继续阅读 »
lixian
3289浏览
在编写shell脚本的时候经常需要在脚本最开头写一些注释信息,这会浪费掉我们很多的时间,下面给大家分享一个shell脚本的模板文件,当建立一个sh文件时,可以自动生成注释信息,只要把下面的代码拷贝到用户的家目录下并命名成 .vimrc 名称。
set ignorecase
set cursorline
set autoindent
autocmd B……继续阅读 »
lixian
22876浏览