nosql社区,数据库 nosql

比Redis好用的NoSQL

实际上为了更好的描述实体之间的关系，我们要是再继续使用Redis的话，是不是感觉实体之间的关系不够那么的明显，虽然也是属于NoSQL的一种，但是相对来说，Redis，表现实体之间的关系就没有那么清晰了，为了更好的描述实体之间的关系，就会使用图形数据库来进行了，那么今天阿粉介绍的，就是一个图形化的数据可，Neo4J。

创新互联公司：于2013年成立为各行业开拓出企业自己的“网站建设”服务，为千余家公司企业提供了专业的成都做网站、成都网站制作、成都外贸网站建设、网页设计和网站推广服务，按需搭建网站由设计师亲自精心设计，设计的效果完全按照客户的要求，并适当的提出合理的建议，拥有的视觉效果，策划师分析客户的同行竞争对手，根据客户的实际情况给出合理的网站构架，制作客户同行业具有领先地位的。

Neo4j是一个世界领先的开源的基于图的数据库。它是使用Java语言完全开发的。那么什么是图数据库呢？图数据库是以图结构的形式存储数据的数据库。它以节点，关系和属性的形式存储应用程序的数据。正如RDBMS以表的“行，列”的形式存储数据，GDBMS以图的形式存储数据。

RDBMS与图数据库的区别

1.Tables 表Graphs 图表

2.Rows 行Nodes 节点

3.Columns and Data 列和数据 Properties and its values属性及其值

4.Constraints 约束Relationships 关系

5.Joins 加入Traversal 遍历

说完了图形数据库，我们就来看看这个 Neo4J 数据库吧

neo4j是用Java语言编写的图形数据库，运行时需要启动JVM进程，因此，需安装JAVA SE的JDK。关于 Java 怎么安装，我就不用再多废话了吧，到时候别忘了检测一下 Java 的版本就好了， java -version

接下来我们就是要进行一个安装了，我们先去官网，下载社区版，企业版要收费的，注意哈。

官网地址

下载完成，直接开始安装，傻瓜式操作即可。

Neo4j应用程序有如下主要的目录结构：

注意，如果你使用的是Zip的压缩包来进行的使用的话，那么你就需要注意一些地方，比如你如果是用 Zip 的包解压之后，并且想要通过 bat 的命令启动，直接在目录下进行 cmd ，然后 neo4j.bat ,这时候可能会出现一个问题，就是版本可能会出现问题，你如果下载使用的是最新版的 Neo4J ,那么就可能会让你使用 JDK 11 ，而阿粉就是踩过了这个大坑之后，才发现，bat 闪退的原因。

这样就是说明我们的 JDk 的版本对应的和 Neo4J 需要的 JDK 是不匹配的，我们就需要换一下我们的 JDK 了。把他换成 JDK 11 就好了，再次启动。

这时候，我们就直接访问 localhost：7474 的端口，直接就能看到如下的画面， 1.jpg

刚进入的时候可能需要大家输入帐号密码，默认的帐号密码就是，neo4j 修改成你想要的就行了。

这样登录进去我们就能开始正式学习 Neo4J 的所有内容了。

Neo4j - CQL语法

我们在讲语法之前首先我们先得看看 Neo4J 的构建模块，不然之后的查询都是无意义的。

Neo4j图数据库主要有以下构建块 -

节点是图表的基本单位。它包含具有键值对的属性，如下所示

属性是用于描述图节点和关系的键值对

关系是图形数据库的另一个主要构建块。它连接两个节点，如下所示。

Label将一个公共名称与一组节点或关系相关联。节点或关系可以包含一个或多个标签。我们可以为现有节点或关系创建新标签。我们可以从现有节点或关系中删除现有标签。

Neo4j数据浏览器一旦我们安装Neo4j，我们可以访问Neo4j数据浏览器使用以下URL

http：// localhost：7474 / browser /

CREATE 语法

CREATE ( : )

它是我们要创建的节点名称。

它是一个节点标签名称

我们可以创建一个节点，然后给他安排上一个标签

CREATE (emp:Employee)

当我们看到

Added 1 label, created 1 node, completed after 74 ms.

这就创建成功了，

那么怎么查看呢？

MATCH语法

MATCH ( : ) return xxx

是这个样子的

但是看到里面竟然没有东西，就相当于是一个空的对象，那是不是就应该给里面放入属性的操作呢？没错，肯定有

CREATE (emp:Employee{ id : 1001 ,name :"lucy", age : 10})

Added 1 label, created 1 node, set 3 properties, completed after 163 ms. 创建成功。

我们再次查看就能看到

如果我们想只要其中的一些对象的属性，而不是全部属性，那应该怎么操作呢？

RETURN语法

RETURN 可以返回的是一个对象，也可以是对象中的属性，比如：

结果就是下面这个样子的，大家看一下，是不是感觉还是挺好用的。

** WHERE语法**

WHERE

为什么在前面的位置阿粉说，CQL 是和 SQL 类型的，这完全是因为很多东西和 SQL 是类似的。

结果如下：

相同的还有

布尔运算符描述 AND 和 OR 或者 NOT 非 XOR 异或

比较运算符描述 = “等于”运算符 “不等于”运算符 “小于”运算符 “大于”运算符 = “小于或等于”运算符。 = “大于或等于”运算符。

DELETE语法

删除语法必然是有的，因为有创建，肯定有删除。

DELETE

但是这个命令也不是单独使用的哈，

MATCH (e: Employee) DELETE e

直接删除成功。

基础的东西讲完了，阿粉就得说说这个比较重要的内容了，关系，

我们之前创建节点的时候，那叫一个简单舒适加愉快，但是创建关系就比较复杂了，因为需要考虑如何匹配到有关系的两个节点，以及关系本身的属性如何设置。这里我们就简单学一下如何建立节点之间的关系。

由于Neo4j CQL语法是以人类可读的格式。 Neo4j CQL也使用类似的箭头标记来创建两个节点之间的关系。

每个关系（）包含两个节点

在Neo4j中，两个节点之间的关系是有方向性的。它们是单向或双向的。

如果我们尝试创建一个没有任何方向的关系，那么就会报错。

关系创建语法

CREATE ( )-[ ]-( )

我们这里直接使用创建新的节点来创建关系。

提示创建成功

这里关系名称是“CONTAINS”

关系标签是“contains”。

这么看是看不出有啥关系的，但是，我们可以从另外的一个位置

这样看下来，这个 Neo4J 简单操作是不是就学会了，阿粉接下来的文章中讲怎么使用 Java 来操作 Neo4J 数据库。欢迎大家来观看。

目前哪些NoSQL数据库应用广泛，各有什么特点

特点：

它们可以处理超大量的数据。

它们运行在便宜的PC服务器集群上。

PC集群扩充起来非常方便并且成本很低，避免了“sharding”操作的复杂性和成本。

它们击碎了性能瓶颈。

NoSQL的支持者称，通过NoSQL架构可以省去将Web或Java应用和数据转换成SQL友好格式的时间，执行速度变得更快。

“SQL并非适用于所有的程序代码，” 对于那些繁重的重复操作的数据，SQL值得花钱。但是当数据库结构非常简单时，SQL可能没有太大用处。

没有过多的操作。

虽然NoSQL的支持者也承认关系数据库提供了无可比拟的功能集合，而且在数据完整性上也发挥绝对稳定，他们同时也表示，企业的具体需求可能没有那么多。

Bootstrap支持

因为NoSQL项目都是开源的，因此它们缺乏供应商提供的正式支持。这一点它们与大多数开源项目一样，不得不从社区中寻求支持。

优点：

易扩展

NoSQL数据库种类繁多，但是一个共同的特点都是去掉关系数据库的关系型特性。数据之间无关系，这样就非常容易扩展。也无形之间，在架构的层面上带来了可扩展的能力。

大数据量，高性能

NoSQL数据库都具有非常高的读写性能，尤其在大数据量下，同样表现优秀。这得益于它的无关系性，数据库的结构简单。一般MySQL使用 Query Cache，每次表的更新Cache就失效，是一种大粒度的Cache，在针对web2.0的交互频繁的应用，Cache性能不高。而NoSQL的 Cache是记录级的，是一种细粒度的Cache，所以NoSQL在这个层面上来说就要性能高很多了。

灵活的数据模型

NoSQL无需事先为要存储的数据建立字段，随时可以存储自定义的数据格式。而在关系数据库里，增删字段是一件非常麻烦的事情。如果是非常大数据量的表，增加字段简直就是一个噩梦。这点在大数据量的web2.0时代尤其明显。

高可用

NoSQL在不太影响性能的情况，就可以方便的实现高可用的架构。比如Cassandra，HBase模型，通过复制模型也能实现高可用。

主要应用：

Apache HBase

这个大数据管理平台建立在谷歌强大的BigTable管理引擎基础上。作为具有开源、Java编码、分布式多个优势的数据库，Hbase最初被设计应用于Hadoop平台，而这一强大的数据管理工具，也被Facebook采用，用于管理消息平台的庞大数据。

Apache Storm

用于处理高速、大型数据流的分布式实时计算系统。Storm为Apache Hadoop添加了可靠的实时数据处理功能，同时还增加了低延迟的仪表板、安全警报，改进了原有的操作方式，帮助企业更有效率地捕获商业机会、发展新业务。

Apache Spark

该技术采用内存计算，从多迭代批量处理出发，允许将数据载入内存做反复查询，此外还融合数据仓库、流处理和图计算等多种计算范式，Spark用Scala语言实现，构建在HDFS上，能与Hadoop很好的结合，而且运行速度比MapReduce快100倍。

Apache Hadoop

该技术迅速成为了大数据管理标准之一。当它被用来管理大型数据集时，对于复杂的分布式应用，Hadoop体现出了非常好的性能，平台的灵活性使它可以运行在商用硬件系统，它还可以轻松地集成结构化、半结构化和甚至非结构化数据集。

Apache Drill

你有多大的数据集？其实无论你有多大的数据集，Drill都能轻松应对。通过支持HBase、Cassandra和MongoDB，Drill建立了交互式分析平台，允许大规模数据吞吐，而且能很快得出结果。

Apache Sqoop

也许你的数据现在还被锁定于旧系统中，Sqoop可以帮你解决这个问题。这一平台采用并发连接，可以将数据从关系数据库系统方便地转移到Hadoop中，可以自定义数据类型以及元数据传播的映射。事实上，你还可以将数据（如新的数据）导入到HDFS、Hive和Hbase中。

Apache Giraph

这是功能强大的图形处理平台，具有很好可扩展性和可用性。该技术已经被Facebook采用，Giraph可以运行在Hadoop环境中，可以将它直接部署到现有的Hadoop系统中。通过这种方式，你可以得到强大的分布式作图能力，同时还能利用上现有的大数据处理引擎。

Cloudera Impala

Impala模型也可以部署在你现有的Hadoop群集上，监视所有的查询。该技术和MapReduce一样，具有强大的批处理能力，而且Impala对于实时的SQL查询也有很好的效果，通过高效的SQL查询，你可以很快的了解到大数据平台上的数据。

Gephi

它可以用来对信息进行关联和量化处理，通过为数据创建功能强大的可视化效果，你可以从数据中得到不一样的洞察力。Gephi已经支持多个图表类型，而且可以在具有上百万个节点的大型网络上运行。Gephi具有活跃的用户社区，Gephi还提供了大量的插件，可以和现有系统完美的集成到一起，它还可以对复杂的IT连接、分布式系统中各个节点、数据流等信息进行可视化分析。

MongoDB

这个坚实的平台一直被很多组织推崇，它在大数据管理上有极好的性能。MongoDB最初是由DoubleClick公司的员工创建，现在该技术已经被广泛的应用于大数据管理。MongoDB是一个应用开源技术开发的NoSQL数据库，可以用于在JSON这样的平台上存储和处理数据。目前，纽约时报、Craigslist以及众多企业都采用了MongoDB，帮助他们管理大型数据集。（Couchbase服务器也作为一个参考）。

十大顶尖公司：

Amazon Web Services

Forrester将AWS称为“云霸主”，谈到云计算领域的大数据，那就不得不提到亚马逊。该公司的Hadoop产品被称为EMR（Elastic Map Reduce），AWS解释这款产品采用了Hadoop技术来提供大数据管理服务，但它不是纯开源Hadoop，经过修改后现在被专门用在AWS云上。

Forrester称EMR有很好的市场前景。很多公司基于EMR为客户提供服务，有一些公司将EMR应用于数据查询、建模、集成和管理。而且AWS还在创新，Forrester称未来EMR可以基于工作量的需要自动缩放调整大小。亚马逊计划为其产品和服务提供更强大的EMR支持，包括它的RedShift数据仓库、新公布的Kenesis实时处理引擎以及计划中的NoSQL数据库和商业智能工具。不过AWS还没有自己的Hadoop发行版。

Cloudera

Cloudera有开源Hadoop的发行版，这个发行版采用了Apache Hadoop开源项目的很多技术，不过基于这些技术的发行版也有很大的进步。Cloudera为它的Hadoop发行版开发了很多功能，包括Cloudera管理器，用于管理和监控，以及名为Impala的SQL引擎等。Cloudera的Hadoop发行版基于开源Hadoop，但也不是纯开源的产品。当Cloudera的客户需要Hadoop不具备的某些功能时，Cloudera的工程师们就会实现这些功能，或者找一个拥有这项技术的合作伙伴。Forrester表示：“Cloudera的创新方法忠于核心Hadoop，但因为其可实现快速创新并积极满足客户需求，这一点使它不同于其他那些供应商。”目前，Cloudera的平台已经拥有200多个付费客户，一些客户在Cloudera的技术支持下已经可以跨1000多个节点实现对PB级数据的有效管理。

Hortonworks

和Cloudera一样，Hortonworks是一个纯粹的Hadoop技术公司。与Cloudera不同的是，Hortonworks坚信开源Hadoop比任何其他供应商的Hadoop发行版都要强大。Hortonworks的目标是建立Hadoop生态圈和Hadoop用户社区，推进开源项目的发展。Hortonworks平台和开源Hadoop联系紧密，公司管理人员表示这会给用户带来好处，因为它可以防止被供应商套牢（如果Hortonworks的客户想要离开这个平台，他们可以轻松转向其他开源平台）。这并不是说Hortonworks完全依赖开源Hadoop技术，而是因为该公司将其所有开发的成果回报给了开源社区，比如Ambari，这个工具就是由Hortonworks开发而成，用来填充集群管理项目漏洞。Hortonworks的方案已经得到了Teradata、Microsoft、Red Hat和SAP这些供应商的支持。

IBM

当企业考虑一些大的IT项目时，很多人首先会想到IBM。IBM是Hadoop项目的主要参与者之一，Forrester称IBM已有100多个Hadoop部署，它的很多客户都有PB级的数据。IBM在网格计算、全球数据中心和企业大数据项目实施等众多领域有着丰富的经验。“IBM计划继续整合SPSS分析、高性能计算、BI工具、数据管理和建模、应对高性能计算的工作负载管理等众多技术。”

Intel

和AWS类似，英特尔不断改进和优化Hadoop使其运行在自己的硬件上，具体来说，就是让Hadoop运行在其至强芯片上，帮助用户打破Hadoop系统的一些限制，使软件和硬件结合的更好，英特尔的Hadoop发行版在上述方面做得比较好。Forrester指出英特尔在最近才推出这个产品，所以公司在未来还有很多改进的可能，英特尔和微软都被认为是Hadoop市场上的潜力股。

MapR Technologies

MapR的Hadoop发行版目前为止也许是最好的了，不过很多人可能都没有听说过。Forrester对Hadoop用户的调查显示，MapR的评级最高，其发行版在架构和数据处理能力上都获得了最高分。MapR已将一套特殊功能融入其Hadoop发行版中。例如网络文件系统（NFS）、灾难恢复以及高可用性功能。Forrester说MapR在Hadoop市场上没有Cloudera和Hortonworks那样的知名度，MapR要成为一个真正的大企业，还需要加强伙伴关系和市场营销。

如何学习及选择大数据非关系型数据库NoSQL

是的，NoSQL（非关系型数据库）简单来说，关系模型指的就是二维表格模型，而一个关系型数据库就是由二维表及其之间的联系组成的一个数据组织。 NoSQL最普遍的解释是“非关系型的”，强调Key-Value Stores和文档数据库的优点，而不是单纯的反对RDBMS。

非关系型数据库特点

1.可以处理超大量的数据。

2.运行在便宜的PC服务器集群上。PC集群扩充起来非常方便并且成本很低，避免了“sharding”操作的复杂性和成本。

3.击碎了性能瓶颈。NoSQL的支持者称，通过NoSQL架构可以省去将Web或Java应用和数据转换成SQL友好格式的时间，执行速度变得更快。

4.没有过多的操作。

5.支持者来源于社区。因为NoSQL项目都是开源的，因此它们缺乏供应商提供的正式支持。这一点它们与大多数开源项目一样，不得不从社区中寻求支持。

NoSQL会取代完全取代关系型数据库吗？

对此，前Google工程师，Milo（本地商店搜索引擎）创始人Ted Dziuba最近发表标题惊人的博客“I Can't Wait for NoSQL to Die”，对NoSQL的适用范围进行了分析。他认为， NoSQL也会带来一连串的新问题，并不会成为主流，无法取代关系型数据库。他的理由是：Cassandra等NoSQL数据库在使用上并不方便，比如，修改column family定义时就需要重启。而且NoSQL更适合Google那样的规模，而一般的互联网公司都不是Google，早早地去考虑Google那样的规模的可扩展性，纯粹是浪费时间，存在巨大的商业风险。他还透露，即使在Google，AdWords这样的关键产品也是基于MySQL实现的。他在文中最后表示，NoSQL当然死不了，但是它最终会被边缘化，就像Rails被NoSQL边缘化一样 Dziuba的文章因为言辞激烈，在社区里引起了强烈反应。 SQL数据库阵营赞同者大有人在。craigslist工程师、著名的MySQL专家Jeremy Zawodny表示，在读此文的时候，不时会心一笑。他说， NoSQL运动只是软件不断进化进程中的正常现象。关系型数据库也会继续发展，MySQL社区不断推出的XtraDB或InnoDB插件, PBXT, Drizzle都是证据。各种技术竞争的结果是，我们获得了更多解决问题的选择。 drizzle项目开发者Eric Day也表示，NoSQL有很多值得学习的，但是目前大部分实际项目的最佳选择还是关系型数据库。 NoSQL阵营当然不会坐视不理，Cassandra项目组的Eric Evans表示，Dziuba提到Cassandra修改column family定义的问题其实很容易解决。而且，NoSQL并不是要取代MySQL，事实上Twitter仍然在用MySQL。如果关系型数据库能够承担负荷，那就用好了；如果不行，请考虑NoSQL。而德国知名博客Code Monkeyism则嘲笑Dziuba看起来并没有用MySQL做过真实项目，因为MySQL如果没有memcache，基本上无法应付网站项目。他认为，NoSQL将使SQL数据库边缘化，而且一个重要理由恰恰是可以节省DBA的开销。 digg的前任首席架构师现在也在创业的Joe Stump说，自己现在的创业项目就是用NoSQL，而且列举了一系列问题挑战SQL阵营。

简述什么是nosql数据库，并列举两种常见的nosql数据库名称及其特点

NoSQL太火，冒出太多产品了，保守估计也成百上千了。

互联网公司常用的基本集中在以下几种，每种只举一个比较常见或者应用比较成功的例子吧。

1. In-Memory KV Store : Redis

in memory key-value store，同时提供了更加丰富的数据结构和运算的能力，成功用法是替代memcached，通过checkpoint和commit log提供了快速的宕机恢复，同时支持replication提供读可扩展和高可用。

2. Disk-Based KV Store: Leveldb

真正基于磁盘的key-value storage, 模型单一简单，数据量不受限于内存大小，数据落盘高可靠，Google的几位大神出品的精品，LSM模型天然写优化，顺序写盘的方式对于新硬件ssd再适合不过了，不足是仅提供了一个库，需要自己封装server端。

3. Document Store: Mongodb

分布式nosql，具备了区别mysql的最大亮点：可扩展性。mongodb 最新引人的莫过于提供了sql接口，是目前nosql里最像mysql的，只是没有ACID的特性，发展很快，支持了索引等特性，上手容易，对于数据量远超内存限制的场景来说，还需要慎重。

4. Column Table Store: HBase

这个富二代似乎不用赘述了，最大的优势是开源，对于普通的scan和基于行的get等基本查询，性能完全不是问题，只是只提供裸的api,易用性上是短板，可扩展性方面是最强的，其次坐上了Hadoop的快车，社区发展很快，各种基于其上的开源产品不少，来解决诸如join、聚集运算等复杂查询。