ES(一)：ES基本概念和原理简单介绍

Elasticsearch概述：ES是基于Lucene的搜索服务器，它提供了一个分布式多用户能力的全问搜索引擎，且ES支持RestFulweb风格的url访问。ES是基于Java开发的开源搜索引擎，设计用于云计算，能够达到实时搜索，稳定、可靠、快速。此外，ES还提供了数据聚合分析功能，但在数据分析方面，es的时效性不是很理想，在企业应用中一般还是用于搜索。ES自2016年起已经超过Solr等，..

三水写代码

29462人浏览 · 2019-11-24 18:56:02

三水写代码 · 2019-11-24 18:56:02 发布

Elasticsearch概述：

ES是基于Lucene的搜索服务器，它提供了一个分布式多用户能力的全问搜索引擎，且ES支持RestFulweb风格的url访问。ES是基于Java开发的开源搜索引擎，设计用于云计算，能够达到实时搜索，稳定、可靠、快速。此外，ES还提供了数据聚合分析功能，但在数据分析方面，es的时效性不是很理想，在企业应用中一般还是用于搜索。ES自2016年起已经超过Solr等，称为排名第一的搜索引擎应用。

ES、Lucene、solr对比：

Luence是Apache基于Java编写的信息搜索工具包（jar包），它包含了索引结构、读写索引工具、相关性工具、排序等功能，因此Lucene的使用需要我们进一步开发搜索引擎系统，如果数据获取、解析、分词等
Solr 是一个有HTTP接口的基于Lucene的查询服务器，是一个搜索引擎系统，系统封装了很多lucene细节，Solr可以直接利用HTTP GET/POST 请求去查询，维护修改索引。Solr利用zookeeper进行分布式管理，它的实现更加全面，官方提供的功能更多。
Elasticsearch 是一个建立在全文搜索引擎Apache Lucene基础上的搜索引擎，采用的策略师分布式实时文件存储，并将每一个字段都编入索引，使其可以被搜索。es的实时搜索性比solr更好。

Elasticsearch基本概念：

ES中有几个基本概念：索引(index)、类型(type)、文档(document)、映射(mapping)等。我们将这几个概念与传统的关系型数据库中的库、表、行、列等概念进行对比，如下表：

RDBS	ES
数据库（database）	索引（index）
表（table）	类型（type）（ES6.0之后被废弃，es7中完全删除）
表结构（schema）	映射（mapping）
行（row）	文档（document）
列（column）	字段（field）
索引	反向索引
SQL	查询DSL
SELECT * FROM table	GET http://.....
UPDATE table SET	PUT http://......
DELETE	DELETE http://......

倒排索引：

倒排索引操作步骤：

先将文档中包含的关键字全部提取出来
然后再将关键字与文档的对应关系保存起来
最后对关键字本身做索引排序。

这样在用户检索关键字时，可以先查找关键字索引，在通过关键字与文档的对应关系查找到所在的文档。

如下面的两个文档：

文档1： I love elasticsearch
文档2： I love logstash

他们对应的倒排索引为： "√" 表示文档中包含这个关键字

序号	关键字	文档1	文档2
1	I	√	√
2	love	√	√
3	elasticsearch	√
4	logstash		√

索引（index）：

索引是ES的一个逻辑存储，对应关系型数据库中的库，ES可以把索引数据存放到服务器中，也可以sharding(分片)后存储到多台服务器上。每个索引有一个或多个分片，每个分片可以有多个副本。

类型（type）：

ES中，一个索引可以存储多个用于不同用途的对象，可以通过类型来区分索引中的不同对象，对应关系型数据库中表的概念。但是在ES6.0开始，类型的概念被废弃，ES7中将它完全删除。删除type的原因：

我们一直认为ES中的“index”类似于关系型数据库的“database”，而“type”相当于一个数据表。ES的开发者们认为这是一个糟糕的认识。例如：关系型数据库中两个数据表示是独立的，即使他们里面有相同名称的列也不影响使用，但ES中不是这样的。

我们都知道elasticsearch是基于Lucene开发的搜索引擎，而ES中不同type下名称相同的filed最终在Lucene中的处理方式是一样的。举个例子，两个不同type下的两个user_name，在ES同一个索引下其实被认为是同一个filed，你必须在两个不同的type中定义相同的filed映射。否则，不同type中的相同字段名称就会在处理中出现冲突的情况，导致Lucene处理效率下降。

去掉type能够使数据存储在独立的index中，这样即使有相同的字段名称也不会出现冲突，就像ElasticSearch出现的第一句话一样“你知道的，为了搜索····”，去掉type就是为了提高ES处理数据的效率。

除此之外，在同一个索引的不同type下存储字段数不一样的实体会导致存储中出现稀疏数据，影响Lucene压缩文档的能力，导致ES查询效率的降低