ES 分布式搜索的运行机制

本文主要是介绍ES 分布式搜索的运行机制，对大家解决编程问题具有一定的参考价值，需要的程序猿们随着小编来一起学习吧！

ES 有两种 search_type 即搜索类型：

query_then_fetch

缺点：由于每个分片独立使用自身的而不是全局的 Term/Document 频率进行相关度打分，当数据分布不均匀时可能会造成打分偏差，从而影响最终搜索结果的相关性。

dfs_query_then_fetch

dfs_query_then_fetch 与 query_then_fetch 的运行机制非常类似，但是有两点不同。

缺点：太耗费资源，一般还是不建议使用。

虽然 ES 有两种搜索类型，但一般还是都用默认的 query_then_fetch 。
当数据量没有足够大的情况下（比如搜索类型数据 20GB，日志类型数据 20-50GB），设置一个 shard 主分片是比较推荐的，只设置一个主分片，你会发现搜索时省掉了好多事情。
不需要文档数据时，使用 _source: false 可以避免请求节点到非本机分片的网络耗时以及读取磁盘文件的耗时。
使用 from + size 分页时，假设你只需要前 10k 条数据里的最后十条，那么每个分片也会取 10k 条数据，如果你的索引有 5 个主分片，那么汇总时就有 5 * 10k = 50k 条数据，这 50k 条数据是在内存里进行排序和最后的分页的，所以深度分页也是比较吃资源的。

公众号

这篇关于ES 分布式搜索的运行机制的文章就介绍到这儿，希望我们推荐的文章对大家有所帮助，也希望大家多多支持为之网！

Java教程