Lucene 源码分析之倒排索引(二)

本文以及后面几篇文章将讲解如何定位 Lucene 中的倒排索引。内容很多,唯有静下心才能跟着思路遨游。

我们可以思考一下,哪个步骤与倒排索引有关,很容易想到检索文档一定是要查询倒排列表的,那么就从此处入手。检索文档通过调用 IndexSearcher.search(Query query, int n) 方法返回匹配的文档。

1public class IndexSearcher { 2 public TopDocs search(Query query, int n) throws IOException { 3 return searchAfter(null, query, n); 4 } 5 6 public TopDocs searchAfter(ScoreDoc after, Query query, int numHits) throws IOException { 7 // ... 8 return search(query, manager); 9 } 10 11 public <C extends Collector, T> T search(Query query, CollectorManager<C, T> collectorManager) throws IOException { 12 if (executor == null) { 13 final C collector = collectorManager.newCollector(); 14 search(query, collector); 15 return collectorManager.reduce(Collections.singletonList(collector)); 16 } 17 // ... 18 } 19}

上面是 search 的调用链,最终调用的核心方法是 reduce(...),也就是说 reduce(...) 会返回匹配的文档。

下文通过聚焦 reduce(...) 方法定位 Lucene 中的倒排索引。

reduce(...) 方法的形参是 Collections.singletonList(collector),collector 是由 CollectorManager.newCollector() 方法创建的,而 CollectorManager 创建于上面代码中第二个方法 searchAfter 方法中的匿名内部类,代码如下。

1public class IndexSearcher { 2 public TopDocs searchAfter(ScoreDoc after, Query query, int numHits) throws IOException { 3 // ... 4 final CollectorManager<TopScoreDocCollector, TopDocs> manager = new CollectorManager<TopScoreDocCollector, TopDocs>() { 5 @Override 6 public TopScoreDocCollector newCollector() throws IOException { 7 return TopScoreDocCollector.create(cappedNumHits, after); 8 } 9 // ... 10 }; 11 // ... 12 } 13} 14 15public abstract class TopScoreDocCollector extends TopDocsCollector<ScoreDoc> { 16 public static TopScoreDocCollector create(int numHits, ScoreDoc after) { 17 return new SimpleTopScoreDocCollector(numHits); 18 } 19}

也就是说 reduce 的形参是一个集合,该集合包含一个 SimpleTopScoreDocCollector 对象。

回到 reduce 的内部实现,调用方也是 searchAfter 方法中的匿名内部类 CollectorManager,代码如下。

1public class IndexSearcher { 2 public TopDocs searchAfter(ScoreDoc after, Query query, int numHits) throws IOException { 3 // ... 4 final CollectorManager<TopScoreDocCollector, TopDocs> manager = new CollectorManager<TopScoreDocCollector, TopDocs>() { 5 // ... 6 @Override 7 public TopDocs reduce(Collection<TopScoreDocCollector> collectors) throws IOException { 8 final TopDocs[] topDocs = new TopDocs[collectors.size()]; 9 int i = 0; 10 for (TopScoreDocCollector collector : collectors) { 11 topDocs[i++] = collector.topDocs(); 12 } 13 return TopDocs.merge(0, cappedNumHits, topDocs, true); 14 } 15 16 }; 17 // ... 18 } 19}

由于 reduce(...) 方法的形参仅有一个元素,reduce(...) 方法退化成执行 SimpleTopScoreDocCollector.topDocs(),其结果就是匹配的文档。

1public abstract class TopScoreDocCollector extends TopDocsCollector<ScoreDoc> { 2 private static class SimpleTopScoreDocCollector extends TopScoreDocCollector { 3 // ... 4 } 5} 6 7public abstract class TopDocsCollector<T extends ScoreDoc> implements Collector { 8 public TopDocs topDocs() { 9 return topDocs(0, topDocsSize()); 10 } 11 12 public TopDocs topDocs(int start, int howMany) { 13 // ... 14 ScoreDoc[] results = new ScoreDoc[howMany]; 15 // ... 16 populateResults(results, howMany); 17 return newTopDocs(results, start); 18 } 19 20 protected void populateResults(ScoreDoc[] results, int howMany) { 21 for (int i = howMany - 1; i >= 0; i--) { 22 results[i] = pq.pop(); 23 } 24 } 25}

SimpleTopScoreDocCollector 继承自 TopScoreDocCollector 继承自 TopDocsCollector,实际执行 TopDocsCollector.topDocs()。

时刻记住 reduce() 返回匹配的文档,也就是说 TopDocsCollector. topDocs() 返回匹配的文档。 results 作为 NewTopDocs 的成员变量一定包含了匹配的文档,results 又来自于 pq.pop(),那么 pq 一定包含了匹配的文档。

下面通过聚焦 SimpleTopScoreDocCollector 对象的 pq 定位倒排索引。

回顾 CollectorManager.reduce(...) 所在的 search(...) 方法,在初始化 SimpleTopScoreDocCollector 和 reduce(...) 之间唯一的方法就是另一个 search(…) 方法,一定是在这个方法中赋值了 pq,代码如下。

1public class IndexSearcher { 2 public void search(Query query, Collector results) throws IOException { 3 search(leafContexts, createNormalizedWeight(query, results.needsScores()), results); 4 } 5 6 protected void search(List<LeafReaderContext> leaves, Weight weight, Collector collector) throws IOException { 7 for (LeafReaderContext ctx : leaves) { // search each subreader 8 final LeafCollector leafCollector = collector.getLeafCollector(ctx); 9 BulkScorer scorer = weight.bulkScorer(ctx); 10 scorer.score(leafCollector, ctx.reader().getLiveDocs()); 11 } 12 } 13}

一共就三个方法,究竟是在哪个方法中赋值了 pq 呢?一个个分析。

第一个方法,collector.getLeafCollector(ctx) 实际调用的就是 SimpleTopScoreDocCollector.getLeafCollector(ctx)。

1public abstract class TopScoreDocCollector extends TopDocsCollector<ScoreDoc> { 2 private static class SimpleTopScoreDocCollector extends TopScoreDocCollector { 3 @Override 4 public LeafCollector getLeafCollector(LeafReaderContext context) throws IOException { 5 final int docBase = context.docBase; 6 return new ScorerLeafCollector() { 7 @Override 8 public void collect(int doc) throws IOException { 9 float score = scorer.score(); 10 totalHits++; 11 pqTop.doc = doc + docBase; 12 pqTop.score = score; 13 pqTop = pq.updateTop(); 14 } 15 }; 16 } 17 } 18}

可以看到 getLeafCollector(...) 方法返回的 ScorerLeafCollector 类提供了 collect(doc) 方法对 pq 进行操作。也就是说找到调用 collect(doc) 方法的地方也就找到了倒排索引。

下面通过聚焦找到调用 collect() 方法的来源来定位倒排索引。

第二个方法,weight.bulkScorer(ctx) 创建 BulkScorer,而 weight 由 createNormalizedWeight(…) 创建。

1public class IndexSearcher { 2 public Weight createNormalizedWeight(Query query, boolean needsScores) throws IOException { 3 // ... 4 return createWeight(query, needsScores, 1f); 5 } 6 7 public Weight createWeight(Query query, boolean needsScores, float boost) throws IOException { 8 // ... 9 Weight weight = query.createWeight(this, needsScores, boost); 10 // ... 11 return weight; 12 } 13}

假设 query 是最简单的 TermQuery,createWeight(…) 代码如下。

1public class TermQuery extends Query { 2 @Override 3 public Weight createWeight(IndexSearcher searcher, boolean needsScores, float boost) throws IOException { 4 // ... 5 return new TermWeight(searcher, needsScores, boost, termState); 6 } 7}

最终返回的是 TermWeight 对象,那么 weight.bulkScorer(ctx) 实现类代码如下。

1public abstract class Weight implements SegmentCacheable { 2 public BulkScorer bulkScorer(LeafReaderContext context) throws IOException { 3 // ... 4 return new DefaultBulkScorer(scorer); 5 } 6}

最终返回的是一个 DefaultBulkScorer 对象。

第三个方法,scorer.score(…),实际调用类是 DefaultBulkScorer,代码如下。

1public abstract class Weight implements SegmentCacheable { 2 protected static class DefaultBulkScorer extends BulkScorer { 3 // ... 4 } 5} 6 7public abstract class BulkScorer { 8 public void score(LeafCollector collector, Bits acceptDocs) throws IOException { 9 final int next = score(collector, acceptDocs, 0, DocIdSetIterator.NO_MORE_DOCS); 10 } 11}

BulkScorer.score(…) 内部调用的还是 DefaultBulkScorer 中重构的 score(…) 方法,代码如下。

1public abstract class Weight implements SegmentCacheable { 2 protected static class DefaultBulkScorer extends BulkScorer { 3 @Override 4 public int score(LeafCollector collector, Bits acceptDocs, int min, int max) throws IOException { 5 collector.setScorer(scorer); 6 if (scorer.docID() == -1 && min == 0 && max == DocIdSetIterator.NO_MORE_DOCS) { 7 scoreAll(collector, iterator, twoPhase, acceptDocs); 8 return DocIdSetIterator.NO_MORE_DOCS; 9 } 10 } 11 12 static void scoreAll(LeafCollector collector, DocIdSetIterator iterator, TwoPhaseIterator twoPhase, Bits acceptDocs) throws IOException { 13 if (twoPhase == null) { 14 for (int doc = iterator.nextDoc(); doc != DocIdSetIterator.NO_MORE_DOCS; doc = iterator.nextDoc()) { 15 if (acceptDocs == null || acceptDocs.get(doc)) { 16 collector.collect(doc); 17 } 18 } 19 } 20 } 21 } 22}

看到了什么!找到了调用 collect(…) 方法的代码。

点赞
收藏

评论区

加载中...

相关推荐

MySQL:[Err] 1292 - Incorrect datetime value: ‘0000-00-00 00:00:00‘ for column ‘CREATE_TIME‘ at row 1

文章目录问题用navicat导入数据时,报错:原因这是因为当前的MySQL不支持datetime为0的情况。解决修改sql\mode:sql\mode:SQLMode定义了MySQL应支持的SQL语法、数据校验等,这样可以更容易地在不同的环境中使用MySQL。全局s

Oracle 分组与拼接字符串同时使用

SELECTT.,ROWNUMIDFROM(SELECTT.EMPLID,T.NAME,T.BU,T.REALDEPART,T.FORMATDATE,SUM(T.S0)S0,MAX(UPDATETIME)CREATETIME,LISTAGG(TOCHAR(

MySQL部分从库上面因为大量的临时表tmp_table造成慢查询

背景描述Time:20190124T00:08:14.70572408:00User@Host:@Id:Schema:sentrymetaLast_errno:0Killed:0Query_time:0.315758Lock_

皕杰报表之UUID

​在我们用皕杰报表工具设计填报报表时,如何在新增行里自动增加id呢?能新增整数排序id吗?目前可以在新增行里自动增加id,但只能用uuid函数增加UUID编码,不能新增整数排序id。uuid函数说明:获取一个UUID,可以在填报表中用来创建数据ID语法:uuid()或uuid(sep)参数说明:sep布尔值,生成的uuid中是否包含分隔符'',缺省为

手写Java HashMap源码

HashMap的使用教程HashMap的使用教程HashMap的使用教程HashMap的使用教程HashMap的使用教程22

mysql设置时区

mysql设置时区mysql\_query("SETtime\_zone'8:00'")ordie('时区设置失败,请联系管理员!');中国在东8区所以加8方法二:selectcount(user\_id)asdevice,CONVERT\_TZ(FROM\_UNIXTIME(reg\_time),'08:00','0

Lucene 源码分析之倒排索引(二) - HelloWorld