倒排索引跟正排索引的优化点
倒排索引和正排索引的优化点
搜索系统中对于索引和字典的存储主要面临两大挑战:
1.数据压缩
2.快速地检索和排序
正排表的存储有如下两个点来压缩数据:
1.正排表词在在DOC中出现的为止采用单调递增差分存储,这样存储这个数字序列的时候可以用尽可能少的字节数来存,达到压缩效果
2.在存储文档中所有WORD ID的时候在最后一个词后面插入一个NULL,并且采用非结构化方式存储可以减少很多冗余的DOCID的存储