我的编程空间,编程开发者的网络收藏夹
学习永远不晚

Lucene fnm索引文件格式是什么

短信预约 -IT技能 免费直播动态提醒
省份

北京

  • 北京
  • 上海
  • 天津
  • 重庆
  • 河北
  • 山东
  • 辽宁
  • 黑龙江
  • 吉林
  • 甘肃
  • 青海
  • 河南
  • 江苏
  • 湖北
  • 湖南
  • 江西
  • 浙江
  • 广东
  • 云南
  • 福建
  • 海南
  • 山西
  • 四川
  • 陕西
  • 贵州
  • 安徽
  • 广西
  • 内蒙
  • 西藏
  • 新疆
  • 宁夏
  • 兵团
手机号立即预约

请填写图片验证码后获取短信验证码

看不清楚,换张图片

免费获取短信验证码

Lucene fnm索引文件格式是什么

这篇文章主要介绍“Lucene fnm索引文件格式是什么”的相关知识,小编通过实际案例向大家展示操作过程,操作方法简单快捷,实用性强,希望这篇“Lucene fnm索引文件格式是什么”文章能帮助大家解决问题。

简介

后缀为fnm文件是存储索引的字段的元信息,包含字段名称,字段类型,字段属性等信息。

版本

lucene 9.1.0

涉及的主要类

fnm索引文件的生成源码比较简单,不贴了,主要逻辑在:

org.apache.lucene.codecs.lucene90.Lucene90FieldInfosFormat

代码示例

FieldType fieldType = new FieldType();fieldType.setStored(true);fieldType.setStoreTermVectors(true);fieldType.setStoreTermVectorOffsets(true);fieldType.setStoreTermVectorPositions(true);fieldType.setStoreTermVectorPayloads(true);fieldType.setTokenized(true);fieldType.setOmitNorms(true);fieldType.setIndexOptions(IndexOptions.DOCS_AND_FREQS_AND_POSITIONS_AND_OFFSETS);Document doc = new Document();doc.add(new Field("name", "maria", fieldType));doc.add(new SortedDocValuesField("name", new BytesRef("maria")));doc.add(new IntPoint("id", 1, 2, 3));doc.add(new KnnVectorField("vector", new float[]{1.1f, 2.2f, 3.3f}, VectorSimilarityFunction.COSINE));

文件结构全局示意图

Lucene fnm索引文件格式是什么

字段描述

Header

文件头部信息,主要是包括:

  • 文件头魔数(同一lucene版本所有文件相同)

  • 该文件使用的codec名称:Lucene90FieldInfos(codec可以理解成文件的布局格式,不同版本lucene相同后缀文件有不一样的版本格式)

  • codec版本

  • segment后缀名(一般为空)

  • segment id(也是Segment_N文件中的N)

FieldCount

该索引的field总数

Field

记录字段的元信息

FieldName 

字段名称,比如示例代码中的name,id,vector都是字段名称

FieldNumber 

字段的编号

FieldBits

部分属性的位图信息,是一个组合值,描述字段是否具有以下属性:

  • 是否存储词向量(termVector):0x1

  • 是否要忽略norm值:0x2

  • 是否带有payload:0x4

  • 该字段是否是软删除字段(soft delete):0x8

示例代码中的name字段的FieldBits的值为:0x1 | 0x2 | 0x4 = 0x7

IndexOptions

字段的索引选项,表示在索引该字段的时候存储的倒排信息有哪些,所有的类型:

  • 0:NONE

  • DOCS

  • DOCS_AND_FREQS

  • DOCS_AND_FREQS_AND_POSITIONS

  • DOCS_AND_FREQS_AND_POSITIONS_AND_OFFSETS

DocValuesBits

官方文档描述的是由norm和docValue类型的组合值,但是从源码看只存储了docValue类型。

  • 0:NONE

  • NUMERIC

  • BINARY

  • SORTED

  • SORTED_SET

  • SORTED_NUMERIC

DocValuesGen

可以理解为字段DocValues的版本号,通过IndexWriter.updateDocValues(...)会更新该版本号

Attributes

可能的值有:

Lucene fnm索引文件格式是什么

PointDimensionCount

如果字段是IntPoint,LongPoint等类型,则记录维数。

PointNumBytes

如果字段是IntPoint,LongPoint等类型,则记录每一维数据存储需要的字节个数。

VectorDimension

向量字段记录向量的维数

VectorSimilarityFunction

向量相似度衡量函数:

  • EUCLIDEAN:欧式距离

  • DOT_PRODUCT:点积

  • COSINE:consine距离

Footer

文件尾,主要包括

  • 文件尾魔数(同一个lucene版本所有文件一样)

  • 0

  • 校验码

关于“Lucene fnm索引文件格式是什么”的内容就介绍到这里了,感谢大家的阅读。如果想了解更多行业相关的知识,可以关注编程网行业资讯频道,小编每天都会为大家更新不同的知识点。

免责声明:

① 本站未注明“稿件来源”的信息均来自网络整理。其文字、图片和音视频稿件的所属权归原作者所有。本站收集整理出于非商业性的教育和科研之目的,并不意味着本站赞同其观点或证实其内容的真实性。仅作为临时的测试数据,供内部测试之用。本站并未授权任何人以任何方式主动获取本站任何信息。

② 本站未注明“稿件来源”的临时测试数据将在测试完成后最终做删除处理。有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

Lucene fnm索引文件格式是什么

下载Word文档到电脑,方便收藏和打印~

下载Word文档

猜你喜欢

Lucene fnm索引文件格式是什么

这篇文章主要介绍“Lucene fnm索引文件格式是什么”的相关知识,小编通过实际案例向大家展示操作过程,操作方法简单快捷,实用性强,希望这篇“Lucene fnm索引文件格式是什么”文章能帮助大家解决问题。简介后缀为fnm文件是存储索引的
2023-07-05

lucene全文索引是什么

本篇内容主要讲解“lucene全文索引是什么”,感兴趣的朋友不妨来看看。本文介绍的方法操作简单快捷,实用性强。下面就让小编来带大家学习“lucene全文索引是什么”吧!一、Lucene介绍及应用Apache Lucene是当下最为流行的开源
2023-06-02

Lucene倒排索引原理是什么

本篇内容主要讲解“Lucene倒排索引原理是什么”,感兴趣的朋友不妨来看看。本文介绍的方法操作简单快捷,实用性强。下面就让小编来带大家学习“Lucene倒排索引原理是什么”吧!一、搜索引擎介绍1.1 搜索引擎是什么这里引用百度百科的介绍:搜
2023-06-02

mysql索引文件是什么

MySQL索引文件是用于快速查找和检索数据库中数据的数据结构,它是在表中的一个或多个列上创建的,以提高查询性能和数据检索速度,包含了索引键值和指向实际数据位置的指针,索引文件通常存储在磁盘上,与表数据文件分开存储。本教程操作系统:Windo
2023-08-02

Lucenefnm索引文件格式源码解析

这篇文章主要为大家介绍了Lucenefnm索引文件格式源码解析,有需要的朋友可以借鉴参考下,希望能够有所帮助,祝大家多多进步,早日升职加薪
2023-03-14

mht文件是什么格式

MHT文件是用于存储和传输Web页面内容的文件格式。允许用户离线查看和共享完整的网页信息,减少了存储空间的占用和文件的数量,然而由于其依赖于MIME类型和浏览器的差异,使用MHT文件时需要注意其限制和兼容性问题。本教程操作环境:window
2023-08-08

php是什么文件格式

PHP(Hypertext Preprocessor)是一种服务器端脚本语言,它主要用于开发动态网页和Web应用程序。PHP文件的文件格式通常为“.php”,它包含PHP代码和HTML代码,以及可能的CSS和JavaScript代码。当用户
2023-08-30

mdp格式文件是什么

这期内容当中小编将会给大家带来有关mdp格式文件是什么,文章内容丰富且以专业的角度为大家分析和叙述,阅读完这篇文章希望大家可以有所收获。mdp文件一般用ACCESS就能直接打开它,当然也可以用办公软件excel来对打开它。mdb是数据库文件
2023-06-14

xml文件是什么格式

这篇文章主要介绍“xml文件是什么格式”,在日常操作中,相信很多人在xml文件是什么格式问题上存在疑惑,小编查阅了各式资料,整理出简单好用的操作方法,希望对大家解答”xml文件是什么格式”的疑惑有所帮助!接下来,请跟着小编一起来学习吧!xm
2023-06-20

mht是什么格式文件

mht是一种网络文件格式,它的全称是MIME HTML文件,也被称为单文件网页。mht格式文件是通过将网页内容和相关资源打包成一个文件来实现的,包括HTML代码、CSS样式、图片、脚本等。这个文件可以在网页浏览器中打开和浏览,就像正常的网页
2023-08-09

mdb是什么格式文件

MDB是一种由微软公司开发的数据库文件格式,用于存储和管理数据。它是Microsoft Access数据库系统的默认文件格式,具有丰富的功能和易于使用的特点。MDB文件是一种二进制文件格式,由一组数据表、查询、表单、报表、宏和模块组成。md
2023-08-09

csv格式文件是什么

CSV格式文件是一种常见的文本文件格式,其全称为Comma-Separated Values,中文名为逗号分隔值文件,其简单明了的结构和易读性使得它成为数据导入、备份和传输的理想选择,在使用CSV文件时需要注意对兼容性和数据类型的处理,以确
2023-07-25

jdf格式是什么文件

这期内容当中小编将会给大家带来有关jdf格式是什么文件,文章内容丰富且以专业的角度为大家分析和叙述,阅读完这篇文章希望大家可以有所收获。JDF(Job Definition Format)即活件描述格式,是一种基于XML(可扩展标志语言)用
2023-06-14

caj是什么格式的文件

CAJ是一种特定的电子文献格式。CAJ格式文件是中国学术期刊领域常用的电子文献格式,具有高度压缩、可读性强、检索功能和强大的功能等特点。它通过数字化的方式,方便用户对学术期刊内容进行存储、传播和阅读,为学术研究提供了便利和效率。CAJ是中国
2023-08-10

jsp是什么格式的文件

JSP(JavaServer Pages)是一种基于XML和Java的服务器端页面文件格式。它允许开发人员在HTML或XML页面中嵌入Java代码,以动态生成页面内容。与静态HTML文件不同,JSP文件在服务器上被编译为Java Servl
2023-08-24

x_t是什么格式的文件

x_t是一种常见的3D图形文件格式,也称为“Parasolid”文件。它是由美国Unigraphics Solutions公司(后来被Siemens PLM Software收购)开发的,用于在计算机辅助设计(CAD)软件中存储和交换三维几
2023-08-14

php是什么格式的文件

PHP是一种服务器端脚本语言,它的文件格式通常是以`.php`为后缀的文本文件。这意味着PHP代码通常存储在以`.php`结尾的文件中,并且可以通过Web服务器进行解释和执行。当一个包含PHP代码的文件被请求时,Web服务器会将该文件传递给
2023-08-24

m3u8指的是什么格式文件

这篇文章给大家分享的是有关m3u8指的是什么格式文件的内容。小编觉得挺实用的,因此分享给大家做个参考,一起跟随小编过来看看吧。m3u8是指UTF-8编码格式的M3U文件;M3U文件是记录了一个索引纯文本文件,打开它时播放软件并不是播放它,而
2023-06-08

dps指的是什么格式文件

这篇文章将为大家详细讲解有关dps指的是什么格式文件,小编觉得挺实用的,因此分享给大家做个参考,希望大家阅读完这篇文章后可以有所收获。dps是WPS的PPT所保存文件的文件格式,是一种常见的幻灯片格式。我们可以直接使用WPS来打开dps文件
2023-06-14

编程热搜

  • Python 学习之路 - Python
    一、安装Python34Windows在Python官网(https://www.python.org/downloads/)下载安装包并安装。Python的默认安装路径是:C:\Python34配置环境变量:【右键计算机】--》【属性】-
    Python 学习之路 - Python
  • chatgpt的中文全称是什么
    chatgpt的中文全称是生成型预训练变换模型。ChatGPT是什么ChatGPT是美国人工智能研究实验室OpenAI开发的一种全新聊天机器人模型,它能够通过学习和理解人类的语言来进行对话,还能根据聊天的上下文进行互动,并协助人类完成一系列
    chatgpt的中文全称是什么
  • C/C++中extern函数使用详解
  • C/C++可变参数的使用
    可变参数的使用方法远远不止以下几种,不过在C,C++中使用可变参数时要小心,在使用printf()等函数时传入的参数个数一定不能比前面的格式化字符串中的’%’符号个数少,否则会产生访问越界,运气不好的话还会导致程序崩溃
    C/C++可变参数的使用
  • css样式文件该放在哪里
  • php中数组下标必须是连续的吗
  • Python 3 教程
    Python 3 教程 Python 的 3.0 版本,常被称为 Python 3000,或简称 Py3k。相对于 Python 的早期版本,这是一个较大的升级。为了不带入过多的累赘,Python 3.0 在设计的时候没有考虑向下兼容。 Python
    Python 3 教程
  • Python pip包管理
    一、前言    在Python中, 安装第三方模块是通过 setuptools 这个工具完成的。 Python有两个封装了 setuptools的包管理工具: easy_install  和  pip , 目前官方推荐使用 pip。    
    Python pip包管理
  • ubuntu如何重新编译内核
  • 改善Java代码之慎用java动态编译

目录