建设网站公司服装网站建设

中生国态(北京)文化传播有限公司 2026/09/09 18:32:15

作者:来自 Elastic spinscale

分析链中的数字标准化

在全文搜索中,一个常见问题是如何处理数字。最基本的方法是将它们完全提取出来,并在范围内作为真实数字进行查询,但在很多情况下,这需要大量分析,而且数字往往只是全文搜索的一部分,比如 iphone 17 或 bed 1.4 m。

问题是,当用户输入搜索时,他们对数字的理解可能与你不同。

1.4 m 和 1,4 m 是相同的吗?事实是,美国和欧洲在大数和分数的分隔符上使用不同的字符。除此之外,用户在搜索引擎中输入数字时,点和逗号常常可以互换使用,尤其是数字较小时。

  • 007 和 7 是相同的吗?取决于你的使用场景。
  • 1.4 m 和 1.40 m 是相同的吗?这取决……你明白我的意思。

那么我们能做些什么来稍微标准化数字呢?

为了这个示例,让我们使用 keep_types token filter,仅保留数字,丢弃分析链中的其他内容:

POST _analyze { "text": "makita führungsschiene 1.4 m, 1,4 m 1,40 1.40", "tokenizer": "standard", "filter": [ { "type": "keep_types", "types": [ "<NUM>" ] } ] }

这只会返回看起来像数字的 token,无论它们是否包含点或逗号,但会排除其他内容,例如普通单词,比如 makita。

接下来,我们先统一所有带点或逗号的数字。

POST _analyze { "text": "makita führungsschiene 1.4 m, 1,4 m 1,40 1.40", "tokenizer": "standard", "filter": [ { "type": "keep_types", "types": [ "<NUM>" ] }, { "type": "pattern_replace", "pattern": "(\d+)\,(\d+)", "replacement" : "$1.$2" } ] }

这只返回 1.4 或 1.40 —— 很好!所以无论索引了什么,或者用户搜索什么,现在我们总是假设数字使用点,借助 pattern_replace token filter 实现。

如果不关心位置,可以在最后使用 unique token filter —— 当然也可以省略 norms 以减少索引大小。

你也可以去掉点,只保留数字本身,但这可能导致搜索 1.7 时返回 iphone 17 —— 同样,这取决于是否希望这样。

接下来,我们去掉前导零:

POST _analyze { "text": "test 007 7 700 000 0", "tokenizer": "standard", "filter": [ { "type": "keep_types", "types": [ "<NUM>" ] }, { "type": "pattern_replace", "pattern": "^0+(\d+)", "replacement" : "$1" } ] }

现在,007 或 000 会被简化为单个数字字符。虽然这可能有用,但请注意,当用户搜索 007 作为零件编号时,可能会返回包含 7 的所有结果,从而增加歧义。

接下来,真正有趣的部分来了:去掉尾随零,但不要弄得太复杂。像往常一样,如果你手头只有正则表达式,你可能会想出一个复杂的正则,但也许预处理可能已经是个好主意。

POST _analyze { "text": "0.100 0.1000 0.101 100 100.0 100.00 100.001", "tokenizer": "standard", "filter": [ { "type": "keep_types", "types": [ "<NUM>" ] }, { "type": "pattern_replace", "pattern": "^(\d+)\.([0-9])(0+)$", "replacement" : "$1.$2" } ] }

这会返回(至少如果你在请求中添加 filter_path=**.token):

{ "tokens": [ { "token": "0.1" }, { "token": "0.1" }, { "token": "0.101" }, { "token": "100" }, { "token": "100.0" }, { "token": "100.0" }, { "token": "100.001" } ] }

你已经可以看到这里还有一些可以改进的地方。100 和 100.0 之间真的有区别吗?也许在这种情况下可以完全去掉尾随的 .0。我相信你会为此想出一个很棒的正则表达式。

让我们把所有步骤整合起来:

POST _analyze { "text": "makita führungsschiene 1.4 m, 1,4 m 1,40 1.40 1.0 1.00 0.100 0.1000 0.101 0.1010 100 100.0 100.00 100.001 0.100 007 700", "tokenizer": "standard", "filter": [ { "type": "keep_types", "types": [ "<NUM>" ] }, { "type": "pattern_replace", "pattern": "(\d+)\,(\d+)", "replacement" : "$1.$2" }, { "type": "pattern_replace", "pattern": "^0+(\d+)", "replacement" : "$1" }, { "type": "pattern_replace", "pattern": "^(\d+)\.([0-9])(0+)$", "replacement" : "$1.$2" } ] }

在真实的分析链中,你可能会去掉 keep_types filter,并且在适用时尝试将正则表达式组合以提高速度,但这大概是一个不错的起点。

仔细看上面的输出,你会注意到还有一个小问题:0.1010 没有被简化为 0.101。因此,你可能需要对正则表达式做进一步修正 —— 记住,如果增加一个 token filter 有助于可读性,也是可以的 😊

还有一个实现提示。如果你想确保 pattern replace filter 只针对数字运行,可以使用 condition token filter。

原文:https://discuss.elastic.co/t/dec-2nd-2025-en-normalizing-numbers-during-analysis/383512

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系我们进行投诉反馈,一经查实,立即删除!

吉安网站建设三亚网站建设

编程主题与数据处理实用指南1. 代码文档处理在编程中,代码文档的处理至关重要。以一个包含特定功能的文件为例,该文件仅有五行实际源代码。其中,第 1 行和第 2 行是常见的文件头;第 4 行有一个变量声

2026/06/30 12:57:03

建设局网站永康网站建设

快速体验打开 InsCode(快马)平台 https://www.inscode.net输入框内输入如下内容:创建一个EXT2FSD使用指南应用,包含:1.分

2026/06/30 12:59:03

青岛网站建设昆山网站建设

Trackformer:基于Transformer的多目标跟踪终极指南【免费下载链接】trackformerImplementation of "TrackFormer: Mul

2026/06/30 10:50:52

寿光网站建设莱州网站建设

YOLOv8 Flipping图像翻转增强策略(水平/垂直)在目标检测的实际项目中,一个常见的困境是:标注数据有限,模型却需要应对

2026/06/30 10:45:52

医疗网站建设沧州网站建设

第一章:Open-AutoGLM本地部署保姆级教程:3小时快速上手AI智能体编排Open-AutoGLM 是一款开源的 AI 智能体编排框架,支持多模型调度、

2026/06/30 13:05:35

长春网站建设公司企业网站的建设

Boss-Key高效窗口隐藏工具:智能保护你的办公隐私【免费下载链接】Boss-Key老板来了?快用Boss-Key老板键一键隐藏静音当前窗口!上班摸鱼必备神

2026/06/30 12:54:03

西安专业网站建设门户网站建设方案

音乐歌词获取神器:告别手动搜索,一键解锁网易云与QQ音乐完整歌词库【免费下载链接】163MusicLyricsWindows 云音乐歌词获取【网易云、QQ音乐】项目地址:

2026/06/30 11:55:28

建设网站pc网站建设

如何用Kotaemon构建跨部门知识共享平台?在一家快速扩张的科技企业中,新员工入职第三天就遇到了难题:他需要提交一次差旅报销,但找不到流程文档

2026/06/30 13:17:05