Skip to content

IK 分词器

一句话

给 ElasticSearch 装上中文大脑的插件。 它能把「混合检索知识库」切成 混合 | 检索 | 知识 | ,而不是默认的 | | | | | |

为什么需要它

ElasticSearch 默认的 standard 分词器按空格和标点切词——对英文好用,对中文是灾难:

分词器「混合检索知识库」的分词结果
standard (逐字拆,毫无意义)
ik_max_word混合 检索 知识 知识库 (最细粒度,穷举)
ik_smart混合 检索 知识库(最粗粒度,按语义单元)

两种模式

  • ik_max_word:尽可能多切,召回率高。搜「知识库」也能命中「知识」相关的文档。
  • ik_smart:按语义最少切分,精准度高。适合索引不需要过多膨胀的场景。

实际项目里通常索引时用 ik_max_word(多存一些词),查询时用 ik_smart(精准匹配)。

应用场景

场景推荐模式
中文网站搜索索引 ik_max_word + 查询 ik_smart
技术文档/专业术语ik_max_word 加自定义词典补充专业词
论坛/社交媒体ik_max_word(覆盖网路用语)
法律/合同ik_smart(减少噪声匹配)

横向对比

standardIK 分词器
中文支持❌ 逐字拆✅ 按语义切
英文支持
自定义词典✅ 可扩展
分词精度
安装内置需装插件

优缺点

优点: 中文分词质量高,支持自定义词典(补齐专业术语和新兴词汇),双向粒度模式灵活切换 缺点: 需要安装插件(不是 ES 开箱即用),默认词典可能缺少最新词汇(需定期更新),不适用于分词逻辑与中文完全不同的语言(如日文)

如何选择

中文项目用 ES → 必装 IK。英文为主的系统 → standard 就够。中英混合 → IK + standard 双分词器按字段配置。

小结

IK 分词器是中文 ES 检索的入口——没有它,ES 搜中文基本废了。安装简单、配置灵活,是你搭建中文 RAG 系统的第一件事。

下一步

  • 倒排索引 — 分词后的词条存入倒排索引
  • BM25 — 在分词后的倒排索引上打分