IKAnalyzer使用不同版本中文分词的切词方式实现相同功能效果

2025-04-21 01:25:22

最近公司在做一个题库的功能，需要用到中文分词和公式分词的工具，最开始用 IKAnalyzer 2012F 版本 + lunece 6.5.1做了一版中文分词工具。

具体如下：

一、IKAnalyzer 2012F + lunece 6.5.1 实现中文分词

 public static List<String> analysisByIK(Analyzer analyzer,String field, String content){
 if(StringUtils.isNullOrEmpty(content)){
  return null;
 }
 TokenStream ts = null;
 try {
  ts = analyzer.tokenStream(field, new StringReader(content));
  CharTermAttribute term = ts.addAttribute(CharTermAttribute.class);
  ts.reset();
  List<String> vocabularies = new ArrayList<>();
  while (ts.incrementToken()) {
  vocabularies.add(term.toString());
  }
  ts.end();
  return vocabularies;
 } catch (Exception e) {
  logger.error(e.getMessage(), e);
 } finally {
  if (ts != null) {
  try {
   ts.close();
  } catch (IOException e) {
   e.printStackTrace();
  }
  }
 }
 return null;
 }

调用方式：

 String str = "已知三角形ABC中，角A等于角B加角C，那么三角形ABC是 A、锐角三角形 B、直角三角形 C、钝角三角形 D、不能确定";
 Analyzer analyzer = new IKAnalyzer(true);
 ikList = analysisByIK(analyzer, "myfield", str);
 listAnalyzer.addAll(ikList);

输出结果listAnalyzerd：

[已知, 三角形, abc, 中, 角, a, 等于, 角, b, 加, 角, c, 那么, 三角形, abc, 是, a, 锐角三角形, b, 直角三角形, c, 钝角三角形, d, 不能, 确定]

但是由于公式切词是原来公司大牛写的，在满足公式切词的条件下，中文切词的IKAnalyzer 2012F与其不兼容。于是尝试其他版本，最终决定用 IKAnalyzer 3.2.8 实现了兼容。

二、IKAnalyzer 3.2.8 + lunece 3.1.0 兼容版本

 public static List<String> analysisByIK3Point2(Analyzer analyzer,String field, String content) throws Exception{
 if(StringUtils.isNullOrEmpty(content)){
  return null;
 }
 List<String> list = new ArrayList<>();
 Reader reader = new StringReader(content);
    TokenStream stream = (TokenStream)analyzer.tokenStream(field, reader);
    //添加工具类 注意：以下这些与之前lucene2.x版本不同的地方
    TermAttribute termAtt = (TermAttribute)stream.addAttribute(TermAttribute.class);
    OffsetAttribute offAtt = (OffsetAttribute)stream.addAttribute(OffsetAttribute.class);
    // 循环打印出分词的结果，及分词出现的位置
    while(stream.incrementToken()){
     list.add(termAtt.term());
//       System.out.println(termAtt.term());
    }
 return list;
 }

调用方式：

 String str = "已知三角形ABC中，角A等于角B加角C，那么三角形ABC是 A、锐角三角形 B、直角三角形 C、钝角三角形 D、不能确定";
 Analyzer analyzer = new IKAnalyzer(true);
 ikList = analysisByIK3Point2(analyzer, "myfield", str);
 listAnalyzer.addAll(ikList);

输出结果：

[已知, 三角形, abc, 中, 角, a, 等于, 角, b, 加, 角, c, 那么, 三角形, abc, 是, a, 锐角三角形, b, 直角三角形, c, 钝角三角形, d, 不能, 确定]

即使用不同版本实现相同功能效果。主要是因为IKAnalyzer 2012F 依赖Analyzer的tokenStream是final方法，但是公式分词用到的tokenSteam方法是抽象方法。两者冲突了，所以考虑去做兼容。

总结

以上就是这篇文章的全部内容了，希望本文的内容对大家的学习或者工作具有一定的参考学习价值，谢谢大家对我们的支持。如果你想了解更多相关内容请查看下面相关链接

IKAnalyzer结合Lucene实现中文分词(示例讲解)

1.基本介绍随着分词在信息检索领域应用的越来越广泛,分词这门技术对大家并不陌生.对于英文分词处理相对简单,经过拆分单词.排斥停止词.提取词干的过程基本就能实现英文分词,单对于中文分词而言,由于语义的复杂导致分词并没英文分词那么简单,一般都是通过相关的分词工具来实现,目前比较常用的有庖丁分词以及IKAnalyzer等.这里我们主要通过一个简单的Demo聊聊IKAnalyzer的基本使用.IKAnalyzer是一个开源的,基于java开发的分词工具包,它独立于Lucene项目,同时提供了Lucen
Python中文分词工具之结巴分词用法实例总结【经典案例】

本文实例讲述了Python中文分词工具之结巴分词用法.分享给大家供大家参考,具体如下: 结巴分词工具的安装及基本用法,前面的文章<Python结巴中文分词工具使用过程中遇到的问题及解决方法>中已经有所描述.这里要说的内容与实际应用更贴近--从文本中读取中文信息,利用结巴分词工具进行分词及词性标注. 示例代码如下: #coding=utf-8 import jieba import jieba.posseg as pseg import time t1=time.time() f=open(&q
PHP中文分词的简单实现代码分享

当然, 本文不是要对中文搜索引擎做研究, 而是分享如果用 PHP 做一个站内搜索引擎. 本文是这个系统中的一篇. 我使用的分词工具是中科院计算所的开源版本的 ICTCLAS. 另外还有开源的 Bamboo, 我随后也会对该工具进行调研. 从 ICTCLAS 出发是个不错的选择, 因为其算法传播比较广泛, 有公开的学术文档, 并且编译简单, 库依赖少. 但目前只提供了 C/C++, Java 和 C# 版本的代码, 并没有 PHP 版本的代码. 怎么办呢? 也许可以学习它的 C/C++ 源码和学术
开源php中文分词系统SCWS安装和使用实例

一.SCWS简介 SCWS 是 Simple Chinese Word Segmentation 的首字母缩写(即:简易中文分词系统).这是一套基于词频词典的机械式中文分词引擎,它能将一整段的中文文本基本正确地切分成词. 词是中文的最小语素单位,但在书写时并不像英语会在词之间用空格分开, 所以如何准确并快速分词一直是中文分词的攻关难点.SCWS 采用纯 C 语言开发,不依赖任何外部库函数,可直接使用动态链接库嵌入应用程序, 支持的中文编码包括 GBK.UTF-8 等.此外还提供了 PHP 扩展模
几款开源的中文分词系统

以下介绍4款开源中文分词系统. 1.ICTCLAS – 全球最受欢迎的汉语分词系统中文词法分析是中文信息处理的基础与关键.中国科学院计算技术研究所在多年研究工作积累的基础上,研制出了汉语词法分析系统ICTCLAS(Institute of Computing Technology, Chinese Lexical Analysis System),主要功能包括中文分词:词性标注:命名实体识别:新词识别:同时支持用户词典:支持繁体中文:支持GBK.UTF-8.UTF-7.UNICODE等多种编码
Python结巴中文分词工具使用过程中遇到的问题及解决方法

本文实例讲述了Python结巴中文分词工具使用过程中遇到的问题及解决方法.分享给大家供大家参考,具体如下: 结巴分词是Python语言中效果最好的分词工具,其功能包括:分词.词性标注.关键词抽取.支持用户词表等.这几天一直在研究这个工具,在安装与使用过程中遇到一些问题,现在把自己的一些方法帖出来分享一下. 官网地址:https://github.com/fxsjy/jieba 1.安装. 按照官网上的说法,有三种安装方式, 第一种是全自动安装:easy_install jieba 或者 pip
PHP中文分词自动获取关键词介绍

复制代码代码如下: <?php header("Content-Type:text/html; charset=utf-8"); define('APP_ROOT', str_replace('\\', '/', dirname(__FILE__))); $test = '这里是一段中文测试代码!'; function get_tags_arr($title) { require(APP_ROOT.'/pscws4.class.php'); $pscws = new PSCWS
python使用jieba实现中文分词去停用词方法示例

前言 jieba 基于Python的中文分词工具,安装使用非常方便,直接pip即可,2/3都可以,功能强悍,十分推荐. 中文分词(Chinese Word Segmentation) 指的是将一个汉字序列切分成一个一个单独的词. 分词模块jieba,它是python比较好用的分词模块.待分词的字符串可以是 unicode 或 UTF-8 字符串.GBK 字符串.注意:不建议直接输入 GBK 字符串,可能无法预料地错误解码成 UTF-8 支持三种分词模式 1 精确模式,试图将句子最精确地切开,适合
php实现的中文分词类完整实例

本文实例讲述了php实现的中文分词类.分享给大家供大家参考,具体如下: 该中文分词类源码使用http://tools.jb51.net/code/jb51_php_format进行了格式化处理,便于阅读.具体代码如下: class Segmentation { var $options = array('lowercase' => TRUE, 'segment_english' => FALSE); var $dict_name = 'Unknown'; var $dict_words = a
python中文分词教程之前向最大正向匹配算法详解

前言大家都知道,英文的分词由于单词间是以空格进行分隔的,所以分词要相对的容易些,而中文就不同了,中文中一个句子的分隔就是以字为单位的了,而所谓的正向最大匹配和逆向最大匹配便是一种分词匹配的方法,这里以词典匹配说明. 最大匹配算法是自然语言处理中的中文匹配算法中最基础的算法,分为正向和逆向,原理都是一样的. 正向最大匹配算法,故名思意,从左向右扫描寻找词的最大匹配. 首先我们可以规定一个词的最大长度,每次扫描的时候寻找当前开始的这个长度的词来和字典中的词匹配,如果没有找到,就缩短长度继续寻找,直
java中文分词之正向最大匹配法实例代码

前言基于词典的正向最大匹配算法(最长词优先匹配),算法会根据词典文件自动调整最大长度,分词的好坏完全取决于词典. 所谓词典正向最大匹配就是将一段字符串进行分隔,其中分隔的长度有限制,然后将分隔的子字符串与字典中的词进行匹配,如果匹配成功则进行下一轮匹配,直到所有字符串处理完毕,否则将子字符串从末尾去除一个字,再进行匹配,如此反复. 算法流程图如下: 下面给大家主要讲一下中文分词里面算法的简单实现,废话不多说了,现在先上代码示例代码 package com; import java.util

IKAnalyzer使用不同版本中文分词的切词方式实现相同功能效果

相关推荐

随机推荐