esteem 发表于 2013-1-27 04:53:58

lucene 中文分词

1.分词方法A: lucene core中自带了StandardAnalyzer和ChineseAnalyzer,这个分词方法非常的简单,是以字为区隔  的。 比如 Searching for: "中 华"   结果: <b>中</b><b>华</b>人民共和国
  Searching for: "华民"   结果: 空

2.分词方法B: CJKAnalyzer , 分词策略是 中华、华人、人民、民共...
 Searching for: 中华  结果:<b>中华</b>人民共和国
Searching for: 民共   结果: 中华人<b>民共</b>和国

3.分词方法C: PaodingAnalyzer,  lucene-analyzers-2.3.2.jar 带的,
  分词策略是按照字典来,那么分词为 中华、人民、共和国。
Searching for: 中华  结果:<b>中华</b>人民共和国
Searching for: 民共  结果:空
 
 
转自:http://ilovelate.blog.163.com
页: [1]
查看完整版本: lucene 中文分词