go-ego / gse

Go efficient multilingual NLP and text segmentation; support English, Chinese, Japanese and others.
Apache License 2.0
2.57k stars 215 forks source link

各个分词方法的区别是什么,能介绍一下吗? #80

Closed birdycn closed 3 years ago

birdycn commented 3 years ago

cut search hm string 您好,有详细的方法区别介绍吗

vcaesar commented 3 years ago

Cut 试图将句子最精确地切开,适合文本分析; CutAll 采用全模式, 把句子中所有的可以成词的词语都扫描出来, 速度非常快,但是不能解决歧义; HMM 参数用来控制是否使用 HMM 模型; CutSearch() 搜索引擎模式,在精确模式的基础上,对长词再次切分,提高召回率,适合用于搜索引擎分词