Python jieba结巴分词原理及用法解析

#代码知识发布时间： 2026-01-12

1、简要说明

结巴分词支持三种分词模式，支持繁体字，支持自定义词典

2、三种分词模式

全模式：把句子中所有的可以成词的词语都扫描出来, 速度非常快，但是不能解决歧义

精简模式：把句子最精确的分开，不会添加多余单词，看起来就像是把句子分割一下

搜索引擎模式：在精简模式下，对长词再度切分

# -*- encoding=utf-8 -*-

import jieba

if __name__ == '__main__':
  str1 = '我去北京天安门广场跳舞'
  a = jieba.lcut(str1, cut_all=True) # 全模式
  print('全模式:{}'.format(a))
  b = jieba.lcut(str1, cut_all=False) # 精简模式
  print('精简模式:{}'.format(b))
  c = jieba.lcut_for_search(str1) # 搜索引擎模式
  print('搜索引擎模式:{}'.format(c))

运行

3、某个词语不能被分开

# -*- encoding=utf-8 -*-

import jieba

if __name__ == '__main__':
  str1 = '桃花侠大战菊花怪'
  b = jieba.lcut(str1, cut_all=False) # 精简模式
  print('精简模式:{}'.format(b))
  # 如果不把桃花侠分开
  jieba.add_word('桃花侠')
  d = jieba.lcut(str1) # 默认是精简模式
  print(d)

运行

4、某个单词必须被分开

# -*- encoding=utf-8 -*-

import jieba

if __name__ == '__main__':
  # HMM参数，默认为True
  '''HMM 模型，即隐马尔可夫模型（Hidden Markov Model, HMM），是一种基于概率的统计分析模型，
  用来描述一个系统隐性状态的转移和隐性状态的表现概率。
  在 jieba 中，对于未登录到词库的词，使用了基于汉字成词能力的 HMM 模型和 Viterbi 算法，
  其大致原理是：
  采用四个隐含状态，分别表示为单字成词，词组的开头，词组的中间，词组的结尾。
  通过标注好的分词训练集，可以得到 HMM 的各个参数，然后使用 Viterbi 算法来解释测试集，得到分词结果。
  '''
  str1 = '桃花侠大战菊花怪'
  b = jieba.lcut(str1, cut_all=False, HMM=False) # 精简模式，且不使用HMM模型
  print('精简模式:{}'.format(b))
  # 分开大战为大和战
  jieba.suggest_freq(('大', '战'), True)
  e = jieba.lcut(str1, HMM=False) # 不使用HMM模型
  print('分开:{}'.format(e))

运行

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持。

代码知识SEO

上一篇 : VMware虚拟机安装苹果Mac OS的超详细教程

下一篇 : nuxt.js写项目时增加错误提示页面操作

首页

关于我们

SEO服务

品牌推广

优化学院

联系我们

Python jieba结巴分词原理及用法解析

SEO公司

SEO套餐

SEO教程

SEO资源

SEO建站

推荐阅读

docker容器中切换用户,提示权限不足

Python下载的11种姿势(小结)

Python监听键盘和鼠标事件的示例代码

Java序列化常见实现方法代码实例

Springboot mybatis p

Vue如何循环提取对象数组中的值

vue在图片上传的时候压缩图片

Opencv python 图片生成视频

C++17中的折叠表达式实现

Vue +WebSocket + Wav

微信小程序实现多张图片上传功能

springsecurity 基本使用详

解决Mybatis-plus找不到对应表

WIN10系统和Docker内部容器IP

calendar在python3时间中常

Java object wait not

Python 远程开关机的方法

如何在Express4.x中愉快地使用a

Linux上定位后台服务偶发崩溃的解决方

IDEA中用maven连接数据库的教程