Python中文分词工具之结巴分词用法实例总结【经典案例】

本文实例讲述了Python中文分词工具之结巴分词用法。分享给大家供大家参考，具体如下：

结巴分词工具的安装及基本用法，前面的文章《Python结巴中文分词工具使用过程中遇到的问题及解决方法》中已经有所描述。这里要说的内容与实际应用更贴近——从文本中读取中文信息，利用结巴分词工具进行分词及词性标注。

示例代码如下：

 #coding=utf-8 import jieba import jieba.posseg as pseg import time t1=time.time() f=open("t_with_splitter.txt","r") #读取文本 string=f.read().decode("utf-8") words = pseg.cut(string) #进行分词 result="" #记录最终结果的变量 for w in words: result+= str(w.word)+"/"+str(w.flag) #加词性标注 f=open("t_with_POS_tag.txt","w") #将结果保存到另一个文档中 f.write(result) f.close() t2=time.time() print("分词及词性标注完成，耗时："+str(t2-t1)+"秒。") #反馈结果

其中t_with_splitter.txt文件内容如下：

 本网站是国内专业的网站建设资源、脚本编程学习类网站，提供asp、php、asp.net、javascript、jquery、vbscript、dos批处理、网页制作、网络编程、网站建设等编程资料。

Python2.7.9平台运行后出现如下图所示的错误提示：

查阅相关资料后发现，需要在开头加上：

 import sys reload(sys) sys.setdefaultencoding( "utf-8" )

最终代码应为：

 #coding=utf-8 import jieba import jieba.posseg as pseg import time import sys reload(sys) sys.setdefaultencoding( "utf-8" ) t1=time.time() f=open("t_with_splitter.txt","r") #读取文本 string=f.read().decode("utf-8") words = pseg.cut(string) #进行分词 result="" #记录最终结果的变量 for w in words: result+= str(w.word)+"/"+str(w.flag) #加词性标注 f=open("t_with_POS_tag.txt","w") #将结果保存到另一个文档中 f.write(result) f.close() t2=time.time() print("分词及词性标注完成，耗时："+str(t2-t1)+"秒。") #反馈结果

运行成功：

Editplus打开t_with_POS_tag.txt文件如下图所示：

更多关于Python相关内容可查看本站专题：《Python字典操作技巧汇总》、《Python字符串操作技巧汇总》、《Python常用遍历技巧总结》、《Python数据结构与算法教程》、《Python函数使用技巧总结》及《Python入门与进阶经典教程》

希望本文所述对大家Python程序设计有所帮助。

您可能感兴趣的文章:

python实现中文分词FMM算法实例
Python中文分词实现方法(安装pymmseg)
Python结巴中文分词工具使用过程中遇到的问题及解决方法
python中文分词教程之前向最大正向匹配算法详解
python中文分词,使用结巴分词对python进行分词(实例讲解)
python使用jieba实现中文分词去停用词方法示例
python中文分词库jieba使用方法详解
Python中文分词库jieba,pkusegwg性能准确度比较
Python3爬虫中关于中文分词的详解
Python jieba 中文分词与词频统计的操作
Python中文分词库jieba(结巴分词)详细使用介绍

Python中文分词工具之结巴分词用法实例总结【经典案例】

2023年最新react面试题总结大全(附详细答案)

python实现自动更换ip的方法

Python中的for循环示例详解

可爱松鼠微信头像图片

Ghost安装器怎么安装Win10-Ghost安装器下安装Win10专业版系统详细图文教程

VUE3使用JSON编辑器的详细图文教程

iphone X如何关闭后台？苹果iphone X关闭软件后台方法介绍

Uint 和 int 的区别解析

Headshot插件如何使用-Headshot插件使用教程

Filecoin(FIL)是什么币？如何挖掘Filecoin

原神2.1直播兑换码是什么原神2.1最新直播兑换码大全

Python timeit模块原理及使用方法

冒险岛麦格勒斯BOSS打法攻略

电脑cpu温度多少度算是正常查看cpu温度的软件和方法

微信拍一拍后缀怎么设置-

C++中的throw关键字详解

易语言操作EDB数据库的方法

SKUY是什么币？SKUY币怎么样？

仙剑奇侠传6驭界枢怎么跳过去仙剑奇侠传6驭界枢跳跳乐技能介绍

Python中八种数据导入方法总结

Python中文分词工具之结巴分词用法实例总结【经典案例】

2023年最新react面试题总结大全(附详细答案)

python实现自动更换ip的方法

Python中的for循环示例详解

可爱松鼠微信头像图片

Ghost安装器怎么安装Win10-Ghost安装器下安装Win10专业版系统详细图文教程

VUE3使用JSON编辑器的详细图文教程

iphone X如何关闭后台？苹果iphone X关闭软件后台方法介绍

Uint 和 int 的区别解析

Headshot插件如何使用-Headshot插件使用教程

Filecoin(FIL)是什么币？如何挖掘Filecoin

原神2.1直播兑换码是什么 原神2.1最新直播兑换码大全

Python timeit模块原理及使用方法

冒险岛麦格勒斯BOSS打法攻略

电脑cpu温度多少度算是正常 查看cpu温度的软件和方法

微信拍一拍后缀怎么设置-

C++中的throw关键字详解

易语言操作EDB数据库的方法

SKUY是什么币？SKUY币怎么样？

仙剑奇侠传6驭界枢怎么跳过去 仙剑奇侠传6驭界枢跳跳乐技能介绍

Python中八种数据导入方法总结

原神2.1直播兑换码是什么原神2.1最新直播兑换码大全

电脑cpu温度多少度算是正常查看cpu温度的软件和方法

仙剑奇侠传6驭界枢怎么跳过去仙剑奇侠传6驭界枢跳跳乐技能介绍