17赞

python基础之停用词过滤详解

作者：手机用户2502851955 | 2021-11-02 23:13

这篇文章主要介绍了python基础之停用词过滤详解,文中有非常详细的代码示例,对正在学习python基础的小伙伴们有很好地帮助,需要的朋友可以参考下

一、什么是停用词

在汉语中，有一类没有多少意义的词语，比如组词“的”，连词“以及”、副词“甚至”，语气词“吧”，被称为停用词。一个句子去掉这些停用词，并不影响理解。所以，进行自然语言处理时，我们一般将停用词过滤掉。

而HanLP库提供了一个小巧的停用词字典，它位于Lib\site-packages\pyhanlp\static\data\dictionary目录中，名字为：stopwords.txt。该文本收录了常见的中英文无意义的词汇，每行一个词语。示例如下：

我们在进行自然语言处理时，可以用BinTrie、DoubleArrayTrie和AhoCorasickDoubleArrayTrie中的任意一个来存储词典。考虑到该词典中都是短语且比较多，用双数组字典树更划算，处理时间更快。

二、加载停用词字典

通过前文的介绍，我们知道了使用双数组字典树加载停用词字典更划算。下面，我们来加载其停用词，并返回键值对结构。代码如下：

def load_dictionary(path):
    map=JClass('java.util.TreeMap')()
    with open(path,encoding='utf-8') as src:
        for word in src:
            word=word.strip()
            map[word]=word
    return JClass('com.hankcs.hanlp.collection.trie.DoubleArrayTrie')(map)

三、删除停用词

通过上面的停用词加载，我们获取了DoubleArrayTrie树结构的词汇。如果要删除停用词，可以直接使用分词后的结果剔除停用词即可。剔除的方法如下：

def remove_stopwords(termlist,trie):
    return [term.word for term in termlist if not trie.containsKey(term.word)]

四、分词以及删除停用词

在前面的博文中，我们已经学会了如何分词，现在我们又学会了如何剔除停用词。这里，我们将两者结合起来，实现分词效果。代码如下：

if __name__ == "__main__":
    HanLP.Config.ShowTermNature=False
    trie=load_dictionary(HanLP.Config.CoreStopWordDictionaryPath)
    text="今天就这样吧！明天我们在说可以吗？"
    segment=DoubleArrayTrieSegment()
    termlist=segment.seg(text)
    print("分词结果",termlist)
    print("去掉停用词",remove_stopwords(termlist,trie))

运行之后，得到如下结果：

五、直接删除停用词（不分词）

对应上面的结果，我们先分词在删除停用词。但是，有时候我们也喜欢先删除停用词在进行分词。下面，我们来实现直接删除停用词。

代码如下：

#直接过滤方法
def direct_remove_stopwords(text,replacement,trie):
    JString=JClass('java.lang.String')
    searcher=trie.getLongestSearcher(JString(text),0)
    offset=0
    result=''
    while searcher.next():
        begin=searcher.begin
        end=begin+searcher.length
        if begin>offset:
            result+=text[offset:begin]
            result+=replacement
            offset=end
    if offset

运行之后，效果如下：

运行结果

到此这篇关于python基础之停用词过滤详解的文章就介绍到这了,更多相关python停用词过滤内容请搜索以前的文章或继续浏览下面的相关文章希望大家以后多多支持！

推荐阅读

程序员
主键是否必要？

如何解决《主键是否必要？》经验，为你挑选了0个好方法。 ... [详细]
程序员
使用`ShouldBeEquivalentTo`,`ShouldAllBeEquivalentTo`和`BeEquivalentTo`

如何解决《使用`ShouldBeEquivalentTo`,`ShouldAllBeEquivalentTo`和`BeEquivalentTo`》经验，为你挑选了1个好方法。 ... [详细]
程序员
Python请求:标头名称无效

如何解决《Python请求:标头名称无效》经验，为你挑选了1个好方法。 ... [详细]
程序员
Appinvite_styles.xml:5:错误将Google Play服务库包含在eclipse中

如何解决《Appinvite_styles.xml:5:错误将GooglePlay服务库包含在eclipse中》经验，为你挑选了0个好方法。 ... [详细]
程序员
Tensorflow教程:输入管道中的重复混洗

如何解决《Tensorflow教程:输入管道中的重复混洗》经验，为你挑选了1个好方法。 ... [详细]
程序员
g ++和clang ++ - 删除由重载转换运算符歧义获取的指针

如何解决《g++和clang++-删除由重载转换运算符歧义获取的指针》经验，为你挑选了1个好方法。 ... [详细]
程序员
django,属性更新模型实例

如何解决《django,属性更新模型实例》经验，为你挑选了0个好方法。 ... [详细]
程序员
使用JavaScript进行多项左手分配,真的是正确的关联吗？

如何解决《使用JavaScript进行多项左手分配,真的是正确的关联吗？》经验，为你挑选了2个好方法。 ... [详细]
程序员
在Rails中为link_to方法发送特定变量值

如何解决《在Rails中为link_to方法发送特定变量值》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何区分火花中的操作是转换还是动作？

如何解决《如何区分火花中的操作是转换还是动作？》经验，为你挑选了1个好方法。 ... [详细]
程序员
企业服务总线与BPM

如何解决《企业服务总线与BPM》经验，为你挑选了1个好方法。 ... [详细]
程序员
RStudio shiny runApp在工作目录中失败

如何解决《RStudioshinyrunApp在工作目录中失败》经验，为你挑选了1个好方法。 ... [详细]
程序员
AsyncStorage数据在Android设备上的物理位置在哪里？

如何解决《AsyncStorage数据在Android设备上的物理位置在哪里？》经验，为你挑选了2个好方法。 ... [详细]
程序员
Android.mk应该在哪里？

如何解决《Android.mk应该在哪里？》经验，为你挑选了0个好方法。 ... [详细]
程序员
为SSL配置SSRS

如何解决《为SSL配置SSRS》经验，为你挑选了1个好方法。 ... [详细]
程序员
查找表 - 自然或代理键作为主键？

如何解决《查找表-自然或代理键作为主键？》经验，为你挑选了1个好方法。 ... [详细]
程序员
ATMEGA168A-F_CPU警告

如何解决《ATMEGA168A-F_CPU警告》经验，为你挑选了1个好方法。 ... [详细]
程序员
使用F#在类/接口中动态定义多个成员

如何解决《使用F#在类/接口中动态定义多个成员》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何重新启动pyqt应用程序？

如何解决《如何重新启动pyqt应用程序？》经验，为你挑选了1个好方法。 ... [详细]
程序员
代码合同.net - 替代品

如何解决《代码合同.net-替代品》经验，为你挑选了1个好方法。 ... [详细]

手机用户2502851955

这个屌丝很懒，什么也没留下！

关注作者

Tags | 热门标签

RankList | 热门文章