0
推荐
1609
阅读

向量化与HashTrick在文本挖掘中预处理中的体现

前言在(文本挖掘的分词原理)中,我们讲到了文本挖掘的预处理的关键一步:“分词”,而在做了分词后,如果我们是做文本分类聚类,则后面关键的特征预处理步骤有向量化或向量化的特例Hash Trick,本文我们就对向量化和特例Hash Trick预处理方法做一个总结。词袋模型在讲向量化与Hash Trick之前,我们先说说词袋模型(Bag of...

发表了文章 • 2017-08-23 10:28 • 0 条评论

0
推荐
1619
阅读

文本挖掘的分词原理

前言在做文本挖掘的时候,首先要做的预处理就是分词。英文单词天然有空格隔开容易按照空格分词,但是也有时候需要把多个单词做为一个分词,比如一些名词如“New York”,需要做为一个词看待。而中文由于没有空格,分词就是一个需要专门去解决的问题了。无论是英文还是中文,分词的原理都是类似的,本文就对文本挖掘时的分...

发表了文章 • 2017-08-21 10:39 • 0 条评论