sklearn: TfidfVectorizer 中文处理及一些使用参数

本文转载自查看原文 2018-07-22 22:40 3494 python学习

TfidfVectorizer可以把原始文本转化为tf-idf的特征矩阵，从而为后续的文本相似度计算，主题模型，文本搜索排序等一系列应用奠定基础。基本应用如：

#coding=utf-8
from sklearn.feature_extraction.text import TfidfVectorizer
document = ["I have a pen.",
            "I have an apple."]
tfidf_model = TfidfVectorizer().fit(document)
sparse_result = tfidf_model.transform(document)     # 得到tf-idf矩阵，稀疏矩阵表示法
print(sparse_result)
# (0, 3)    0.814802474667
# (0, 2)    0.579738671538
# (1, 2)    0.449436416524
# (1, 1)    0.631667201738
# (1, 0)    0.631667201738
print(sparse_result.todense())                     # 转化为更直观的一般矩阵
# [[ 0.          0.          0.57973867  0.81480247]
#  [ 0.6316672   0.6316672   0.44943642  0.        ]]
print(tfidf_model.vocabulary_)                      # 词语与列的对应关系
# {'have': 2, 'pen': 3, 'an': 0, 'apple': 1}

https://blog.csdn.net/blmoistawinde/article/details/80816179

免责声明！

本站转载的文章为个人学习借鉴使用，本站对版权不负任何法律责任。如果侵犯了您的隐私权益，请联系本站邮箱yoyou2525@163.com删除。

猜您在找 sklearn: TfidfVectorizer 中文处理及一些使用参数 sklearn: CountVectorize处理及一些使用参数文本数据预处理：sklearn 中 CountVectorizer、TfidfTransformer 和 TfidfVectorizer WinForm -- CEF的使用和一些坑处理 tf idf公式及sklearn中TfidfVectorizer sklearn文本特征提取——TfidfVectorizer sklearn 下 CountVectorizer\TfidfVectorizer\TfidfTransformer 函数详解 Python中的TfidfVectorizer参数解析用python + openpyxl处理excel(07+)文档 + 一些中文处理的技巧 ssm使用@RequestBody传参数时的一些坑