使用GloVe(c语言版)训练自定义语料

本文转载自查看原文 2018-03-13 20:38 1998

1.准备语料

将分好词的语料保存为×××.txt

2.准备源码

下载地址：https://github.com/stanfordnlp/GloVe，解压后将语料×××.txt添加到GloVe-master文件夹下

3.修改训练语料地址

打开demo.sh文件，由于默认是下载TXT8作为语料，故将这段代码删除，并修改CORPUS=×××.txt，最终文件内容如下：

其他应该都可以自行修改。

4.执行

打开终端，进入GloVe-master文件后：

(1)make

(2)./demo.sh

5.修改词向量文件

训练后会得到vetors.txt，打开后在第一行加上vacob_size vector_size，这样才能用word2vec的load函数加载成功

vacob_size vector_size可在训练时看到：

6.加载使用巽寮的词向量

1 from gensim.models import Word2Vec  
2   
3 model = Word2Vec.load_word2vec_format(‘vectors.txt’, binary=False)

接下来的使用就和word2vec一样

本站转载的文章为个人学习借鉴使用，本站对版权不负任何法律责任。如果侵犯了您的隐私权益，请联系本站邮箱yoyou2525@163.com删除。

猜您在找 GeoIP的使用-C语言版傻瓜编程入门（C语言版）数据结构（C语言版）消息轰炸器(c语言版) 排序算法总结(C语言版) 【C语言】函数和自定义函数 c语言自定义BOOL函数 C语言中的自定义函数 C语言基础：自定义函数自定义C语言CVector