在python下word2vec词向量的详细解析-创新互联
这篇文章主要讲解了在python下word2vec词向量的详细解析,内容清晰明了,对此有兴趣的小伙伴可以学习一下,相信大家阅读完之后会有帮助。
创新互联建站是一家集网站建设,通渭企业网站建设,通渭品牌网站建设,网站定制,通渭网站建设报价,网络营销,网络优化,通渭网站推广为一体的创新建站企业,帮助传统企业提升企业形象加强企业竞争力。可充分满足这一群体相比中小企业更为丰富、高端、多元的互联网需求。同时我们时刻保持专业、时尚、前沿,时刻以成就客户成长自我,坚持不断学习、思考、沉淀、净化自己,让我们为更多的企业打造出实用型网站。项目中要对短文本进行相似度估计,word2vec是一个很火的工具。本文就word2vec的训练以及加载进行了总结。
word2vec的原理就不描述了,word2vec词向量工具是由google开发的,输入为文本文档,输出为基于这个文本文档的语料库训练得到的词向量模型。
通过该模型可以对单词的相似度进行量化分析。
word2vec的训练方法有2种,一种是通过word2vec的官方手段,在linux环境下编译并执行。
在github上下载word2vec的安装包,然后make编译。查看demo-word.sh脚本,得到word2vec的执行命令:
./word2vec -train text8 -output vectors.bin -cbow 1 -size 200 -window 8 -negative 25 -hs 0 -sample 1e-4 -threads 20 -binary 1 -iter 15
参数解释:
1)-train:需要训练的语料库,text8为语料库文件名
2)-output:输出的词向量文件,vectors.bin为输出词向量文件名,.bin后缀为二进制文件。若要以文档的形式查看词向量文件,需要将-binary参数的值由1改为0
3)-cbow:是否使用cbow模型进行训练。参数为1表示使用cbow,为0表示不使用cbow
4)-size:词向量的维数,默认为200维。
5)-window:训练过程中截取上下文的窗口大小,默认为8,即考虑一个词前8个和后8个词
6)-negative:若参数非0,表明采样随机负采样的方法,负样本子集的规模默认为25。若参数值为0,表示不使用随机负采样模型。使用随机负采样比Hierarchical Softmax模型效率更高。
7)-hs:是否采用基于Hierarchical Softmax的模型。参数为1表示使用,0表示不使用
8)-sample:语料库中的词频阈值参数,词频大于该阈值的词,越容易被采样。默认为e^-4.
9)-threads:开启的线程数目,默认为20.
10)-binary:词向量文件的输出形式。1表示输出二进制文件,0表示输出文本文件
11)-iter:训练的迭代次数。一定范围内,次数越高,训练得到的参数会更准确。默认值为15次.
./word2vec -train mytext.txt -output vectors.txt -cbow 1 -size 200 -window 5 -negative 25 -hs 0 -sample 1e-4 -threads 20 -binary 0 -iter 30
示例为训练一个名mytext.txt的文档。设置输出词向量的格式为.txt文本文档,所以还需要将-binary参数设置为0.
训练模型采用基于随机负采样的cbow模型。由于短文本字数极为有限,所以-window参数设置为5,设置词向量的维数
为200,为了使得到的参数更准确,将迭代次数增加至30.其他参数使用默认值。
训练以后得到一个txt文本,该文本的内容为:每行一个单词,单词后面是对应的词向量。
gensim加载词向量:
保存词向量模型到pkl中(注意:这里是对词向量模型进行构建)
from gensim.models import KeyedVectors if not os.path.exists(pkl_path): # 如果pickle模型不存在,则构建一个 print '词向量模型不存在,开始构建词向量模型...' Word2Vec = KeyedVectors.load_word2vec_format(vecs_path, binary=False) # 加载词向量模型 f = file(pkl_path, 'wb') pickle.dump(Word2Vec, f, True) f.close() print '词向量模型构建完毕...' f= file(pkl_path, 'rb')# 打开pkl文件 word2vec=pickle.load(f)# 载入pkl
另外有需要云服务器可以了解下创新互联scvps.cn,海内外云服务器15元起步,三天无理由+7*72小时售后在线,公司持有idc许可证,提供“云服务器、裸金属服务器、高防服务器、香港服务器、美国服务器、虚拟主机、免备案服务器”等云主机租用服务以及企业上云的综合解决方案,具有“安全稳定、简单易用、服务可用性高、性价比高”等特点与优势,专为企业上云打造定制,能够满足用户丰富、多元化的应用场景需求。
分享标题:在python下word2vec词向量的详细解析-创新互联
当前链接:http://scyanting.com/article/dcgeio.html