Pytorch学习笔记——文本预处理

isyezhongzhong 20 0 PDF 2021-01-16 07:01:05

文本预处理 1、概述 文本数据:有用内容和无用内容 文章:单词、符号、空格、乱码等 思想:我们需要对无用信息进行过滤,而计算机无法直接处理单词等有用信息,我们需要把他们转换成数字。将单词映射到不同的数字,可以考虑用列表,如data=[‘ni’, ‘hao’],我们就可以用data[0],data[1]来表示 单词内容,这就是索引到单词,然后 ‘ni hao’我们可以表示成’01’,这就是单词到索引,通过建立单词与数字的关系来进行互相的映射,这是文本预处理的核心思想 预处理的步骤: 1、读文本(计算机读取) 2、分词(过滤无用信息) 3、建立字典(建立索引到词的映射) 4、词序列转换成索引序列(

用户评论
请输入评论内容
评分:
暂无评论