《动手学深度学习PyTorch版》4
机器翻译及相关技术 1、机器翻译和数据集 机器翻译(MT):将一段文本从一种语言自动翻译为另一种语言,用神经网络解决这个问题通常称为神经机器翻译(NMT)。 主要特征:输出是单词序列而不是单个单词。 输出序列的长度可能与源序列的长度不同。 1.数据预处理 将数据集清洗、转化为神经网络的输入minbatch def preprocess_raw(text): # 处理空格 text = text.replace('\u202f', ' ').replace('\xa0', ' ') out = '' # 标点之前统一加上空格 for i, char in